AsymSpec: Context-Asymmetric Speculative Decoding for Agentic LLMs 精读

Agent 流水线的推理成本随上下文累积而飙升,压缩输入省钱却伤精度,而投机解码(SD)受制于「drafter 与 verifier 必须读同一份上下文」的对称性约束,无法破解这个两难。华为与中国科大的 AsymSpec 打破对称:小 drafter 读全文、大 verifier 只读压缩视图,通过同模型跨上下文的对比 δ-fusion 把被压缩丢弃的信息在 logit 空间回注,再用免调参的 JSD 散度门保持接受率稳定。结果:以 0.23 倍计算拿到 LongBench 59.7 F1(恢复压缩损失差距的 72%)、1.45 倍吞吐;恢复量随压缩严重度单调增长,近无损压缩处自动失活;还能让读原图的视觉 drafter 操纵只读文字的 verifier。

August 27, 2026 · 5 min

Automata from Agent Traces: Failure and Next-Step Prediction 精读

深度精读 Holistic AI、PUC-Rio 与 UCL 合作的 Agent 轨迹自动机研究(ICML 2026 AIWILD workshop)——把整条语料库的 LLM Agent 执行轨迹坍缩成一台 7-43 个状态的紧凑有限状态机(FSM),无超参数、毫秒级构建。这台 FSM 同时充当四件任务的统一结构基底:工作流记忆(8/8 数据集胜过 Agent Workflow Memory)、下一步预测(交叉熵降 21%)、失败预测(held-out AUROC 最高 0.94)、运行时监控(32% 完成度即触发早停)。本文拆解其’前缀树+最后活动右同余合并’构造、紧凑性为何是全部下游收益的根源,以及’拓扑由 harness 而非模型决定’的核心发现。

August 27, 2026 · 4 min

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment(Station v2)精读

Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。

August 27, 2026 · 3 min

AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion 精读

深度精读 Tulane 大学与武汉大学的 OOXML 供应链安全论文——首个规范驱动、跨 Word/Excel/PPT 三格式的「模型所见证据 vs Office 画布所见内容」分歧系统测量。论文从 15,884 条 schema 记录 + 5,206 段规范文本中挖出 639 个候选、确认 21 个 evidence forks(六维分类),用 210 份真实财报文档 × 4 API × 7 网页聊天机器人测试传播:四 API 陷阱返回率 48-76%,20/21 机制至少被一个接口吐出。关键发现:暴露由摄取路径与抽取器配置决定而非模型——同厂 API 与网页端行为不同、三个 Claude 模型走同一 skill 暴露完全一致。本文拆解「合法规范构造里埋只被机器看见的陷阱」的完整机制链。

August 27, 2026 · 5 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks 精读

斯坦福单作者实证研究:固定模型、系统性变化任务描述本身,量化 prompt 信息量对编码 agent token 开销的影响。2,700 次受控运行显示——把完整规格砍到裸 user story 使成本 +29.7%、轮数 +16.4%(五个任务全部同向);prompt 只动均值不动方差(重复运行几何标准差恒为 ×1.34);输出 token 仅占 2.7% 却占 51.1% 花费;单次 $0.11 探测可把未知任务成本预测误差从 161% 降到 36%。「具体性而非要求的存在」才是省轮数关键。

August 27, 2026 · 3 min

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems 精读

复旦大学(华山医院+类脑智能研究院)联合上海交大、上海科学智能研究院的多智能体实证研究(Nature 子刊风格):把 MAS 推理分解为「候选生成→同行通信→终端选择」的演化管线,发现核心瓶颈是「生成-保留鸿沟」——正确答案常已在候选中却被多数偏置级联丢弃(差距 13-14pp)。15,336 题离线排序基准证明裁判可靠性随正确答案可用率 sigmoid 上升(半升中点 14.7%);81,390 个冻结候选池重放显示,频率+排序混合选择规则把准确率从 63.82% 提到 70.82-70.95%。

August 27, 2026 · 3 min

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval 精读

深度精读吉林大学 + 蚂蚁集团论文:把大规模技能库的图检索形式化为「预算约束的边置信度校准问题」——多信号诱导高召回候选图后,用移除/替换/逆序三个反事实探针验证每条边是否真为操作依赖,Beta 平滑聚合后按状态门控发布。6 个骨干 × 2 基准的全部 12 个组合全部第一,ScienceWorld 宏平均 72.62→80.50,步数全线下降。

August 27, 2026 · 2 min