AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

Beyond Scaling: Self-Evolving LLM Agents for Hardware Kernel Optimization 精读

深度精读 KOPE 论文——香港城市大学与华为联合提出的硬件内核优化自进化 Agent 框架。在公共语料极度稀缺的昇腾 NPU 场景下,KOPE 用经验图记忆保留「决策-结果」证据链,配合预算化三层上下文注入,使模型参数完全冻结的前提下通过率达 84.6%(最强基线 57.8%),token 消耗反而下降 93%。本文从内核优化领域背景、经验记忆机制、主动上下文管理、双消融实验到 RISC-V 跨硬件迁移,完整拆解「经验复用为何在语料稀缺场景碾压模型能力」的因果链。

August 27, 2026 · 5 min

Beyond the Editing Canvas: Evidence Divergence in OOXML-to-LLM Ingestion 精读

深度精读 Tulane 大学与武汉大学的 OOXML 供应链安全论文——首个规范驱动、跨 Word/Excel/PPT 三格式的「模型所见证据 vs Office 画布所见内容」分歧系统测量。论文从 15,884 条 schema 记录 + 5,206 段规范文本中挖出 639 个候选、确认 21 个 evidence forks(六维分类),用 210 份真实财报文档 × 4 API × 7 网页聊天机器人测试传播:四 API 陷阱返回率 48-76%,20/21 机制至少被一个接口吐出。关键发现:暴露由摄取路径与抽取器配置决定而非模型——同厂 API 与网页端行为不同、三个 Claude 模型走同一 skill 暴露完全一致。本文拆解「合法规范构造里埋只被机器看见的陷阱」的完整机制链。

August 27, 2026 · 5 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min

Can your AI agent be cheaper? Investigating the effects of task specifications on token spend in agentic coding tasks 精读

斯坦福单作者实证研究:固定模型、系统性变化任务描述本身,量化 prompt 信息量对编码 agent token 开销的影响。2,700 次受控运行显示——把完整规格砍到裸 user story 使成本 +29.7%、轮数 +16.4%(五个任务全部同向);prompt 只动均值不动方差(重复运行几何标准差恒为 ×1.34);输出 token 仅占 2.7% 却占 51.1% 花费;单次 $0.11 探测可把未知任务成本预测误差从 161% 降到 36%。「具体性而非要求的存在」才是省轮数关键。

August 27, 2026 · 3 min

Candidate supply and answer selection shape the value of LLM judging in multi-agent systems 精读

复旦大学(华山医院+类脑智能研究院)联合上海交大、上海科学智能研究院的多智能体实证研究(Nature 子刊风格):把 MAS 推理分解为「候选生成→同行通信→终端选择」的演化管线,发现核心瓶颈是「生成-保留鸿沟」——正确答案常已在候选中却被多数偏置级联丢弃(差距 13-14pp)。15,336 题离线排序基准证明裁判可靠性随正确答案可用率 sigmoid 上升(半升中点 14.7%);81,390 个冻结候选池重放显示,频率+排序混合选择规则把准确率从 63.82% 提到 70.82-70.95%。

August 27, 2026 · 3 min

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval 精读

深度精读吉林大学 + 蚂蚁集团论文:把大规模技能库的图检索形式化为「预算约束的边置信度校准问题」——多信号诱导高召回候选图后,用移除/替换/逆序三个反事实探针验证每条边是否真为操作依赖,Beta 平滑聚合后按状态门控发布。6 个骨干 × 2 基准的全部 12 个组合全部第一,ScienceWorld 宏平均 72.62→80.50,步数全线下降。

August 27, 2026 · 2 min

Code World Model: Coding Agent as World Brain 精读

西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。

August 27, 2026 · 3 min

CyberFactory: Scaling Cyber Security Capabilities with Instances from the Wild 精读

开源模型能否拥有专业级网络安全能力?北航联合 ELLIS、IQuest Research 与新加坡管理大学发布 CyberFactory——一个把野外真实 CVE 工件转化为可执行、可验证训练监督的统一开源框架,覆盖 PoC 生成、漏洞修补、安全问答三任务。其核心是一条’可验证差分 oracle → 技能引导轨迹合成 → SFT 内化’的流水线:差分判定器(补丁前崩溃、补丁后不崩溃)使 agent 能无人监督地 propose-verify-refine;可复用’漏洞分析技能’改变教师模型的工作流(领域引导探索覆盖率 3.78%→99.85%);训练出的 OpenAegis(Qwen3.5-397B-A17B)在 CyberGym 上 Pass@1 达 58.1%,超基座 28.5 个百分点、超 1T 参数的 Kimi K2.7,且推理时不需要技能——工作流已被内化为模型参数。

August 27, 2026 · 4 min

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness 精读

KAIST 与东京大学合作研究机器遗忘的「复活」问题:遗忘后的 LLM 经短暂微调即可恢复已删知识。论文反驳「权重移动距离决定鲁棒性」的流行假说,提出免训练预测器 FRAG——度量遗忘更新是否集中在 forget 关键权重而避开 retain 关键权重,Spearman 相关达 −0.78(全局 L2 仅 −0.36);同原理 instantiated 为剪枝方法 FRP,在三种重学习攻击下 post-attack 遗忘分数全面最优。「哪些权重动了」比「动了多远」更能解释鲁棒性。

August 27, 2026 · 3 min