What Process Evaluation of Coding Agents Actually Measures: Action, Task, and Step Are Three Different Levels 精读

这篇 ICLR 2027 论文(阿里 Amap × 南京大学)用结构因果模型(SCAE)把编码 Agent 的’过程评测’拆成三个被混用的层次,并给出三个可检验的颠覆性结论:下一动作由’执行出处’(provenance,模型刚看到什么)而非代码图结构决定(top-3 0.326 vs 0.058);不确定性属于任务而非步骤(190 个步骤级因果效应 0 个通过 FDR);全轨迹 LLM judge 存在系统性 collider 偏置——judge 能看到下游步骤时,归责位置系统性后移 +0.537。‘过程分数测的是语义相关性,不是认证的因果贡献。’

August 25, 2026 · 2 min

AI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-Improvement 精读

Naver Labs、Einsia.AI 与清华大学推出 AI4AI-Bench:冻结 10 个真实研究仓库,覆盖 SFT、agentic RL、蒸馏、奖励建模、DPO、扩散 RL、遗忘、图扩散、权重平均与剪枝十族算法,测评 agent 能否改写仓库训练算法本身。agent 在单块 B300 用 4 小时改代码;提交后源码从零训练 12 小时,由冻结评估器打分,σ 坐标统一指标(0.1 为原算法,1.0 为最优)。负结果:290 格平均 0.166,最强系统 Claude Opus 5 仅 0.250;触及学习层者平均 0.226,远高于只动运行层的 0.126。

August 24, 2026 · 4 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

Co-RL 提出无标签多智能体强化学习框架:多个不共享参数的异构模型对同一道无标签题目各自采样回答,每个 agent 的奖励取决于其回答是否命中指定同伴的多数投票伪标签,从而把监督信号从『自己批改自己』换成『同伴互相批改』。理论证明自奖励是自我确认动态,正确率低于一半必然收敛到零;而跨智能体监督把正确收敛的吸引域扩大到两者正确率之和大于一。实验上文本七基准平均提升 3.0-8.6%,多模态四基准提升 2.3-7.2%,多个设置下甚至超过使用真值标签的 GRPO,也无需 LLM 裁判。

August 24, 2026 · 4 min

EnvHarness: Awakening Static Worlds for Agent Learning 精读

EnvHarness 把 agent harness 的思路搬到环境侧:不改一行底层代码,只在 reset/step 标准接口外包裹可插拔组件(Stage 改初始态、Contract 重写交互、Chain 串联环境),把静态人工环境改造成针对目标策略弱点的定制训练场,且 100% 继承原环境可信 verifier。配套 EnvRigger 自动化闭环从 rollout 诊断策略缺陷、写组件、用新鲜 rollout 验证。五个基准四领域全面超越原始环境与领域专用生成管线:held-out 最高提升 9.0 分、步数省 9.8%,并支撑 RL 共同进化。

August 24, 2026 · 3 min

FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读

FACET 由中国科学技术大学、上海人工智能实验室与复旦大学联合提出,直面从异构 agent 技能合成可验证终端任务的两大难题:多阶段生成中源信息被过早压缩、以及指令/环境/参考解/验证器四件套各自为政导致的跨工件不一致。其三阶段框架先收 71,341 个技能建场景-技能库,再以五维表示代理式重建场景以恢复跨技能依赖与中间状态,最后先构建并修复 Docker 环境,把实现容器态作为三者共享接地,并按失败溯源定向修复。最终产出 6,078 个验证任务,平均 22.77 项可执行测试居各数据集之首;仅用 1.2K 轨迹做 SFT,Qwen3.5-4B/9B/27B 在 Terminal-Bench 2.1 分别提升 7.12/8.24/6.75 分,27B 距大它约 15 倍的 397B 模型仅 1.49 分。

August 24, 2026 · 4 min

FlowEvo: Self-Evolving Agents through the Co-Evolution of Workflows and Executable Skills 精读

FlowEvo 提出一个免训练框架,让工作流与可执行技能在推理期共进化:它把验证通过的成功轨迹在线编译成带接口与回放测试的技能存入持久库,经直接执行、技能条件化生成与动态生成三路分层路由加以复用,并用对比效用机制抑制持续负迁移的技能。在 GPT-4o-mini 骨干上,FlowEvo 于 ALFWorld、HumanEval、MBPP、GSM8K、MATH-500 五个全量基准全面超越八个基线,ALFWorld 达 85.6%(超最强基线 26.4 点)且每任务 token 约为基线的三分之一,跨十种骨干模型 49/50 项对比胜出。

August 24, 2026 · 3 min

Inducing Task Models from Computer-Use Traces 精读

本文精读斯坦福与CMU合作的论文《Inducing Task Models from Computer-Use Traces》(arXiv 2608.20319)。日常电脑录屏与鼠标键盘事件流中沉淀着大量从未文档化的工作知识,论文提出TMI方法:先把低层事件接地为语义活动,再把多线程交织的活动流拆解为潜在任务,最后为每个任务调和生成配对目标层次与控制流的符号化任务模型。在真实人类工作会话上,TMI以0.974的ARI还原交织任务,步骤描述准确率74.9%远超最强基线30.3%;用任务模型生成Agent技能可使held-out准确率相对提升30%。

August 24, 2026 · 3 min

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking 精读

本文精读西湖大学、浙江大学与快手可灵团队合著的 arXiv 2608.20011。论文形式化了流匹配生成模型偏好优化中的流形漂移现象:偏好更新会把轨迹终端样本推离预训练数据流形,产生非零法向位移,这是 reward hacking 的结构性根因。理论上,最优流匹配能精确恢复数据分布,而偏好更新一旦含非零法向分量必然离流形。方法上提出 THERMODPO,用带温度的三态能量 softmax 在胜者侧加流形锚,统一了 RFT 与 FlowDPO,并对流形距离给出逐点上界。实验显示玩具基准 StrictScore 达 0.899,SD3.5-M 四指标宏平均提升 16.0%、OCR 提升 47.5%,FLUX.2 上复现同趋势。

August 24, 2026 · 4 min

MemTrapBench: Benchmarking Cognitive Traps in LLM Memory Use 精读

浙江大学联合新加坡国立大学、东北大学、Heriot-Watt 大学与腾讯提出 MemTrapBench,首次系统评测记忆诱发的认知陷阱:忠实记录且语义相关的记忆,仍可能扭曲大模型的推理与信念,使表现跌破无记忆水平。基准按植入陷阱、噪声掩埋、触发陷阱三阶段生成 1050 个多轮对话实例,覆盖认知偏差、任务边界、创伤、安全四类场景;五个主流记忆框架在 Gemini 与 Qwen 上全部落后无记忆基线逾 10 个百分点,创伤场景去陷阱对照的正确性从 66.40% 回升至 91.07%,证明退化源于陷阱语义而非上下文长度。论文进一步提出推理时提示技能 AdaptiveMem,把是否该用记忆显式化为决策前的静默校验,最高提升 14.9 个百分点且不损害常规记忆基准表现。

August 24, 2026 · 4 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

本文精读 arXiv 2608.20290《Phantom Gains: Auditing Self-Improvement Against a Measured Null》。论文指出:逐题得失(transition-level)分析已成为自我改进研究的标准证据,但一次得失是两个含噪估计之差,极易产生测量伪影。作者让一个从未训练的冻结模型走完完全相同的评估管道,实测每个统计量的噪声底,识别出七种测量失败——单次贪心解码、m=1 扩展统计量、固定 token 上限、欠功效、单训练种子、欠功效探针、只测一次的零假设——每一种在缺少对照时都会反转一个结论。受控审计表明:外部蒸馏能真正改进基模型几乎够不到的题,而三种自训练不能;自训练毁掉的题远超噪声底;其全部新增解均为锐化而非能力扩张。论文主张:逐题审计必须为每个统计量单独实测零假设。

August 24, 2026 · 5 min