信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

后果化评测四重奏:当基准不再比对答案——Argo-Bench、DAYJOB、Incident-Arena、EurekaBench 合读

2026 年 10 月初,四篇基准论文在同一周内集体宣告了一件事:比答案的时代该结束了。TextQL 的 Argo-Bench 用 74.9 亿行 ERP 模拟器按行动后果给企业数据智能体打分,最强模型 Opus 5.5 仅解决 34.8% 的任务;Surge AI 的 DAYJOB 以全标准通过制测专业交付,Opus 5.5 医疗 24.7%/金融 23.9%,中位配置仅 0.6%;Incident-Arena 用双门 LLM-free 验证器在持续流量与重启下检验生产修复,GPT-6 Astra 也只有 0.59 的 Pass@1,且 55% 的轨迹已执行完整修复却只有 59% 通过——340 例纯粹败在不知道何时停;CMU Neubig 组领衔 10 机构的 EurekaBench 则发现 agent 预测精度已逼近人类(47.4 vs 48.8),科学洞察却悬殊落后(42.4 vs 69.7)。四篇合读指向同一范式转移:让评分落在行动的真实后果上,才能量出被『答案比对』掩盖的能力断层。

October 3, 2026 · 7 min

多智能体可靠性三种失败模式合读:Right Answers, Wrong States + Worse Together + The Delegation Danger Band 精读

把三篇 2026 年 10 月的多智能体系统(MAS)可靠性论文放在一起读:西交大等四机构的 OFFQUERY 发现「答对但状态错」的 off-query 失败(T3 64.7% vs T1 14.3%),REGROUND 三任务齐升(T1 +309.0%);Anthropic Fellows 的 Worse Together 用四环境 77 场景证明多用户多智能体团队反而劣于单协调者(30% vs 64%),MCP 服务端 guard 挽回 73.1% 失败;PayPal AI 的 Delegation Danger Band 发现继承伤害非单调——只有中间能力的 1.7B 显著受害(Δ(32)=−0.19),最强模型全剂量稳健,策展交接带内 +0.50。三篇合起来勾勒出 MAS 可靠性的三层失灵图景:信息状态污染、公共地悲剧、上下文继承过时。

October 3, 2026 · 8 min

当 Agent 开始自我改进,安全还剩什么?——自进化安全三部曲合读:SAVER × Safety Must Survive Self-Improvement × Sharpening Tax

本篇合读 2026 年 10 月初同期发布的三篇论文,回答同一个核心问题:当 Agent 通过经验积累、递归自我改进与 RL 后训练不断更新自己时,原本经过验证的安全属性与能力覆盖能否在「改进」中存活?浙大领衔 16 家机构的 SAVER 综述以 683 篇语料绘制自进化 Agent 安全的转移中心地图(Provenance Loss 97 例 / Authority Escalation 77 例);Tulane 领衔 6 校的实证研究证明「检测到失败≠停止执行」,keep 规则下 42 个失败根 0% 恢复、founder fallback 100% 恢复且保留 43% 以上成本节省;Meta Superintelligence Labs 领衔的 Sharpening Tax 用 pass@K 曲线形状量化后训练代价——42 个组合中 36 个 TaxS(128) 为正,base+harness 在 WebShop 上以 85% vs 56% 反超。三篇合起来构成「领域地图—失败机制—改进代价」的完整认知链条。

October 3, 2026 · 8 min

当评测本身成为研究对象:Agent 评测方法学三支柱合读精读

三篇 2026 年 10 月 arXiv 论文从不同角度重写了「怎么评测 agent」这件事:Agents Are Systems 用 432 配置格 × 8640 次实验证明信息轴效应第一(1.93)、54% 分数方差是纯噪声、提示式自我验证无效而 oracle 工具让验证行为 ×3;ReLiveGym 把评测拉长到数周真实回放世界,发现种子方差占 54–95%、触发机制主效应 ω²=11%、cron 在浏览器任务上碾压 sleep;Groundability 证明弱审查者的可靠性由接地证据而非参数量决定——官方证据下 GPT-OSS-120B 达到 catch 1.00/over-rejection 0.00,而 30 倍大的 Qwen3-235B 未检查 catch 仅 0.28。三者合起来构成一份「评测方法学三支柱」:配置系统观、时间维度、审查证据观。

October 3, 2026 · 9 min

经验的去处:Token 化训入权重,还是组件级路由分流?——X-Tree × Component Routing 合读精读

自改进 Agent 的核心争论——经验该微调进权重还是检索进上下文——在同月两篇论文中得到两个正交答案。Waterloo+Duke+NUS 的 X-Tree 借鉴文本 BPE tokenizer,以「递现次数×长度×成功率」的 X-Score 从轨迹池确定性挖掘技能树,零 LLM 调用,作为数据、奖励、上下文三种信号训入权重:WebArena 离线 RL 22.9 vs Go-Browse 18.4(相对 +24%),随机树消融 −5.0 跌破 SFT 基线,仅 100 条轨迹挖出的树已超 500 样本 SFT。South Dakota State 的 Component Routing 则把经验拆成定位符/过程/状态事实/教训四组件,按训练前可测的复现率 r 与状态条件性 κ 路由:定位符 +4.9、教训 +1.5 归权重,过程 −4.2、状态事实 −4.1 归上下文,路由规则在留出骨干族 24/24 格恢复符号,MobileGym 33.2% 全面碾压(无经验 19.1%)。合读结论:权重与上下文不是二选一,而是按经验成分的性质分流——高复现低条件性进权重,低复现高条件性进上下文。

October 3, 2026 · 7 min

Agent 安全应当是一份运行时契约——精读《Agent Safety Should Be a Runtime Contract》

当 Agent 开始执行代码、改写文件、发送消息、操作数据库,把安全寄托在 RLHF 这类训练时对齐上,在结构上是不够的。本文精读 arXiv:2608.11274,拆解其提出的’运行时契约’范式:预防面阻止危险、证据面验证完成,并以 52 起事件、32 起虚假完成、12 个系统轨迹审计和 28560 篇论文的会议审计四条证据线汇聚论证。

August 13, 2026 · 7 min

AI4AI at Test-Time:通过脚手架实现强到弱的能力迁移

Salesforce AI Research 提出强到弱脚手架范式:让强构建者模型为固定弱目标模型构建推理时脚手架,在不更新参数的前提下,将 GPT-5.4-mini 在四个心智理论基准上的宏平均准确率从 0.49 提升至 0.91。本文从背景、定位、问题定义、解法、知识反推、通用灵感六个维度精读全文。

August 13, 2026 · 6 min

EvoX Genesis:用持久递归世界让软件自主演化

深度精读 EvoX Genesis(arXiv 2608.10450):它把’持久化’从 agent 转移到项目,用持久递归世界在 120 小时、44 美元内从空仓库长出 25 万行 Rust C 编译器,跨模型替换保持测试全通过,并把 10 万行 Fortran MESA 重写为 9 万行 Rust 获得 1.55–6.87× 加速。

August 13, 2026 · 8 min

Spark-to-Paper:将端到端论文生成做成可组合技能

深度精读 Spark-to-Paper(arXiv:2608.11924)——一个把研究论文生成做成 13 个可组合技能、预注册式实验规划、Self-Refutation Loop、6 个确定性门控、双路径可编辑图表的端到端系统。引用有效率 99.5%、图表可编辑性 96.4%、伪造检测 14%→92%、每篇 $8.1 / 3.2h / 11.9M token。

August 13, 2026 · 5 min