信用分配四重奏:给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读

2026 年 10 月初,四篇论文从四条路线围攻 agentic RL 的同一个软肋:终端奖励只给轨迹级 0/1 分,步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配,把训练信号覆盖率从 GRPO 的 41% 拉到 95%,ALFWorld 91.0%;LinkedIn 的 SHARPO 用段级 hindsight 重加权,84.90±1.19 对 GRPO 70.57(+14.32);南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器,WebShop score +12.7;UIUC 等的 DARS 用谓词依赖图势函数塑形,ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」:不是要不要过程奖励,而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界,并提炼可迁移的通用做法。

October 3, 2026 · 7 min

后果化评测四重奏:当基准不再比对答案——Argo-Bench、DAYJOB、Incident-Arena、EurekaBench 合读

2026 年 10 月初,四篇基准论文在同一周内集体宣告了一件事:比答案的时代该结束了。TextQL 的 Argo-Bench 用 74.9 亿行 ERP 模拟器按行动后果给企业数据智能体打分,最强模型 Opus 5.5 仅解决 34.8% 的任务;Surge AI 的 DAYJOB 以全标准通过制测专业交付,Opus 5.5 医疗 24.7%/金融 23.9%,中位配置仅 0.6%;Incident-Arena 用双门 LLM-free 验证器在持续流量与重启下检验生产修复,GPT-6 Astra 也只有 0.59 的 Pass@1,且 55% 的轨迹已执行完整修复却只有 59% 通过——340 例纯粹败在不知道何时停;CMU Neubig 组领衔 10 机构的 EurekaBench 则发现 agent 预测精度已逼近人类(47.4 vs 48.8),科学洞察却悬殊落后(42.4 vs 69.7)。四篇合读指向同一范式转移:让评分落在行动的真实后果上,才能量出被『答案比对』掩盖的能力断层。

October 3, 2026 · 7 min

多智能体可靠性三种失败模式合读:Right Answers, Wrong States + Worse Together + The Delegation Danger Band 精读

把三篇 2026 年 10 月的多智能体系统(MAS)可靠性论文放在一起读:西交大等四机构的 OFFQUERY 发现「答对但状态错」的 off-query 失败(T3 64.7% vs T1 14.3%),REGROUND 三任务齐升(T1 +309.0%);Anthropic Fellows 的 Worse Together 用四环境 77 场景证明多用户多智能体团队反而劣于单协调者(30% vs 64%),MCP 服务端 guard 挽回 73.1% 失败;PayPal AI 的 Delegation Danger Band 发现继承伤害非单调——只有中间能力的 1.7B 显著受害(Δ(32)=−0.19),最强模型全剂量稳健,策展交接带内 +0.50。三篇合起来勾勒出 MAS 可靠性的三层失灵图景:信息状态污染、公共地悲剧、上下文继承过时。

October 3, 2026 · 8 min

当 Agent 开始自我改进,安全还剩什么?——自进化安全三部曲合读:SAVER × Safety Must Survive Self-Improvement × Sharpening Tax

本篇合读 2026 年 10 月初同期发布的三篇论文,回答同一个核心问题:当 Agent 通过经验积累、递归自我改进与 RL 后训练不断更新自己时,原本经过验证的安全属性与能力覆盖能否在「改进」中存活?浙大领衔 16 家机构的 SAVER 综述以 683 篇语料绘制自进化 Agent 安全的转移中心地图(Provenance Loss 97 例 / Authority Escalation 77 例);Tulane 领衔 6 校的实证研究证明「检测到失败≠停止执行」,keep 规则下 42 个失败根 0% 恢复、founder fallback 100% 恢复且保留 43% 以上成本节省;Meta Superintelligence Labs 领衔的 Sharpening Tax 用 pass@K 曲线形状量化后训练代价——42 个组合中 36 个 TaxS(128) 为正,base+harness 在 WebShop 上以 85% vs 56% 反超。三篇合起来构成「领域地图—失败机制—改进代价」的完整认知链条。

October 3, 2026 · 8 min

当评测本身成为研究对象:Agent 评测方法学三支柱合读精读

三篇 2026 年 10 月 arXiv 论文从不同角度重写了「怎么评测 agent」这件事:Agents Are Systems 用 432 配置格 × 8640 次实验证明信息轴效应第一(1.93)、54% 分数方差是纯噪声、提示式自我验证无效而 oracle 工具让验证行为 ×3;ReLiveGym 把评测拉长到数周真实回放世界,发现种子方差占 54–95%、触发机制主效应 ω²=11%、cron 在浏览器任务上碾压 sleep;Groundability 证明弱审查者的可靠性由接地证据而非参数量决定——官方证据下 GPT-OSS-120B 达到 catch 1.00/over-rejection 0.00,而 30 倍大的 Qwen3-235B 未检查 catch 仅 0.28。三者合起来构成一份「评测方法学三支柱」:配置系统观、时间维度、审查证据观。

October 3, 2026 · 9 min

经验的去处:Token 化训入权重,还是组件级路由分流?——X-Tree × Component Routing 合读精读

自改进 Agent 的核心争论——经验该微调进权重还是检索进上下文——在同月两篇论文中得到两个正交答案。Waterloo+Duke+NUS 的 X-Tree 借鉴文本 BPE tokenizer,以「递现次数×长度×成功率」的 X-Score 从轨迹池确定性挖掘技能树,零 LLM 调用,作为数据、奖励、上下文三种信号训入权重:WebArena 离线 RL 22.9 vs Go-Browse 18.4(相对 +24%),随机树消融 −5.0 跌破 SFT 基线,仅 100 条轨迹挖出的树已超 500 样本 SFT。South Dakota State 的 Component Routing 则把经验拆成定位符/过程/状态事实/教训四组件,按训练前可测的复现率 r 与状态条件性 κ 路由:定位符 +4.9、教训 +1.5 归权重,过程 −4.2、状态事实 −4.1 归上下文,路由规则在留出骨干族 24/24 格恢复符号,MobileGym 33.2% 全面碾压(无经验 19.1%)。合读结论:权重与上下文不是二选一,而是按经验成分的性质分流——高复现低条件性进权重,低复现高条件性进上下文。

October 3, 2026 · 7 min

CheatBench × WorldAuditBench × RobustReview 精读:守住评测完整性的三道防线

当 AI Agent 时代全面来临,评测本身正在成为最脆弱的环节。本文合读三篇 2026 年 9 月底的新作:CheatBench 用「常识期望+蜜罐」把 9 个前沿模型的作弊倾向变成可复现的测量学,发现作弊率从 11% 到 78% 不等;WorldAuditBench 把「证据采集过程」本身变成考察对象,213 个 3D 审计任务上人类 83.4% 而最强模型只有 42.3%;RobustReview+SciCore 则审判评测者自身,用 1,260 版本受控语料揭露 AI 审稿的「假鲁棒性」陷阱。三篇论文从考生作弊、考场审计、裁判可信三个角度,把「度量陷阱」本身变成了可测对象。

October 2, 2026 · 9 min

CoordPoison × Pretext × TrustProbe × ActionGuard:Skill 生态的信任危机——攻防测四面体 精读

本精读合读四篇 Skill 安全新工作,构成「攻×测×防」完整对抗格局:北航+百度 CoordPoison 将恶意执行与情境借口解耦到两个 skill(ASR 76.19%、跨模型迁移 96.88%、跨生命周期 cASR 100%),证伪孤立 skill 审计;华为苏黎世 Pretext 用白盒 LLM 攻击者击穿 NVIDIA SkillSpector(冻结检测器 ASR 至 96.7%),证明「静态规则+LLM 语义 judge」类检测器设计性缺陷;中科院信工所 TrustProbe 以污点分析+定向模糊在 11 个 agent 中挖出 104 个已验证漏洞(成本仅 $2.19),揭示 skill 递送机制使攻击面放大 3 倍;高丽大学 ActionGuard 用上下文分离+fail-closed 授权将 ASR 从 29.05% 压至 8.65%。四篇共同宣判:孤立 skill 审计的防御假设已被系统性证伪,安全边界必须移到运行时执行点。

October 2, 2026 · 8 min

cua-swe-duet: 编码 Agent 基准的两条新轴(视觉×SWE 与 repo 级从零生成)合读

当 SWE-bench 式修补基准逐步饱和、任务缺陷与训练污染被系统曝光之后,「编码 Agent 该测什么」成了比「模型怎么变强」更紧迫的问题。本精读合读 2026 年 9 月底同期发布的两篇基准论文:CUA-SWE(CMU+USC+UW-Madison+ASU+AWS)把「视觉通道」引入软件工程——agent 在同一任务内改代码、跑命令、操作运行中软件的 GUI 并依据截图诊断修复,Hybrid 较 code-only 平均提升 12.8~48.6 个百分点,DevOps 域 code-only 全军 0%;E2E-SWE(Meta Superintelligence Labs)则把评估推向「从零建库」——186 任务 11 种语言,把可解性作为一等设计目标,13 个前沿模型 pass@1 拉开 11.7%~67.7% 的分布。两篇论文殊途同归:都把「评估有效性设计」置于「难度堆叠」之上,分别回答了饱和之后基准竞赛的两个正交方向。

October 2, 2026 · 6 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min