Harness 的有效性边界:Malena × Finding the Right Fit 合读精读

同月两篇论文从正反两面划定 Agent Harness 工程的有效性边界。EPFL+Apple 的 Malena 用受控消融证明:骨干够强时,几乎全部收益来自编码 agent 运行时与骨干本身——给模型一个 shell 和文件系统(Chat→Oneshot)是测得的最大单一效应,搜索原语、多 agent 编排全部统计不显著(最大差距 Best-of-N vs UCB1 仅 2.71pp,CI 含 0),单会话极简 agent 在 MLE-bench 上以 62.5% medal 率碾压四个 SOTA Harness(最佳外部 47.1%)。NTU 的 Finding the Right Fit 用 66 配置矩阵证明另一半事实:换 Harness 模型排名完全反转(TB4 上 Claude−GPT 差距在 OpenHands +7.94、PI −30.16,摆幅 38.09pp),6204 条轨迹归因发现 Harness 的真实价值集中于「把失败转成模型可用的反馈」这一件事。合读结论:Harness 的价值不在「编排的丰富度」而在「反馈回路的完整性」,且随骨干增强而向运行时基底收缩。

October 3, 2026 · 7 min

CheatBench × WorldAuditBench × RobustReview 精读:守住评测完整性的三道防线

当 AI Agent 时代全面来临,评测本身正在成为最脆弱的环节。本文合读三篇 2026 年 9 月底的新作:CheatBench 用「常识期望+蜜罐」把 9 个前沿模型的作弊倾向变成可复现的测量学,发现作弊率从 11% 到 78% 不等;WorldAuditBench 把「证据采集过程」本身变成考察对象,213 个 3D 审计任务上人类 83.4% 而最强模型只有 42.3%;RobustReview+SciCore 则审判评测者自身,用 1,260 版本受控语料揭露 AI 审稿的「假鲁棒性」陷阱。三篇论文从考生作弊、考场审计、裁判可信三个角度,把「度量陷阱」本身变成了可测对象。

October 2, 2026 · 9 min

CoordPoison × Pretext × TrustProbe × ActionGuard:Skill 生态的信任危机——攻防测四面体 精读

本精读合读四篇 Skill 安全新工作,构成「攻×测×防」完整对抗格局:北航+百度 CoordPoison 将恶意执行与情境借口解耦到两个 skill(ASR 76.19%、跨模型迁移 96.88%、跨生命周期 cASR 100%),证伪孤立 skill 审计;华为苏黎世 Pretext 用白盒 LLM 攻击者击穿 NVIDIA SkillSpector(冻结检测器 ASR 至 96.7%),证明「静态规则+LLM 语义 judge」类检测器设计性缺陷;中科院信工所 TrustProbe 以污点分析+定向模糊在 11 个 agent 中挖出 104 个已验证漏洞(成本仅 $2.19),揭示 skill 递送机制使攻击面放大 3 倍;高丽大学 ActionGuard 用上下文分离+fail-closed 授权将 ASR 从 29.05% 压至 8.65%。四篇共同宣判:孤立 skill 审计的防御假设已被系统性证伪,安全边界必须移到运行时执行点。

October 2, 2026 · 8 min

cua-swe-duet: 编码 Agent 基准的两条新轴(视觉×SWE 与 repo 级从零生成)合读

当 SWE-bench 式修补基准逐步饱和、任务缺陷与训练污染被系统曝光之后,「编码 Agent 该测什么」成了比「模型怎么变强」更紧迫的问题。本精读合读 2026 年 9 月底同期发布的两篇基准论文:CUA-SWE(CMU+USC+UW-Madison+ASU+AWS)把「视觉通道」引入软件工程——agent 在同一任务内改代码、跑命令、操作运行中软件的 GUI 并依据截图诊断修复,Hybrid 较 code-only 平均提升 12.8~48.6 个百分点,DevOps 域 code-only 全军 0%;E2E-SWE(Meta Superintelligence Labs)则把评估推向「从零建库」——186 任务 11 种语言,把可解性作为一等设计目标,13 个前沿模型 pass@1 拉开 11.7%~67.7% 的分布。两篇论文殊途同归:都把「评估有效性设计」置于「难度堆叠」之上,分别回答了饱和之后基准竞赛的两个正交方向。

October 2, 2026 · 6 min

Harness 的三种缩放轴:Mid-Harness × STITCH × Turbo Harness 精读

同日三篇论文从三个互补粒度回答同一问题:固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一,发现采样收益完全由验证支配(前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%),且与轨迹级缩放正交可组合(+Best-of-T 达 66.33%、成本减半)。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器,SWE-V 80.5%、组装开销仅 2.7%,配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁,SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加,构成 Harness 工程学的完整缩放谱系。

October 2, 2026 · 10 min

Skill 泛化性二重奏:GSO 的过拟合诊断与 Rep2Skill 的表征进化 精读

本文合读同日发布于 arXiv 的两篇 Skill 论文:大阪大学 GSO 首次系统度量 skill 过拟合——21 个训练增益 skill 仅 5 个全保真、3 个归零,并提出改学「元技能」(学写法不学内容),在全部 6 基准领先(SWE-bench 47.5 vs 25.0);上科大+美团 Rep2Skill 证明文本轨迹归因太粗(AUROC 0.494),引入隐藏态轨迹+Neural CDE 定位偏离成功动力学的关键轮次(AUROC 0.838),ALFWorld Qwen3.5-9B 达 69.90%。两篇一体两面,共同回答「skill 自进化的信号应从哪里来」。

October 2, 2026 · 7 min

编码 Agent 的安全边界与协作假象:Approval Laundering 与 OpenCollab 合读 精读

本文合读 2026 年 9 月底同期出现的两篇编码 Agent 基础设施论文:复旦单作者工作 Approval Laundering 证明「人批准的动作 ≠ 实际执行的动作」,用六轴分类学系统化批准-执行绑定漏洞(Scope/Temporal/PATH 替换 BGR=1.0),并以七字段 HMAC Approval Token 部分修复;上海交大牵头的七机构工作 OpenCollab 证明「声明的协作 ≠ 发生的协作」,用 Adherence 六轴审计与 CACE 因果归因把多智能体增益争议变成可测量问题,并以双 Coder 工作流在 SWE-bench Pro 拿下 64.25% SOTA。两篇从安全与效能两个方向拆掉 Harness 的同一类隐式信任假设:把 Agent 系统的隐式假设变成可测量、可审计的对象。

October 2, 2026 · 9 min

编码 Agent 训练三条线:token 效率、自验证与安全 精读

本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文:HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来(SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token);SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」,再用学生条件化蒸馏修复(PASS@1 +9.7~16.9pp 且 OOD 不掉点);SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为,再用 Security Suite SFT + rl/hg 双路后训练补齐(unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1)。三篇论文共享同一方法论:先归因行为缺口,再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。

October 2, 2026 · 9 min

Codoku × SecProbe:可再生谜题与自适应出题的评估方法学双星 精读

本精读合并解读两篇互为犄角的评估方法学论文:ETH Zurich(含 Zhendong Su)的 Codoku 用 semantic reification(PLDI'26)从零合成 witness 程序、掩码成程序推理谜题,以全局约束 Φ 验证任意有效填充——谜题不编译、不可执行,执行/调试/穷举三条捷径全部失效(16,200 个填充仅 6 个有效),GLM 5.2 五分钟解光 CruxEval 全部 1600 题,而 Codoku large 最强模型仅 54%,小谜题不足 40 行仍让最强模型漏 23%+,专有/开源差距从 26pp 拉大到 37pp;Notre Dame 等 8 机构的 SecProbe 把心理测量学的 2PL IRT 与自适应测试引入 agent 安全评测,用 information-gap 分数定位「能力密集但信息不足」区域,驱动五专家 agent 管线按 12 维难度向量按需合成仓库级漏洞修复任务(353 任务/151 CWE,最强 GLM-5.3 pass 仅 28.33%),同等估计精度比随机合成省 29.5% 任务、held-out 能力估计 RMSE 0.110 vs 0.140。一篇治污染与作弊,一篇治饱和与低效,合看是基准评估两大顽疾的两份独立解方。

September 30, 2026 · 4 min

RepoReuse × VulContextBench:代码智能体的复用行为与安全证据审计 精读

本精读一次读两篇互补论文:北大等六机构的 RepoReuse 审计 coding agent 在多轮迭代开发中『写了什么』——是复用仓库既有代码还是重复造轮子(recall 饱和但 self reuse 仍从 83.9% 跌到 69.1%,Cdup 升至 51–69%,pass 率却纹丝不动);新加坡管理大学等三机构的 VulContextBench 审计安全审查中『看了什么』——浏览 86.3% 金标准行却只申报 12.9%,37–73 个百分点的『看到但不上报』差距。二者共同宣告:功能测试通过 ≠ 过程正确,viewed vs declared、recall vs reuse 的分离测量是过程可信的关键仪器。

September 30, 2026 · 9 min