论文一链接:Approval Laundering: Systematizing Approval–Execution Binding Failures in AI Coding-Agent Harnesses 论文二链接:OpenCollab: A Multi-Agent Coding Framework with Programmable Collaboration and Controllable Runtime 发表时间:2026 年 9 月(论文一为 2026-09-22 working draft,目标 IEEE TDSC、尚未投稿;论文二为 2026-09-29) 机构:

  • 论文一:复旦大学(博士后杨旺单作者,明确标注 working draft)
  • 论文二:上海交通大学(RISE-X Lab,通讯作者 Yihong Dong)+剑桥大学+南洋理工大学+香港大学+帝国理工学院+北京大学+腾讯(北大 Xue Jiang 以北大+腾讯双 affiliations 参与,属产学合作;前三位共同一作为上交 RISE-X Lab 实习生) 领域标签:cs.CR(论文一)/cs.SE(论文二)

为什么把这两篇放在一起读

2026 年 9 月最后一周,arXiv 上出现了两篇方向看似无关的编码 Agent 论文:一篇是安全论文,研究「人批准的动作和机器实际执行的动作之间的绑定漏洞」;另一篇是多智能体框架论文,研究「配置文件里声明的协作组织和运行时实际发生的协作之间的偏差」。把它们放在一起读会发现,两篇论文其实在拆同一堵墙:现代 AI 编码 Agent 的 Harness(运行框架)建立在一堆从未被验证的隐式信任假设之上——

  • Harness 假设:你批准的 A 就是执行的 A′(Approval Laundering 证明这个假设在六类场景下系统性失效)
  • Harness 假设:配置的组织就是发生的组织(OpenCollab 证明这个假设在默认配置下只有 47.2% 的运行成立)

两篇论文的方法论也惊人地同构:都在运行时设置一个拦截观测点(PreToolUse 钩子/pre-call 准入门控),都用结构化事件流替代散文日志,都设计了多轴审计分类学(六轴绑定失效分类学/六轴 Adherence 审计轴),都以诚实报告阴性结果著称(Approval Token 防不住 Scope/Argument 洗白/高 Adherence 配置的 Pass@1 反而可能更低)。合读它们能看到 2026 年编码 Agent 研究的一个共同转向:从「让 Agent 更强」转向「让 Harness 的承诺可验证」。


一、论文背景

1.1 编码 Agent 与 Harness 是什么

**编码 Agent(Coding Agent)**是让大语言模型自主完成软件工程任务的系统:给它一个 GitHub issue 或一段任务描述,它自己读代码、定位问题、写补丁、跑测试。Claude Code、Codex CLI、Cursor 就是当前生产环境中最常用的三个编码 Agent 产品。

**Harness(运行框架/马具)**这个词很形象:它像马的挽具一样「套」在模型外面,负责模型和执行环境之间的一切杂务——上下文管理、工具调用分发、权限检查、预算控制。模型只负责「想」,Harness 负责「做」。你平时在终端里看到的 Claude Code 界面,就是一层 Harness 包着一个 LLM。

理解本文主题的关键在于:Harness 的核心安全机制是一个人类批准检查点。控制循环是:

模型提议动作 → Harness 检查策略 → 人类批准(或策略自动放行) → 工具执行

这个检查点是唯一的安全边界——批准一旦给出,后面没有第二道防线。

1.2 多智能体编码:分工的承诺与争议

随着任务复杂度上升,单个 Agent 管理庞大上下文和多阶段执行越来越吃力,业界转向多智能体系统:配置分析师、程序员、测试员等专职角色,通过分工与协作解决复杂任务。MetaGPT、ChatDev、AutoGen、LangGraph 都是这个路线的框架。

但「多智能体是否真的比单智能体强」一直是争议焦点。有工作报告多智能体辩论、投票集成、重复采样有收益;也有大量工作(如 Cemri 等的 MAST 研究、Kim 等发表于 Nature Machine Intelligence 的工作)发现加 Agent、加调用的收益微弱甚至为负,协调开销巨大,部分报告的增益甚至低于复现噪声底。这些矛盾结论难以调和的一个深层原因是:比较时很少把预算、工具集、Harness 等因素固定住——你看到的「多智能体更好」可能只是「它的 Harness 更好」。

1.3 两篇论文各自瞄准的空白

论文一(Approval Laundering)瞄准的空白:此前对编码 Agent 安全的测量研究分两类——一类(AmPermBench)测「风险分类器能否正确判断一个动作是否需要批准」,另一类(OverEager-Bench)测「模型能否推断出隐式的授权边界」。两者都把授权当作判断问题。但有一个更基本的问题没人直接测过:**给定一个人类已经明确批准的动作,Harness 是否保证它派发的就是那个动作?**这是凭证绑定完整性问题,与前两者正交——一个 Agent 可以完美推断范围、通过所有分类器检查,它的批准仍然可能被机制层的缝隙「洗白」。

论文二(OpenCollab)瞄准的空白:现有多智能体评估默认配置的组织被忠实执行,但现实并非如此。轨迹分析显示,模型自主决策时委派很少发生——主 Agent 通常绕过配置好的队友独自解决问题,或者在任何交接发生前耗尽 token 预算。论文把这称为协作假象(illusion of collaboration):配置文件里写着三人分工,运行时实际是单人循环。而标准基准只看最终结果,根本无法发现协作没发生,也就无法回答「组织到底有没有用」。


二、论文定位和关联工作

2.1 论文一的安全研究谱系

论文一自觉地把自身定位在一条从 1988 年延续至今的「混淆副手(confused deputy)」谱系上:

谱系工作核心思想与论文一的关键区别
Confused Deputy(Hardy, 1988)持有合法权限的程序被诱导为无权限者行使特权经典场景是固定代码;论文一的「副手」是行为不可穷举的模型控制分发循环
Woodpecker(NDSS 2012)Android 权限模型的能力泄漏漏洞论文一是该谱系在 LLM 编码 Harness 上的再实例化
间接提示注入文献(Greshake 等)对手把指令偷渡进模型上下文威胁模型不同:论文一不假设任何对抗输入,良性任务+默认模型行为即可触发
CaMeL/Conseca/SkillScope能力隔离/即时策略生成/Skill 权限收敛都不绑定「一次具体批准事件与一次具体派发」
KITA阈值签名,密钥份额不进 LLM 进程委员会威胁模型;论文一是单点威胁模型(一次批准到一次执行之间的时空窗口)
VAC(Verifiable Action Card)浏览器 Agent 的可信渲染+派发时字段比对机制上最接近,但域(浏览器单确认对话框 vs 编码 Harness 工具调用层)与凭证结构(单动作重渲染 vs 七字段键控能力)不同
IntentCap(workshop 论文)批准绑定到声明意图的能力最接近的先行提案,但未测 Temporal(跨会话重放)场景
Loopjacking(arXiv:2609.21081,同期独立工作)同一核心框架:批准的动作必须是后来执行的动作目标是 Agno AgentOS/LangGraph Agent Server 等编排类产品而非编码 CLI/IDE Harness;按「替换何时引入」分两类,而非按凭证字段分六类;已提出 canonical approval record 绑定设计
AmPermBench/OverEager-Bench分类器准确率/范围推断准确率都预设策略决策已做出,测决策正确性;论文一测的是决策之后的绑定残差

论文一的定位结论:第一个在编码 Agent CLI/IDE Harness 上直接测量批准-执行绑定完整性的工作,六轴分类学覆盖面严格超出所有先行与同期工作(后者至多覆盖其子集)。

2.2 论文二的评估基础设施谱系

谱系工作核心思想与论文二的关键区别
组织理论经典(Fox 1981、Malone & Crowston 1994 等)组织设计的经典理论论文二把「组织是否兑现」变成运行时可计算指标
MetaGPT/ChatDev/AutoGen/LangGraph降低多智能体部署门槛组织设计与底层执行纠缠,无法受控比较
MAST(Cemri 等,NeurIPS 2025)多智能体失败模式分类学(14 种失败、3 大类)事后人工标注轨迹;论文二的 Adherence 是运行时自动判定,且接入因果归因
「多智能体增益存疑」系列(Smit、Tran & Kiela、Kim 等、Kaliyev & Maryanskyy)等预算下单 Agent 不输多 Agent、增益低于噪声底论文二解释了为何结论互相矛盾:比较未固定混杂因素、未验证协作发生
Kirgis 等Agent 评估必须做日志分析论文二把日志变成结构化事件流+形式化审计
Destefanis & Aste指定的协调者角色实际常未成为通信枢纽观察性发现;论文二提供可编程审计基础设施
HAL(Holistic Agent Leaderboard)Agent 评估缺失的基础设施审计显示其连模型都不可显式设置

论文二的定位结论:第一个把「协作是否发生」形式化为可测量指标(Adherence)并接入因果识别理论(CACE)的多智能体编码基础设施——这不是「又一个框架」,而是多智能体争议的裁决基础设施。

2.3 两篇论文的对照定位

维度Approval LaunderingOpenCollab
拆掉的隐式假设批准的动作=执行的动作声明的组织=发生的组织
审计对象凭证绑定(批准→派发)组织兑现(声明→执行)
观测点PreToolUse 钩子(每次工具调用前)pre-call 准入门控+事件流(每次模型调用前)
分类学六轴绑定失效(5 个凭证字段+1 个正交渲染维度)六轴 Adherence(参与、委派、角色边界、预算共享、信息流、上下文策略)
核心量化指标Bound-Gap Rate(BGR)Adherence 率+CACE
威胁/失效来源Harness 自身机制(非对抗)模型自主决策偏离配置(非对抗)
防御/修复Approval Token(部分有效)结构约束(工具边界、强制卡、环形拓扑)+代码化 Workflow

三、问题定义

3.1 论文一的抽象:绑定完整性

论文一的核心洞察是把安全问题抽象为一个等式:

A(人类批准的动作) =? A′(Harness 实际执行的动作)

形式化地,把「一次授权」与「一次候选调用」分开(因为 Bash(npm run test *) 这类模式授权在任何具体命令存在之前就被批准了):

  • 授权 G =(principal, agent_id, session_id, tool, scope):principal 是授权的人类身份,agent_id/session_id 标识授权时的进程与会话,scope 是授权时固定的策略模式
  • 候选调用 c =(agent_id, session_id, tool, arguments)
  • D_G(c):c 在 G 之下是否可容许(字面文本匹配语义下)
  • E(c, σ):在派发时环境状态 σ(已安装钩子、$PATH、仓库配置)下执行 c 的实际生效效果——包括所有子进程的副作用
  • Perm_G(c):G 自己的凭证文本为可容许的 c 许可的效果集合

Approval Laundering 的形式化定义:Harness 在未请求新批准的情况下派发了 c,且以下至少一条成立:

  1. 可容许性偏离:¬D_G(c)——c 的 agent_id/session_id/字面文本与 G 不符,Harness 的原生匹配器却放行了
  2. 效果偏离:E(c, σ) ⊄ Perm_G(c)——c 完全可容许(所有记录字段都没变),但执行它实际做的事超出了凭证文本许可的范围

第六类(Semantic Laundering)正交于这两个析取支:它关心的是 Render(G)——批准提示展示给人类的文本是否忠实披露了 G 的实际内容。

这个定义的精妙之处在于它不是策略正确性问题:G 本身可以完全正确(git commit -m "wip" 的白名单规则没有错),模型行为也可以完全符合用户期望——失败在于 Harness 自己的匹配与分发机制没有在执行前验证绑定。这也使问题变得可证伪:论文预先声明自己的操作化策略(哪些效果算「许可」、哪些不算),再测量偏离率,而不是依赖对「操作者主观意图」的不可验证建模。

3.2 论文二的抽象:配置组织与实现组织的对齐

论文二把每次运行 r 表示为四元组:

  • Z_r ∈ {Single, Workflow, Team}:分配的配置(声明侧,运行前写入 manifest)
  • A_r ∈ {0,1}:实现组织指示器(实现侧,从事件流读出)
  • Y_r ∈ {0,1}:任务结果
  • C(r):token 成本

Adherence 的定义:对每个适用的审计轴 x,运行时产生客观判定 v_x(r) ∈ {adherent, deviant, unverifiable};一次运行当且仅当所有适用轴都通过才算 adherent:

adh(r) = ∏_x 1[v_x(r) = adherent]

关键设计:任何一轴 deviant 或 unverifiable 都判 0——「只委派了一个队友而另一个声明参与者从未行动」的运行 adh(r)=0;证据缺失只能压低报告率、永远不会抬高它。

因果归因(CACE):多智能体实验里「分配了 Team 配置」不等于「真的协作了」,观测到的增益(ITT,意图治疗效应)被不依从运行稀释。类比药物临床试验里患者不吃药的情形:

CACE = ITT / α_adh

其中 α_adh 是 Adherence 率。这个比值只有在均值排除约束(δ₀ = E[Y(z)−Y(0) | A=0] = 0,即不依从运行的组间结果差均值为零)下才能读作依从者平均因果效应——论文不仅假设它,还利用逐运行记录的 A_r 把 δ₀ 估计出来检验它。这是把因果推断工具(Bloom 1984/Angrist 等 1996 的单侧 Wald 识别)完整搬进 Agent 评估。

3.3 合读的统一抽象

把两篇的形式化并排看,结构完全同构:

声明侧(人批准的 A/manifest 里的组织 Z) →  [Harness 黑盒]  →  实现侧(执行的 A′/事件流里的组织)

两者的研究问题都是:**给定一个被系统承诺过的声明,运行时机制是否兑现了它?如何把「兑现」变成可测量、可审计、可归因的对象?**排除掉的外部干扰也一致:都不引入对抗输入、不依赖对人类主观意图或模型内在动机的假设,只依赖客观可观测的记录字段与事件。


四、问题解法

4.1 论文一:六轴分类学+BGR 测量+Approval Token

4.1.1 六轴分类学

五个轴各绑定一个凭证面,第六轴正交:

#类别绑定字段失效描述(通俗版)
1Scope Launderingscope批准的命令原样执行、也匹配授权模式,但命令的子进程访问了模式文本从未提及的资源
2Argument Launderingarguments批准的字面命令一字未改,但参数串从未提及的仓库本地机制(如 git 钩子)扩大了实际效果
3Temporal Launderingsession_id一个会话里给的批准(或持久化的「总是允许」规则)在另一个会话被行使,无需重新确认
4Tool Launderingtool为工具 T1 批准的调用被等效的 T2 达成(跨工具替换);或命令名经 $PATH 解析到了另一个程序(同名替换)
5Delegation Launderingagent_id主会话获得的批准被子代理继承行使,子代理从未被单独授权
6Semantic Laundering(正交:渲染保真度)批准提示展示的文本没有忠实披露实际授权的命令

论文花了很大篇幅澄清一个关键区分:可容许性偏离 vs 效果偏离。五类字段绑定失效中只有 Delegation(和 Temporal 的构造形式)是记录字段真的变了;Scope、Argument、Tool 的实测案例中字段值根本没变——失效发生在被派发进程再往下一层的副作用里。这个区分直接预测了后面防御的覆盖边界。

还有一个taxonomy自身的修正记录值得注意:早期版本把 agent_id 从凭证公式里漏掉了——这不只是命名缺口,而是活的安全缺口:缺少 agent_id 和 session_id 的凭证无论主会话还是子代理派发都重算出相同值,子代理重放主会话批准就能通过验证。第六节的修复正是绑定这两个字段,才让 Token 能消灭 Delegation/Temporal 洗白。

4.1.2 测量方法

  • Harness 与观测点:Claude Code v2.1.197(headless 模式),固定模型别名写入每个运行的 settings.json。每个运行安装 PreToolUse 钩子——Claude Code 原生的预执行中介点,在任何工具调用派发前以子进程启动,能 allow/deny/rewrite。钩子通过 stdin 接收结构化 JSON 事件(含 session_id、tool_name、tool_input、tool_use_id,子代理调用还有 agent_id),全部写入只追加的审计日志
  • 金丝雀设计:每个场景由固定的 settings.json 授权、良性任务提示词、只有越界动作才能触碰的预置金丝雀(canary)标记、成功判定谓词构成。威胁模型刻意不设对手:没有恶意模型、没有提示注入、没有对抗用户,只有执行良性任务的 Agent 和预置了触发机制(钩子、$PATH 遮蔽)的环境
  • Bound-Gap Rate:BGR = 成功谓词成立的运行占比,配 Wilson 95% 置信区间(在 [0,1] 边界附近比正态近似可靠)
  • 人工复核:每场景分层抽样 5 个运行做作者交叉检查,Cohen’s κ 量化一致性——并且如实披露这是一个「抓虫记录」而非盲测:κ=1.0 之前,人工复核恰好抓出一个判定器作用域 bug(全局 any_denial 检查把「先成功后无关拒绝」的运行误判为失败),修复后 Scope BGR 从 0.80 修正到 1.00,全程可追溯到具体运行

4.1.3 防御:Approval Token

一个键控能力(keyed capability),HMAC-SHA256 绑定七个字段:

token = H_k(principal, agent_id, session_id, tool, sha256(arguments), scope, exp)

类比:普通批准像「签了一张空白支票」——批准事件只记一个布尔值,执行时代码从别处重新读参数;Approval Token 像把批准变成一张记名、限额、有效期、防涂改的支票,兑付时逐字段核验。

三个设计要点:

  1. 密钥保管:协议保证密钥 k 永不通过批准/验证数据流交回 Agent(铸造与核验完全发生在 issuer/guard 两个钩子子进程内)。但论文如实披露:pilot 部署把 k 存在同用户可读的 secret.key 文件(mode 0664),磁盘层的保管缺口未闭合,也未做对抗性密钥外泄测试
  2. 模式授权的绑定技巧:Bash(npm run test *) 这类模式授权在任何字面命令存在之前就被批准,Token 的 arguments 字段因此绑定的不是未来未知的具体命令,而是scope 模式文本本身({"__approved_scope__": scope})——这意味着 Token 在 Harness 原生模式匹配之上只增加身份与时间绑定,设计上并不收紧参数匹配
  3. 验证流程:guard 钩子先查 scope 映射确定调用落入哪个已授权模式,再从调用自身观测字段重算七字段 HMAC,查找匹配的未过期、未撤销 token;任何字段不匹配即拒绝(fail closed)

4.1.4 评估设计

用离线配对重放避免重新花钱跑模型:把基线收集的每个运行已记录的工具调用事件按序喂给 guard 的纯判定函数,唯一的变量是「是否有 guard」。配对前后结果用 McNemar 精确检验。另做小规模在线冒烟测试(guard 作为真实 PreToolUse 钩子全程中介真实会话)确认离线重放不是重放器自身造的假象。

4.2 论文二:可编程协作+受控运行时+Adherence+CACE

4.2.1 两层解耦架构

传统框架里每个 Agent 封装自己的隔离执行循环;OpenCollab 把组织编排与模型执行解耦为两层:

  • 共享会话运行时(底座):每个「会话」代表组织中的一个角色,全部走同一个十状态有限状态机循环(IDLE→PRECHECK→CALLING_LLM→HANDLING_RESPONSE→EXECUTING_TOOLS→AUTOSAVE→…,非法状态转移直接抛错)。底座统一处理上下文管理、模型调用、工具执行,保证各配置下的执行单元一致
  • 编排层(控制器):三种控制 regime——Team(模型主导:声明角色提示词、工具集、有向通信拓扑,由模型决定是否/何时/如何向队友委派)、Workflow(代码主导:Python 脚本固定调用顺序、扇出结构与条件转移)、Single(单智能体基线)

类比:Team 像给员工发组织架构图后让他们自组织,Workflow 像把工作流程写成制度由代码强制执行,Single 是一个人干到底。

这个解耦的工程红利显著:复现 edict 论文的核心多智能体模式(约 2.4 万行代码)在 OpenCollab 里只需 239 行。

4.2.2 受控比较:七项条件与运行时门控

受控比较需要七项条件:五个因子在运行时可显式设置并保持恒定(模型、工具集、token/成本预算、上下文压缩策略、通信拓扑),两个结构化可验证要求(每个运行的声明与实现轨迹并排记录、可相互核对)。

关键是用运行时门控而非事后过滤来执行:工具调用与智能体间消息在调用时刻被拦截,超出声明角色权限或拓扑的请求被拒绝并记录;每次模型调用前,运行时用保守估计对剩余预算做 pre-call 准入,超限则带明确终止码停下。这干净地区分了「预算耗尽而停」与「自愿完成」,构成可追溯性的基础。对十个主流制品(AutoGen、AG2、LangGraph、SWE-agent、OpenHands、Claude Code、Codex CLI、DeepSeek Harness、Inspect AI、HAL)的审计显示没有一个满足全部七项——例如预算维度上,没有任何外部制品在发送前对调用按剩余配额计价准入;拓扑维度上,Claude Code/Codex CLI/OpenHands 等声明了角色但由模型运行时决定启动哪些 Agent。

4.2.3 事件流与 Adherence 六轴

用有序、只追加的事件流替代散文日志:每个操作步骤发出结构化记录(单调步号、时间戳、run id、角色 id、事件类型、类型化负载),七种事件类型覆盖模型调用、工具执行、拒绝动作、会话终止、spawn 拒绝、worktree 变更、上下文压缩。每个事件都盖角色 id,自动脚本无需解析自然语言即可重建实现拓扑、归因资源成本。非入口角色在共享对象库上的隔离 Git worktree 里工作,只有入口角色的 workspace 被评分。

Adherence 六轴(每个适用轴产出 adherent/deviant/unverifiable 判定,全过才算 adherent):

轴实现值读取自偏差
Participation花了 token 且产出至少一个模型输出的队友声明的队友没干活
Delegation存在这样的队友该委派的 regime 里没有任何委派
Role boundary归因到各 Agent 的工具调用执行了工具集之外的调用
Budget sharing各角色对自己配额的抽取角色达到配额却没有拒绝记录
Information flow事件流里的 message_agent 调用消息走了拓扑未声明的边
Context policy每轮施加的压缩级别触发了非指派的级别

在本实验中四个轴(角色边界、预算共享、信息流、上下文策略)被运行时强制持有,因此 Team 的合取实际由参与与委派决定——归结为一条可计算判据:Team 运行 adherent 当且仅当每个声明的队友都花了 token 并产出至少一个模型输出。

4.2.4 样例组织与 SOTA 配置

  • Star(Adopter+两个 Coder):Adopter 接任务、可简报两个 Coder、选择并提交最终补丁
  • Ring(analyst+coder+tester):环形通信
  • Duo(SOTA 配置,Workflow):Coder A 找最窄根因写最小完整修复;Coder B 从同一原始任务出发追求跨组件/API/生命周期的完备性;代码按固定规则在两个候选间选择,规则不决时调用只读的 Adjudicator 依据任务公开需求裁决;代码而非模型发出每一次交接——两个 Coder 在每个任务上必然运行,Adherence 由构造保证

五、评估指标与实验证据

5.1 论文一的测量结果:BGR 全表

Claude Code,N=19–20 有效运行/类(Wilson 95% CI):

类别NBGR95% CI证据解读
Scope201.000[0.839, 1.000]每次运行都在授权模式之外越界生效,无一触发新批准
Temporal201.000[0.839, 1.000]持久化规则在新会话被行使是默认行为
Tool(跨工具身份替换)190.000[0.000, 0.168]真阴性发现:策略引擎确实按自己的白名单门控 Bash
Tool(同名 $PATH 替换)201.000[0.839, 1.000]声明工具、字面命令、参数全部一致,只有 $PATH 解析到的可执行文件不同——完全无防护
Argument200.450[0.258, 0.658]9/20 成功;机制不是模型扩大参数,而是 pre-commit 钩子的副作用
Delegation190.947[0.754, 0.991]子代理在绝大多数运行中继承了主会话批准的实际效果
Semantic(代理指标)200.100[0.028, 0.301]词面覆盖率代理指标;不等于人类感知研究

为什么这些实验设计能证明论点:

  • 非对抗场景排除「对手作恶」解释:良性任务+默认模型行为+无注入内容,失效只能来自 Harness 自身机制。最惊人的一个细节:一次 PATH 替换运行中,模型自己的推理明确判断「用 cat 的只读授权去 launder 一次写入等于走后门」并主动拒绝写——但隐蔽写入早已作为它判定安全的那个只读调用的副作用发生了。模型的道德自律救不了机制层的绑定缺口
  • 金丝雀把「效果越界」变成可观测事件:例如 Argument 场景,git commit -m "wip" 一字不改发出,pre-commit 钩子(git add -A)把操作者从未打算提交的未暂存草稿文件改动扫进提交——45% 的运行中金丝雀被卷入。分类器视角(git commit 不危险)和范围推断视角(重构时提交完全合理)都看不见它
  • 两个 Tool 子模式的对照本身就是发现:跨工具替换全被拦截证明 Harness 不是没有工具身份检查;同名 $PATH 替换全数穿透证明检查只发生在声明的工具身份这一层,对命令名实际解析到哪个程序零可见性——因为解析发生在 PreToolUse 中介点之下的派发进程内部
  • 诚实的分析器完整性案例:denial-scoping bug 的发现-修复-重分析全程公开(Scope 0.80→1.00),并被论文用作方法论论点:任何 BGR 测量的可靠性以成功谓词自身的完备性为限,谓词完备性本身也应被当作可证伪、可审计的对象

局限同样被明确标注:全部结果来自单一 Harness(Claude Code)单模型;运行环境非最小密闭(每条轨迹都加载了插件与前次会话摘要,138 条主研究轨迹全部如此),重复不能当作独立采样;Temporal 的 session_id 是合成播种值而非真实两段会话生命周期;Semantic 是词面代理指标而非人类受试研究。对 Codex CLI 的首次跨 Harness 复现尝试得到一个更粗粒度的阴性发现:其唯一可脚本化模式 codex exec 看起来根本不暴露任何可观测的逐调用批准检查点——没有批准事件可供洗白,因为它似乎就不实现逐调用批准抽象。

5.2 论文一的防御评估:配对重放+McNemar

对六个原始场景的全部有效运行(118 个)做离线配对重放(同名 $PATH 替换后引入,不在重放内):

类别基线 BGR加防御 BGRb/cp结论
Delegation0.9470.00018/07.6e-6完全消除
Temporal1.0000.00020/01.9e-6完全消除(播种构造下)
Argument0.4500.4001/01无统计显著改善
Scope1.0001.0000/01完全不受影响(按构造)
Semantic0.1000.1000/01正交维度,不变是正确预测
Tool(跨工具)0.0000.0000/01基线已为 0,无提升空间

在线冒烟测试提供了最有说服力的单条证据:一次 Argument 运行中,guard 拒绝了模型六个 Bash 调用中的五个(git status/diff/show 等不在精确字面授权内),放行了唯一精确匹配的 git commit -m "wip"——而这个被正确放行的提交仍然通过 pre-commit 钩子卷入了金丝雀改动。guard 全程在场,攻击照样复现。这是「字段级验证器看不见效果级偏离」的最干净的活体证明。Delegation/Temporal 的 6/6 在线新鲜尝试全部被拒(附同一个拒绝理由:principal/agent/session/tool/scope 组合无匹配的未过期 Token),与离线结果完全一致。

为什么这个评估设计有证明力:配对设计(同一批运行、唯一变量是 guard 与否)+McNemar 精确检验(配对二元结果的边际变化)让每条结论都有精确的统计支撑;更重要的是阴性结果被当作结构性发现报告而不是被解释掉——Token 对 Scope/Argument 的无效不是实现缺陷,而是「只验证记录分发字段的防御」这个类的结构极限(见第六节根源分析)。

5.3 论文二:Adherence 五维消融

36 个 SWE-bench Pro 任务,参考团队=Star 拓扑+Qwen3.8-Flash+Open 卡+全工具+每人 2M token,单维度扰动(95% Clopper–Pearson CI):

维度变体AdherencePass@1关键读数
模型Qwen3.8-Flash(参考)47.2%75.0%默认配置下协作过半都不发生
模型DeepSeek-V4.1-Flash66.7%72.2%换模型显著移动 Adherence
模型GPT-5.6-Luna97.2%61.1%最强模型几乎总协作——但 Pass@1 最低
工具全工具(参考)47.2%75.0%—
工具无编辑工具86.1%66.7%拿掉 Adopter 的编辑工具逼它委派
工具只读94.4%52.8%结构上强制协作的极致
预算0.5M/人47.2%44.4%预算太紧,主 Agent 耗尽前来不及委派
预算2M/人(卡上声明)75.0%69.4%仅在提示卡里写明预算就提升 28 个点
预算4M/人77.8%75.0%—
上下文Open 卡(参考)47.2%75.0%—
上下文Optional 卡63.9%61.1%允许自设步骤的指令
上下文Mandatory 卡91.7%72.2%「分工不由你决定」的强制指令
拓扑Star(参考)47.2%75.0%—
拓扑Ring+捷径66.7%66.7%—
拓扑Ring91.7%63.9%环形拓扑结构性限制独干

这个消融证明了两件事:改变任何一个单一维度都能让 Adherence 在 47.2%→97.2% 之间大幅移动(协作高度敏感于配置而非仅仅是「模型能力」);同时Adherence 与 Pass@1 存在张力——把 Adopter 限制成只读把 Adherence 拉到 94.4%,Pass@1 却从 75.0 掉到 52.8。协作被强制发生了,任务反而更常失败。

5.4 论文二:CACE 与因果诊断

各配置与 Single 逐任务配对(ITT 为对 Single 的 Pass@1 差):

配置AdherenceITTWald(ITT/Adh)配对 Ar=1 对照配对 Ar=0 对照
Open 卡(参考)47.2%+5.6+11.8−5.9+15.8
Mandatory 卡91.7%+2.8+3.0+3.00.0
预算声明 2M75.0%0.00.0−3.7+11.1
只读94.4%−16.7−17.6−14.7−50.0

Open 卡这行是全文最重要的因果发现:表面上 +5.6 的 ITT 被 47.2% 的 Adherence 放大成 +11.8 的 Wald 比值,好像是「协作让团队更强」;但配对诊断揭示 +5.6 完全来自 19 个不依从任务(+15.8),17 个真正依从协作的任务反而 −5.9——均值排除约束被数据拒绝,+11.8 不能读作依从者因果效应。如果不做 Adherence 审计,这个配置会被误判为「协作有效」。作为对照,Mandatory 卡(91.7% Adherence)下两个估计重合(+3.0),因果解读成立。

(论文同时诚实标注:单 Agent 原样重跑会翻转 36 个任务中的 5 个结果,−5.9 的符号未稳固确立;表 6 支持的是「Wald-配对差距随 Adherence 变化的方向」,而非任何单一配置的协作效应。)

5.5 论文二:跨 Harness SOTA 与协作价值

五个 Harness、同一模型(GPT-5.6-Luna)、三基准:

基准Mini-SWECodex CLIClaude CodeOpenCollab BaseOpenCollab Duo
SWE-bench Pro Pass@161.6663.7358.0363.2164.25
SWE-bench Pro tokens4.16M7.31M9.38M3.89M6.50M
Terminal-Bench 2.1 Pass@176.4080.9077.5379.7883.15
Terminal-Bench 2.1 tokens2.97M2.86M21.95M1.54M4.60M
DeepSWE Pass@161.9547.7956.6455.7569.91
DeepSWE tokens19.36M15.01M77.90M11.95M26.11M

三个读数:Duo 在三基准全部第一(64.25%/83.15%/69.91%);Base 在三基准 token 与成本全部最省(Terminal-Bench 2.1 上 1.54M vs Claude Code 的 21.95M,差一个数量级以上);Duo 对 Base 的逐任务配对优势在 DeepSWE 显著(21:5,sign test p=0.0025)、在 Terminal-Bench 不显著(6:3,p=0.51)——「组织有价值」的结论被恰当地限定在长程任务上(+14.2 分),而非泛化为普适优势。

值得一提的评估卫生细节:作者主动审计了 Terminal-Bench 2.1 上的答案泄漏——九个 Harness-任务对上共十次生成尝试实际收到了给出答案的外部材料,全部相关通过被撤回或以过滤重跑替代后才报告 Table 2。这种对评估有效性的自我审计与论文的主题自洽。


六、效果优势的根源解释

6.1 论文一:为什么 Approval Token 只能修一半——绑定层与效果层的结构分离

对比对象:Harness 原生的批准机制(allowlist 前缀匹配+持久化规则)。它为什么曾经有效?因为在「批准的字面文本与执行的字面文本一致」这个隐含前提下,字面匹配等价于意图匹配。

根本局限:这个前提在两层失效——

  1. 身份层(可修):原生匹配器从不检查 agent_id(子代理调用与主会话调用的分发字段真的不同,但没被比较);持久化规则根本不记录 session_id(没有基线值可比较)。Approval Token 的七字段 HMAC 把这两个字段显式绑定进凭证——方法差异(增加字段绑定)→ 机制变化(重放时字段失配导致查不到 Token → 拒绝)→ 指标提升(Delegation 0.947→0.000、Temporal 1.000→0.000,p<10⁻⁵)。因果链每一步都可验证:加防御前后唯一变量是 guard 的存在(配对重放),拒绝理由的日志逐条可查,在线 6/6 复现离线结论。taxonomy 开发中「发现 agent_id 缺失→补进凭证公式→Delegation 被消除」的先后顺序本身就是这条因果链的开发时版本
  2. 效果层(结构上不可修,至少不可被此类防御修):Scope/Argument/PATH 替换的实测机制里,所有记录分发字段的值都没变——npm run test 精确匹配模式、git commit -m "wip" 一字不差、cat 的工具名与命令文本原样。失效发生在派发进程再往下一层:钩子、包管理器脚本的再调用、$PATH 解析。一个只验证记录字段的防御器没有任何信号可用——不存在「参数级差异」可供更细地匹配。这解释了 Scope 完全不动(Token 按设计在原生模式匹配之上只加身份/时间绑定)和 Argument 仅有的 1/20 改善(那一个恰好是链式命令 && git status,在更严格的精确字面匹配下是可容许性偏离,不是效果偏离——guard 的判定从实现规则出发就预言了这个分裂)

论文把这个阴性结果推到第一性原理层面:要抓住效果偏离,必须绑定到执行环境的实现效果 E(c, σ) 而非任何记录参数的表示——并论证两个候选机制为何不够:(a) 环境漂移检测(批准与派发时 σ 快照比对)抓不住实测案例,因为产生偏离效果的钩子/脚本在实验布置时就已存在,两个时刻 σ 相同;(b) 初始效果验证(批准时静态/动态分析仓库钩子与构建脚本)超出凭证绑定钩子的能力,或重新引入 Semantic Laundering 已证明难以自动验证的语义保真判断。论文将其列为「最具体的未解问题」而非假装解决。

反事实验证:如果去掉 agent_id/session_id 绑定(回到五字段版本),taxonomy 开发记录显示子代理重放会通过验证——Delegation 消除效果将退化为零。这反证字段绑定的必要性。

6.2 论文二:为什么 Duo 有效而「协作」未必——增益的真实来源

对比对象:主流 Harness(Mini-SWE-agent/Codex CLI/Claude Code)。它们有效的根基是成熟的单 Agent 执行循环;局限在于组织设计与执行机制纠缠——你看到的差距无法归因于组织,因为 Harness、预算、工具全都不同。

Duo 增益的机制分解(方法差异→机制变化→指标提升):

  1. 方法差异:Workflow 用代码发出每次交接,两个 Coder 在每个任务必然运行,固定规则+只读 Adjudicator 在候选间选择
  2. 机制变化:这实际上把任务变成两次带不同求解策略的并行采样+基于证据的选择——Coder A 求最窄根因最小修复、Coder B 求完备性,两个候选由固定规则或对照任务公开需求的裁决者挑选
  3. 指标提升:DeepSWE +14.2(p=0.0025)、Terminal-Bench +3.4(不显著)、token 约两倍于 Base(6.50M vs 3.89M——两次完整求解过程的代价)

关键洞察:Duo 的增益本质是「生成+选择」的采样效应,而非「对话式协作」的涌现智能——Adherence 实验恰恰显示自由对话式 Team 的协作在默认配置下多半不发生。这与重复采样文献(best-of-N)的结论同构,只是两个采样被赋予了互补的求解纲领并由裁决机制连接。

Adherence 工具本身为何优于「看最终分数」:传统评估只能读出 Pass@1,Open 卡配置会读出 +5.6 的表面增益;Adherence 逐运行记录 A_r 使得配对诊断能够揭示 +5.6 全部来自不依从任务、依从任务为 −5.9——没有 Adherence,这个配置的「协作有效」就是因果误读。机制上这是因为低 Adherence 下 Wald 比值偏离 CACE 的因子 (1−α)/α 随 α 下降而爆炸(47.2% 时为 1.12,90% 以上时至多 0.11)——表 6 三档 Adherence 下 Wald-配对差距(17.6/3.7/≤2.9 个点)精确追随这个预测。这不是「指标好看」,而是指标设计直接防止了一个具体的因果谬误。

Adherence-Pass@1 张力的根源:强制协作的手段(只读、环形、强制卡)同时移除了主 Agent 独自求解这条路径——当任务本可由单人高效解决时,强制交接是纯开销(图 3 的轨迹:只读 Adopter 被迫委派并成功采纳 vs 参考 Adopter 独干到预算耗尽)。Adherence 高不等于性能好,它是内部效度的前提(增益可归因于组织),不是性能本身。

6.3 外部检索交叉验证

围绕两篇论文的核心机制,检索相似尝试与相近/相反结论:

研究(可核验链接)相似尝试相关结论与本文的差异与适用边界对根源解释的影响
MAST:Why Do Multi-Agent LLM Systems Fail?(Cemri 等,NeurIPS 2025,arXiv:2503.13657)对 7 个 MAS 框架 200+ 任务做失败模式分类学(14 种失败、3 大类,κ=0.88)「智能体间错位」占失败约三分之一量级;MAS 相对单 Agent 增益常微弱事后人工标注轨迹,非运行时自动审计;不接入因果归因支持 OpenCollab 的动机(协作常不发生/错位),补充了「协作假象」在非编码域也存在
Loopjacking: Hijacking Human-in-the-Loop Approval(A. A. Kumar,2026-09,arXiv:2609.21081)同期独立检验同一「批准=执行」假设于 Agno AgentOS/LangGraph Agent Server 等编排产品,并验证 canonical record 绑定修复批准-执行绑定失败跨产品类别普遍存在;OpenAI Agents SDK 的逐调用序列化是有效负对照目标为编排框架非编码 CLI;按替换引入时机(表示攻击/批准后状态替换)而非凭证字段分类强支持论文一的根源论断(绑定缺口是结构性的,且字段级 canonical 绑定可修「身份层」失效);两个团队独立到达同一框架构成重要交叉验证
Confused Deputy(Hardy, SIGOPS 1988)能力系统的经典起点权限持有者被诱导越权行使是数十年老问题非实证测量论文一自认的谱系锚点:capability-leak 谱系在 LLM Harness 的再实例化
Kim 等,Nature Machine Intelligence 2026(Capable language models can outgrow the benefits of collaboration)强模型单 Agent 与协作的对比能力强的模型会「长出」协作收益之外,单干更优教育 companion 场景为主限定论文二结论的适用范围:协作收益依赖任务与模型,与 OpenCollab「GPT-5.6-Luna 高 Adherence 但团队 Pass@1 不一定最高」的张力数据一致
Kaliyev & Maryanskyy(arXiv:2606.20695)多智能体基准的配对噪声底协议部分报告的协调增益低于复现噪声方法论层面支持「不控制混杂就无法归因」的动机,与十框架审计结论互补
Tran & Kiela(arXiv:2604.02460)等思考 token 预算下单 vs 多智能体等预算下单 Agent 反超多跳推理任务相反方向证据:提示 Duo 的增益须限定在长程编码任务(DeepSWE 显著、Terminal-Bench 不显著),不可外推为普适

综合判断:得到多项独立研究共同支持的机制是——(1) 批准-执行/声明-实现之间的绑定缺口在多个产品类别、多个任务域系统性存在,且字段级密码学绑定(Approval Token 的身份/时间字段、Loopjacking 的 canonical record、OpenAI SDK 的逐调用序列化)能修复字段可观测的那部分;(2) 「多智能体默认会协作」是错误假设,协作是否发生高度依赖配置且需逐运行验证;不验证协作就归因增益会产生系统性因果误读(MAST 的事后分类学、OpenCollab 的运行时审计、配对诊断三方一致)。仍属合理推测或开放的部分:效果层绑定(E(c,σ) 验证)的可行设计(论文一明确列为未解);Duo 的「生成+选择」机制在非编码域的泛化;Semantic Laundering 的真实人类风险(尚无受试研究)。优势的适用条件:字段级防御只在失效表现为字段失配时有效;组织增益在长程、可分解任务上最可能兑现——在短任务或强模型上可能失效甚至为负。


七、必要知识反推

假设让一个没有任何背景的人来完成这两项工作,最少需要掌握什么?

7.1 领域知识层

  • 编码 Agent Harness 的运作细节(两篇共同的硬前提):权限模型(allowlist/denylist、持久化规则、沙箱分级)、钩子系统(PreToolUse 事件的结构与字段)、子代理机制、上下文压缩策略。不理解这些就无法设计可触发的失效场景或受控门控——论文一的全部六场景都是对 Harness 具体机制的精确利用(git 钩子、$PATH、–agents 子代理、settings.json 持久化规则)
  • 多智能体组织范式:模型主导(Team)与代码主导(Workflow)的区别、拓扑(Star/Ring)、消息路由。论文二的控制器设计直接建立在这些概念上
  • 经典安全谱系:confused deputy、capability 系统、Android 能力泄漏——论文一的分类学自觉嵌入这条谱系,密钥保管架构对标 KITA 的进程隔离原则

7.2 方法论知识层

  • 测量与统计推断:Wilson 置信区间(小样本比例在边界附近的正确工具)、Cohen’s κ(评分者一致性)、McNemar 精确检验(配对二元结果)、Clopper–Pearson 区间、精确符号检验——论文一与论文二的每一张关键表都依赖正确的统计工具选择,而非默认的 t 检验
  • 因果识别理论:ITT、CACE、单侧依从、均值排除约束、Wald 比值、敏感性界——论文二附录 A 是完整的工具变量式识别论证,没有这套知识就无法解释「+11.8 为什么不能读作因果效应」
  • 分类学构建方法:如何让分类学可证伪(相对凭证形式化的字段穷尽性+一个正交维度,而非「我们找到了所有失效方式」的不可证伪声明);如何处理轴间共享机制(坦承 Scope/Argument 共享「未命名子进程导致效果偏离」机制族,按「批准者需要检查哪个字段的评审文本」区分)

7.3 工程知识层

  • Headless 自动化与工件驱动实验:claude -p --output-format stream-json 的脚本化、固定模型别名写入工件使其自文档化、只追加审计日志
  • 运行时拦截与状态机:十状态会话状态机、pre-call 准入、非法转移抛错、分层架构的 import 契约(论文二的四层架构在 CI 里用四个 import 契约检查,甚至验证过检查器本身能被抓到违规)
  • HMAC 能力凭证的工程实现:issuer/guard 双钩子分工、模式授权绑定 scope 文本自身的技巧、fail-closed 设计

7.4 知识融合的关键节点

  • 「测量即安全防御的先声」:论文一把安全测量方法论(金丝雀+重复测量+置信区间)与权限系统形式化(grant/call 元组、许可效果集)融合,才产生了「绑定完整性」这个既不是分类器问题也不是范围推断问题的新问题类——单一学科视角都会把它漏掉
  • 「临床试验学遇上 Agent 评估」:论文二的突破点是把临床试验的不依从问题(分配了吃药却没吃)与多智能体评估精确同构,于是 CACE/Wald 这套现成工具整体迁移——关键洞察是「Adherence 对 Agent 不是要消灭的噪声,而是要测量的对象本身」
  • 「把形式化边界推进一层」:论文一最深刻的融合节点是承认形式化本身有观测极限——D_G(c) 可被字段观测防御验证,Perm_G(c) 不能——并把「哪些失效可被哪类防御看见」做成了分类学自身的推论(Table 4 先于实验预测覆盖,Table 5 用实验证实预测)。形式化、实现与统计在这里三向咬合

八、论文中可以提取的通用性灵感

8.1 灵感一:任何「声明→执行」的链条都值得做一次绑定审计

核心思想:系统中大量安全与质量承诺隐式依赖「被承诺的对象就是后来兑现的对象」这一从未验证的等式。把这条等式显式化、形式化、逐实例审计,是发现结构性失效的通用方法。

论文证据:论文一对「批准 A=执行 A′」的审计发现三类 BGR≥0.947 的系统性失效;论文二对「声明组织 Z=实现组织」的审计发现默认配置下只有 47.2% 兑现;Loopjacking 在编排类产品上独立复现前者。

推广场景:(1) 数据管道中 schema 声明与实际写入数据的审计;(2) API 网关中限流策略配置与实际放行流量的对账;(3) 供应链中 BOM 声明与实际构建产物的绑定(SBOM 完整性);(4) 组织管理中岗位职责说明与实际工作内容的对齐度测量;(5) 金融合规中客户签约条款与系统实际执行规则的一致性审计。

8.2 灵感二:警惕「字段级验证」对「效果级偏离」的结构性失明

核心思想:只检查记录字段(字面文本、声明的身份)的验证器,对「字段全部未变、效果在下一层被扩大」的偏离零可见——这是结构极限而非实现缺陷,增加字段匹配精度无法弥补。

论文证据:Approval Token 精确核验七字段仍放行了携带 pre-commit 钩子金丝雀的字面精确提交(在线运行 argument-9ba71aca);$PATH 同名替换在 tool_name/tool_input 全部一致下 BGR=1.00。

推广场景:(1) 数据库权限系统:字段级脱敏策略挡不住存储过程内部的越权读取;(2) 智能合约审计:接口参数校验挡不住合约内部调用的重入效果;(3) 内容审核:字面关键词过滤对语义改写失效;(4) 法务合同审查:条款文本合规不保证执行层的实际行为;(5) CI/CD:merge 检查通过不代表构建产物未被本地钩子污染。

8.3 灵感三:干预的因果归因必须先验证干预真的发生了

核心思想:评估任何干预(组织、治疗、功能开关)的效果时,「分配了干预」≠「接受了干预」;不测量依从率就直接比较组间结果,会把噪声误读为效应——且低依从时被稀释的效应经 Wald 放大后可能完全颠倒真相。

论文证据:Open 卡配置 ITT +5.6 全部来自 19 个不协作任务(+15.8),17 个真协作任务 −5.9;Wald 比值 +11.8 被配对诊断否决为因果效应。

推广场景:(1) A/B 测试中新功能的采用率校正(分配到实验组的用户从未打开功能);(2) 医疗合规研究之外的场景:教育干预的出勤率归因;(3) 推荐系统的曝光归因——「下发了推荐」与「用户看到推荐」的差距;(4) 企业数字化转型的工具落地效果评估;(5) 广告投放的可见曝光(viewability)校正。

8.4 灵感四:用运行时门控替代事后过滤,用结构约束替代提示劝说

核心思想:要保证行为符合声明,在动作发生时刻拦截拒绝(并记录)远比事后筛日志或反复措辞提示词可靠;同理,用结构性约束(移除能力)达成目标比用指令劝说更稳定。

论文证据:OpenCollab 的 pre-call 准入与调用时拓扑拒绝(七个受控条件全满足 vs 十框架全部失守);只读 Adopter(94.4% Adherence)vs 提示词强制卡(91.7%)vs 劝说式 Optional 卡(63.9%)vs 自由 Open 卡(47.2%)——约束的「硬度」阶梯与 Adherence 单调对应。论文一同一原则的镜像:Harness 的字面匹配是「检查声明」而非「检查效果」,于是效果层裸奔。

推广场景:(1) 权限系统设计:能力吊销(revoke)优于承诺检查;(2) 团队管理:制度化的交接流程优于「请记得交接」的口头要求;(3) 数据治理:写入时的 schema 强制优于事后清洗;(4) 代码质量:编译期/提交期门控优于事后代码评审追补;(5) 个人习惯设计:环境设计(移除干扰物)优于意志力对抗。

8.5 灵感五:诚实报告阴性结果是可信度的放大器

核心思想:主动披露防御的失效边界、分析器的 bug 与修复过程、结论不适用的条件,不削弱论文的可信度反而放大它——因为这让其余全部结论的可靠性变得可评估。

论文证据:论文一报告 Approval Token 对 Scope/Argument 结构性无效、denial-scoping bug(0.80→1.00 的修正轨迹)、密钥保管的磁盘缺口、Codex CLI 复现失败;论文二报告 GPT-5.6-Luna 高 Adherence 低 Pass@1、−5.9 的符号不稳、答案泄漏的撤回处理。

推广场景:(1) 工程文档中记录已知的失败模式与边界条件;(2) 商业决策备忘录同时列出反方证据;(3) 模型卡片(model card)记录训练数据缺陷;(4) 尽职调查报告中主动列示未验证项;(5) 医疗诊断中报告鉴别诊断未排除的项。

8.6 灵感六:并行采样+互补纲领+裁决,是不确定任务上的稳健策略

核心思想:对高方差的长程任务,让多个求解者以互补的纲领(最窄根因 vs 完备性)并行尝试,再用基于证据的固定规则或只读裁决者选择,胜过让单一求解者(或名义上的团队)对话协商。

论文证据:Duo(代码强制双 Coder+裁决)在 DeepSWE +14.2(p=0.0025)、三基准全 SOTA;而模型自主的对话式 Team 在默认配置下 47.2% Adherence——对话式协作这个「人类直觉上的先进组织」在当前模型上多半不发生。

推广场景:(1) 投资决策:多策略分析师并行尽调+独立裁决委员会;(2) 系统设计评审:最小改动方案与彻底重构方案并行提案后对选;(3) 应急响应:多预案并行准备、按事态证据切换;(4) 科研假说检验:竞争性假说的并行验证;(5) 产品需求:激进与保守两版方案并行小流量测试。


合读收束:从「更强的 Agent」到「可验证的 Harness」

两篇论文放在一起,浮现出 2026 年编码 Agent 研究的一个清晰转向。过去几年这个领域的能量集中在让模型写代码更强——更好的微调、更长的上下文、更聪明的工具使用。而这两篇论文把探照灯转向了模型身下的那层基础设施:

  • Approval Laundering 证明:人类批准这道「最后防线」本身没有验证机制——你看到的是 A,系统兑付的是 A′,而且大部分失效根本不需要攻击者,Harness 自己的普通机制(git 钩子、$PATH、子代理继承、无 session_id 的持久化规则)就会自动完成「洗白」
  • OpenCollab 证明:多智能体这个「先进范式」在默认配置下大半是独角戏——配置文件里的三人分工,运行时 47.2% 才兑现;不审计协作是否发生,任何「多智能体有效」的结论都可能是对不依从噪声的因果误读

两者共同的方法论遗产是同一套三步:形式化声明(grant 元组/组织 manifest)→运行时观测(中介点拦截/事件流)→逐实例审计(BGR+配对检验/Adherence+CACE)。这套流程不关心模型变强变弱,只关心系统的承诺与兑现之间有没有缝——而它显然可以推广到 Agent 之外一切「声明→执行」的系统。

对从业者的直接行动含义:如果你的产品依赖人类批准做安全边界,先问一句「批准时展示的对象与执行时派发的对象之间,有没有逐字段、逐身份、逐会话的绑定核验」;如果你的团队在用多智能体,先问一句「声明的协作在多大比例的运行里真的发生了,增益是来自协作还是来自没协作的那批运行」。两个问题在 2026 年 9 月之前都没有现成的测量工具——现在有了。