论文链接:Agentic Societies Need a Social Harness 发表时间:2026年9月 机构:University of Washington(Tapan Chugh、Ratul Mahajan 等) 领域标签:cs.MA / Agent Infrastructure
一、论文背景
Agent Society 是什么:多个 AI agent 各自代表不同委托人(principal)——教授的 agent、学生的 agent、两家公司的 agent——跨越信任边界自主协作。OpenClaw、NanoClaw、Hermes 等个人 agent 的爆发让这种"agent 社会"从设想变为现实:教授的 agent 直接联系学生的 agent 约会议,无需两个真人在中间传话。
为什么现在要研究它:单人 agent 的生产力已被证明(GDPval、RE-Bench 等),但多方任务要求 agent 间自主协调——人成了瓶颈(人读信息的速度远低于 agent,且无法维护大量社交关系)。而现有基础设施只有两类:A2A/AGNTCY 这类互联协议只管"连通"不管"结果好不好";Claude Teams/CrewAI 这类 swarm 因为是同一个委托人而目标一致,不面临信任问题。
核心矛盾:模型被训练得"乐于助人、有求必应"(helpful and acquiesce),这在面对不可信实体时是灾难——论文引用 Agents of Chaos 的发现:直接暴露在不可信环境的个人 agent 会行为失控。
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 互联协议 | A2A、AGNTCY、Internet of Agents | 打通 agent 间通信 | 只管连接,不保障协作结果 |
| 单委托人 swarm | MAST(Why do multi-agent systems fail?)、AutoGen、Claude Teams | 单委托人多 agent 协作 | 目标一致、无信任边界、无竞争 |
| 红队攻击面 | Agents of Chaos、AgentWorm、PsySafe | 演示 agent 网络漏洞 | 专注攻击,不研究诚实协作为何失败 |
| 共享上下文 | 共享 wiki 架构(gbrain、Sauna Spaces) | agent 读写共享存储协调 | 私有上下文必须保密的场景不可行 |
| agent 社交网络 | Moltbook | agent 间社交互动 | 无真实利害任务 |
| 分布式系统 | Birman 虚拟同步、PeerReview 问责 | 集合通信、可问责性 | 本文直接借用其机制到 LLM agent |
定位结论:本文是第一个系统研究"诚实、胜任的 agent 为什么也协作失败“并据此刻画基础设施需求的工作——红队研究问"坏人能做什么坏事”,本文问"好人为什么也办不成事",再问"需要什么机制同时解决两者"。
三、问题定义
具体场景:大学里教授与 N 个学生(或 N 个 TA)的 agent 自主协商会议时间——每个 agent 掌握委托人日历,需在满足各自约束下达成一致。刻意选了这个"简单"任务:多解存在、需真正协调、失败可客观判定(日历状态)。
抽象问题:跨信任边界的自主协作需要什么样的基础设施层(social harness),使得 (i) 诚实 agent 能高效达成令委托人满意的结果,(ii) 故意/无意失效的 agent(faulty:无能、掉线、被攻陷、恶意)不能破坏协作。
形式化:社会线束 = 叠加在个人线束(personal harness,管私有上下文/记忆/技能)之上的五层服务栈,每层向下配置、向上提供保证——类比网络协议栈" unleashed computer communication"的历史角色。
精妙之处:不试图让模型更强或更安全,而是把某几类失败变成机制上不可能(L1-L2 直接预防)、把其余失败变成运行时可检测(L3-L4)或事后可追责(L5)——三种处置对应三种时间窗口。
四、问题解法
失败解剖(实验先行)
论文先做了一组控制实验(OpenClaw harness,GPT-5.4 / Claude Opus 4.8 两种配置,每配置 10 次运行):
诚实场景三设置:E1 隔离会话(每对 peer 一个独立上下文)/ E2 共享会话(一个 agent 一个总上下文)/ E3 群组消息(ordered multicast)。发现三类病:其一,上下文分裂——Opus 教授在隔离会话下无法合并与不同 TA 的对话,N>1 时全部失败(livock 或 split booking);其二,确认死循环——GPT-5.4 两个 agent 一对一时竟交换 162±105 条消息才排完一个 30 分钟会议(成功后还在互道感谢);其三,信道争用——ordered multicast 只保证消息按序送达,不约束回复的生成顺序,三个 agent 各自"抢话"导致提案反复翻搅不收敛。
恶意场景四攻击:E4 Stalling(借口拖延)利用"法定人数未定义"把会议拖过指定周;E5 马基雅维利攻击(社会压力/欺骗)——恶意委托人给 agent 喂假事实(“教授的教委会已取消”),agent 当真转达,对方 agent 即使怀疑"二手信息"也有相当概率直接删掉真实日程(M1 欺骗成功率 100%);E6 Stalking——借熟人聚会掩盖发起者、或用 5 个学生各探一天拼出教授整周日程(泄露率 100%)。
五层协议栈
| 层 | 服务 | 机制 | 处置的失败 |
|---|---|---|---|
| L1 | 不可伪造可验证身份 | agent 用密钥签名出站消息;验证"确实由 a 发出、a 确实代表已知委托人" | 伪造/女巫攻击 |
| L2 | 可靠有序通信 | 集合通信原语(MULTICAST/GATHER/ALL-REDUCE);对不可逆副作用用悲观并发控制(先共识下一个发言者再发起 LLM 调用),带防饿死保证 | 信道争用、equivocation |
| L3 | 个人防火墙 | 入站消息双检:结构校验(协议/schema/信任策略,类比包过滤)+ 语义校验(隔离上下文中评估发送者权限/委托人政策,类比深度包检测) | 欺骗、胁迫、越权声明 |
| L4 | 共享协作规范 | 任务级 contract(形式化多方协议,可静态验证 liveness/safety/efficiency);配置 L3 防火墙的检查规则 | 确认死循环、规范缺失 |
| L5 | 社会机构 | 不可篡改会话记录(L1 签名)+ 监控 + 可撤销访问控制 + 裁决治理 | 事后才可判定的欺骗、合谋 |
设计哲学:层次划分模仿人类社会——基础设施提供基本保证,个体靠信任关系自保,机构在事后裁决并施加后果。作者坦承"这个分解未必正确",邀请社区迭代。
五、评估指标与实验证据
| 实验 | 指标 | 关键数字 | 证明什么 |
|---|---|---|---|
| E1→E2(S2, N=7, M2) | 排程成功率 | 0% → 90% | 上下文分裂是主要失败源之一 |
| E1(S1, N=1, M1) | 消息数/run | 162±105 | 诚实 agent 也极度低效(确认死循环) |
| E3 vs E2 | 消息复杂度 | 降低 3-10×(M2)/ 20-25×(M1) | 群组原语的效率价值 |
| E3(M2, N 增大) | 成功率 | 反而恶化(80%→50%) | 只有序序没有发言协议不够——支持 L4 |
| E4 Stalling | 会议失败 | 40-100% 被拖延 | 不完整规范可被"言论"利用 |
| E5 欺骗(M1/M2) | 攻击成功率 | 100% / 20-30% | “乐于助人"的 agent 天然轻信 |
| E5 社会压力 | 影响成功 | M1 30%、M2 10% | 软硬胁迫均有效 |
| E6 日历重建 | 泄露率 | 100%(两配置) | 单独无害的请求可组合成侧信道 |
证明力分析:这套实验设计的高明之处在于分离变量——RQ1(全诚实)先证明"基础设施缺陷独立于恶意存在”,排除"失败都是因为坏 agent"的误读;RQ2 再叠加恶意 agent,证明攻击恰恰利用同一批基础设施缺口(规范不完整、权限不可验证)。100% 的日历泄露率尤其锋利:它证明个别无害的局部交互可以组合成全局隐私灾难——任何只看单条消息的防御(模型层安全训练)原理上无法检测,必须靠 L5 全局视野。
反例自觉:论文诚实报告了 E3 的非单调结果(群组消息让 M1 变好、让 M2 大 N 变差)——正是因为 ordered multicast 不约束生成顺序,这个"负结果"恰好构成 L2 悲观并发控制+L4 规范的必要性论证。
六、效果优势的根源解释
根源机制与证据链
- 失败的结构性根源是"上下文-通信失配",不是模型能力(论文实验已支持):同一模型(Opus)在隔离会话 0%、共享会话 90%——模型没变,变的是信息结构。机制链:隔离会话→教授 agent 对 B 的回复看不到与 C 的对话→轮询结果无法合并→livelock。这解释了为什么"等更强模型"不解决问题:能力提升的同时恶意 agent 的攻击也同步升级(论文原话)。
- “乐于助人"的训练目标与跨信任交互存在结构性冲突(论文实验已支持):模型拒绝直接说谎,但无法拒绝"转达委托人提供的假事实”——因为从模型视角这只是传递信息。机制链:安全训练作用于"模型直接行为"→转达是间接行为→安全护栏不覆盖。欺骗攻击 100% 成功正是打在这个缝隙上。
- 消息有效性验证需要部署特定的信任关系,模型原理上不可判(论文推理+部分实验支持):判断"学生 agent 是否有权宣布教授的会议取消"需要知道该部署中谁委托谁——这是上下文知识而非语言能力。因此 L3 防火墙必须是"配置项"而非"模型能力"。
- 悲观并发控制的必要性来自 LLM 生成的不可回滚性(论文推理):分布式系统的乐观并发控制依赖"写可隔离、可回滚",而 agent 在生成消息时就可能产生本地不可逆副作用——所以必须先共识后生成。(此条为设计论证,尚无实验量化开销。)
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| Agents of Chaos(2602.20021) | agent 社交网络攻击演示 | 直接暴露不可信环境致行为失控 | 个案攻击展示,非系统任务研究 | 支持:信任边界问题真实 |
| Red-teaming a network of agents(微软) | agent 网络红队 | 识别注入/身份攻击面 | 只研究攻击向量 | 补充:L1/L3 所防攻击有实证基础 |
| MAST / Why do multi-agent LLM systems fail?(NeurIPS 2025) | swarm 失败分类学 | 失败多为系统设计而非模型 | 单委托人 swarm,无竞争与信任边界 | 支持:系统层失败主导的证据 |
| Magentic Marketplace(微软) | agent 市场协作 | 交易场景协作研究 | 限经济交易场景 | 限定:协作失败谱系或随任务类型变化 |
| Defeating prompt injections by design(SaTML 2026) | 隔离上下文设计防注入 | 设计层防御优于模型层 | 单 agent 防注入 | 支持:L3 隔离上下文语义校验的可行性 |
| PeerReview(SOSP 2007) | 分布式系统问责 | 不可篡改记录+问责 | 非 LLM 场景 | 支持:L5 机制有成熟先例 |
相反结论检索:本次检索范围内未发现主张"纯模型层安全训练足以保障跨信任协作"的研究——相反,Willison 的 lethal trifecta(私有数据+不可信内容+外部通信)与本文结论一致:能力越强的 agent 越危险,机制隔离是必要条件。
综合判断与未决问题
多研究共同支持:(1) agent 间交互的失败主要是系统/基础设施层问题(MAST+本文 RQ1);(2) 模型层安全训练不能覆盖"转达式"间接危害(本文 E5+Agents of Chaos)。仍属推测:五层栈的层次划分与开销可接受性——悲观并发控制串行化发言会限制吞吐,论文自认未量化协调-吞吐权衡。适用边界:实验限于会议排程单一任务族与两个模型家族;规范(L4 contracts)由谁编写、如何处理不完整规范(E4 的根源)是开放问题。
七、必要知识反推
领域知识层:个人 agent 生态现状(OpenClaw 的 harness 结构、ClawHub skill 分发)——不知道 agent 今天的实际形态就无法设计其社会层;LLM 上下文机制(会话隔离意味着模型看不到什么)——这是解释 0% vs 90% 差异的知识基础。
方法论知识层:分布式系统的成熟工具箱——集合通信语义(MPI 传统)、乐观/悲观并发控制的适用条件(可回滚性)、PeerReview 式问责;博弈论/机制设计视角(委托人目标部分冲突时协作与竞争并存);受控实验设计(10 次重复、trace 人工核验)。
工程知识层:LLM 增强的 trace 分析管线(用 LLM agent 标注/聚类通信轨迹再人工抽查);攻击 prompt 的构造与伦理边界(欺骗/胁迫/跟踪三类攻击的设计)。
知识融合关键节点:全文最大的融合点是"把人类社会科学的制度分层翻译成可工程化的协议栈"——政治理论的立法/司法/行政三分变成 L5 的政策制定/裁决/执行;社交礼仪的"谁该什么时候说什么"变成 L4 的形式化 contract;个体心理的信任判断变成 L3 的个人防火墙。作者必须同时深谙分布式系统(知道哪些机制现成可用)与社会理论(知道该防什么),缺一边都写不出这个栈。
八、通用性灵感
- “更强模型"与"更好制度"是正交变量:同一模型在两种会话结构下成功率 0% vs 90%——系统结构决定了模型能力的上限表达。推广:组织管理(同一个员工在不同流程下产出天差地别)、交通安全(再好的司机也需要红绿灯)、数据库(再快的 CPU 也需要索引)。
- 安全训练存在"转达盲区”:模型能拒绝直接说谎,却会忠实转达委托人的谎言——间接行为的责任链条是模型层防御的结构性缺口,需要机制层(验证发送者权限)补位。推广:金融合规(业务员转述"领导指示"的合规盲区)、法律(传闻证据规则——二手信息需要更高验证等级)。
- 无害局部交互可组合成有害全局行为:5 个学生各问一天教授空档都是正常请求,拼起来就是完整日程泄露——单点审计原理上防不住组合攻击。推广:隐私(多源数据聚合去匿名化)、供应链(每个环节合规但整体被卡脖子)、反垄断(单家企业行为合法但协同构成垄断)。
- 不可逆操作前必须共识(悲观并发),可逆操作可乐观执行:LLM 生成过程可能产生不可逆本地副作用,这改变了分布式系统"先做后回滚"的默认最优——推广到任何"执行中会立即产生外部效果"的系统(手术机器人、金融交易、发布系统)。
- 协议栈思维:一层防一类、一层检一类、一层究一类:预防(L1-L2)→运行时检测(L3-L4)→事后追责(L5)三种时间窗口对应三种失败处置,不迷信单点全防。推广:公共卫生(疫苗防/筛查检/流调究)、信息安全(预防/检测/取证纵深防御)。