Agentic Societies Need a Social Harness 精读

当不同主人的 AI 智能体开始自主协作,会发生什么?华盛顿大学的系统实验给出冷峻答案:即使全部诚实的 agent 也会因上下文分裂与信道争用大量失败(7 人群组排程成功率最低 0%),恶意 agent 凭’言论’即可让欺骗攻击 100% 成功、日历侧信道 100% 泄露。论文提出五层 Social Harness 协议栈(身份→有序通信→个人防火墙→协作规范→社会机构),把人类社会协作的制度智慧移植为 agent 社会基础设施。本精读覆盖’诚实 agent 也失败’的失败解剖与’协议栈防类别性失败’的设计哲学。

September 17, 2026 · 3 min

ExecuCritic × AgentGuard × RepoAtlas × Protocol Trimming 精读:编码智能体可靠性四重奏

四篇互补的 coding agent 可靠性研究合读:Intel×北大的 ExecuCritic 给 RLVR 加’校准 critic 塑形’——ρK 秩相关门控让 critic 失准自动坍缩,SWE-bench Lite +3.7pp 且 sandbox 执行省 42%;York 的 AgentGuard 从 642 条异常轨迹自动学条件激活护栏,异常执行率 69.0%→26.7%(代价:过度拒绝 19.3%);北航 RepoAtlas 用 select-project-refresh 演化多模态仓库视图,三 VLM 一致 +2.4pp 且 token -5.8%;Intuit 工程报告量化协议保持裁剪——常规裁剪成功率 66.6-77.3% vs 协议感知 92.2%/自适应护栏 96.0%,临界阈值随复杂度上移。合读视角:可靠 coding agent 的四层防线——训练时(奖励塑形)、执行时(护栏)、探索时(上下文视图)、压缩时(协议保持)。

September 17, 2026 · 3 min

ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 精读

ScienceBuddy 把’与研究者聊天’变成模型-线束双改进的燃料:研究者交互免费产出任务定义与评估 rubric,内层递归固定模型演化 harness(有界编辑+成对回归检查),外层递归固定 harness 做 rubric 奖励 GRPO——三周期后科学任务准确率 42.2%→73.3%,纯 harness 演化即可 +20pp(权重冻结),纯模型 RL 覆盖率 +19.5pp。Recursive-in-Recursive 范式为 RSI 提供了’两条改进通道各自可评估、互为条件’的工程化路径,并作为可下载的科研产品发布。

September 17, 2026 · 3 min

AlgoEvo × MOSCOPT × SkillLift:Skill 优化三部曲 精读

三篇同日论文从三个角度推进 skill 优化。AlgoEvo(港城大):把算法发现 agentic 化——design skill hub 解耦范式知识与发现引擎,三层经验库(经验卡/经验树/跨任务固化)组织搜索轨迹,6 任务匹配或超越专用方法且评估数与 token 大减。MOSCOPT:skill 池+gating skill 联合优化——EditAdam 双态维护+三阶段交错更新,免梯度单调改进,突破’单模板优化’的协同缺失。SkillLift:稀疏 oracle→稠密 rubric 双层优化——冻结 rubric 作廉价代理引导 skill 修订,解耦搜索与 oracle 成本。本精读合并解读 skill 优化的三条进化路径:知识组织、多技能协同、评估降本。

September 16, 2026 · 2 min

Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents 精读

临床 Agent 的’执行差距’:急诊整班次模拟(CES)中 Agent 多能给出正确诊断(4.39/5)却无法完整及时执行关键动作(2.94/5/3.34/5)——诊断对但病人死的结构性失败。Asclepius 三件套:换班间用 trace 反馈重写操作手册的自进化 harness、高风险规程外置的临床技能库、按病人队列隔离的三个子 Agent。held-out 批次上 critical-action correctness +22%(p=0.024)且诊断精度保持。本精读覆盖执行差距的三失效模式操作化与’操作手册级’harness 演化的医疗安全意义。

September 16, 2026 · 2 min

HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning 精读

同一模型在不同 harness(系统提示/工具 schema/控制循环/轨迹格式)下表现不均——多 harness 共同训练时每个优化步选哪个 harness 是被忽视的调度问题。HarnessBandit 用双信号在线调度:learnability(批平均绝对优势,还有多少可学)× transferability(梯度 sketch 余弦,学了是否白学),bandit 采样决策。6 harness 在 ClawGym 训练,held-out 任务与 held-out harness 双评测均优于混合批次训练。本精读覆盖双信号的互补性设计与 DeepSeek 产学研背景下的调度理论落地。

September 16, 2026 · 2 min

ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement 精读

harness 自改进的泛化性危机:在评测基准上演化=对测试集过拟合,单轨迹更新把系统性缺陷与实例细节纠缠。ModularRSI 三重解法——benchmark-disjoint(2000 个外部演化任务与评测基准不相交)、对比式信用分配(同任务成功/失败轨迹对比聚合跨任务证据)、模块化定位(缺陷归因到 harness 具体组件)。DeepSeek-V4-Flash 骨干上 SWE-Bench-Verified 73.40→76.45、TerminalBench 2.0 47.57→52.43,演化 harness 可跨基座迁移。本精读覆盖三大缺陷的诊断逻辑与对比式信用分配的因果推断本质。

September 16, 2026 · 2 min

PMPA × SkillSecurer × SkillAtlas:Skill 与记忆安全三连 精读

三篇同日论文从攻击、防御、资源三面拼出 skill/记忆安全的完整地图。PMPA(复旦):harness 持久记忆投毒——恶意指令藏进良性外部源诱导 Agent 写入持久记忆,OpenClaw ISR/C-ASR 73.7%/55.5%、Claude Code 66.9%/81.7% 且良性性能保持。SkillSecurer:红蓝 Agent 对抗扫描 skill 注入漏洞,9 威胁类型注入级评估,最佳后端唯一 100% 检测率,skills.sh 热门 skill 17%+ 有漏洞并实测触发事故。SkillAtlas:3014 案例/6589 轨迹的托管攻击轨迹库,42.5% 成功案例首轮失败后才成功,轨迹标签把 pre-execution guard 精度提至 0.770。本精读合并解读攻击面(记忆写入)→防御(红蓝扫描)→基础设施(公共案例库)的完整安全链条。

September 16, 2026 · 2 min

SkillSeam: Six Principles for Auditing Agent Skill Collections 精读

一堆合格技能不等于一个可靠系统——技能在集合的’接缝’处失败:程序竞争注意力、别名重复加载、边界模糊。SkillSeam 提出六原则审计框架(持久梯度/系统连贯/机制门控/正交覆盖/触发流/粒度纪律),每条原则映射到失效机制→最强可观测信号→受控扰动测试。关键发现:破坏持久层级后 loaded-skill tokens +59.5% 而准确率不降——成本病在准确率病之前出现,准确率导向的评测对集合级架构债不敏感。本精读覆盖’按失效机制预测的信道评估’方法论与成本先行的预警价值。

September 16, 2026 · 2 min

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science 精读

语言模型能产出看似合理的短证明,但在长程研究问题(不确定且相互依赖的决策序列)上不可靠——短证明能力与长程研究能力之间存在结构断层。Stellar Colosseum(CMU×Google Research)给出 model-agnostic 的多 Agent harness:策略探索后 readiness gate 决定何时分解、证明计划表示为 section 级相互依赖子问题、verifier 反馈路由回受影响部分;并行候选生成+定向证伪+重叠随机采样树聚合。已在数学与理论计算机科学问题上产出实际研究进展。本精读覆盖’长程=决策序列管理’的问题重构、readiness gate 的推理分配经济学与树聚合的抗噪声机制。

September 16, 2026 · 2 min