CapScope: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents 精读

编码 Agent 沙箱内的工具天然携带’环境权威’——命名一个资源就能操作它,间接提示注入正是利用这一点让 Agent 干用户没让干的事。北大团队的 CapScope 不让模型识别恶意文本,而是在 harness 层做能力作用域授权:从可信输入导出任务级权限上限,每个 sub-agent 持有独立的类型化能力集(存于模型上下文之外),每次工具调用逐主体检查。300 组对照实验:注入生效 ambient 权威 47/75、静态全局策略 33/75、CapScope 仅 3/75,而任务完成度 68/75 基本无损。论文已被 LMPL'26(ACM SIGPLAN 工作坊,Oakland)录用。

September 10, 2026 · 2 min

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读

harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。

September 10, 2026 · 3 min

Gander (Omni Interaction Agent Technical Report) 精读

腾讯混元语音与浙大等团队的 Gander 用’小脑-大脑’协作框架统一了全双工实时交互与长程 Agent 执行:9B 小脑以 Thinker-Talker 流式架构逐秒 chunk 决策听/说/打断,大脑免训练接入 Codex/Claude Code 执行长任务,编排运行时以 task_start/send/resolve 结构化调用衔接。Full-Duplex-Bench v3 上 turn-taking 100% 全场最佳、过早打断仅 8.0%(GPT-Realtime 13.5%);SpokenQA 全双工组第一。模型、代码、数据全部开源。

September 10, 2026 · 3 min

NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 精读

NeoHorse-1 把部署中的模型路由 harness 变成递归自改进(RSI)的数据飞轮:路由层天然记录每次交互的’能力需求预测-实际执行-结果’三元组,这些记录被转化为保留交错推理与工具调用的 user-turn 训练样本,路由分数进一步组织成三阶段课程 SFT 与路由引导的在线策略蒸馏。4B/9B 模型十项基准宏平均分别从 58.94/65.60 提升至 64.87/69.04,路由 harness 数据比公开 Agent 数据平均高 6.26 分。本文精读拆解其数据管线、课程设计、OPD 机制与’评估-选择-更新’闭环为何能成立。

September 10, 2026 · 3 min

Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读

UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈,证明 follower 子游戏是近似势博弈,并首次给出’只看文本的门控不可能可靠’的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆,SWE-bench 500 实例解决率 72.2%(免费反思仅 58.4%)。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。

September 8, 2026 · 2 min

EvoHarnessBench: 智能体能跟上不断进化的 Harness 吗 精读

Salesforce Research×UNC Chapel Hill×UW–Madison 的 EvoHarnessBench 把非平稳性从任务流转移到 harness 本身:17 条受控 harness 进化流(802 任务、520 工具、42 技能、62 智能体),分部署评估(能力保持)与自进化适应两设定。基准回答一个此前无人系统提问的问题:当工具、技能、子智能体持续增加时,已部署 agent 的既有能力何去何从。

September 8, 2026 · 2 min

HackProbe: 自进化语言模型的奖励黑客检测与免疫 精读

Fullive-AI×北大×京东×NTU×武大的 HackProbe 是一个通过两个黑盒钩子挂载到任意自进化回路的监控器:秘密固定分布对比核心保证跨代可比,轮换新鲜层抗共适应;四项检验+Šidak 校正输出族校准 p 值,风险感知免疫层从候选池重选诚实更新。本文精读’诊断之外还能恢复’的奖励黑客治理闭环。

September 8, 2026 · 2 min

TROVE: 轨迹锚定的最小充分路线编辑 — 智能体编排的运行时修正 精读

TROVE 把智能体编排的结构决策从’执行前锁定’改为’运行时最小充分编辑’:离线把工作流搜索轨迹蒸馏为原子/复合技能+结果条件转移图,在线对挂起路线执行保留/插入/替换失效后缀三操作。代码生成、QA、数学推理上质量-效率权衡全面优于 AFlow/MaAS/LAS。本文精读’route 即临时品’的编排新原则。

September 8, 2026 · 2 min

What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读

本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录(Aider/OpenHands/Qwen Code/SWE-agent),对比 GRPO 的 Within/Cross 两种分组规则,用 24,000 次密封 SWE-bench Verified 评估发现:评测 harness 使解决率从 2.14% 摆到 9.27%(4.3 倍),训练配方仅移动 1.16,分组规则不显著(+0.25pp,CI 含 0)。harness 工程对 Agent RL 的影响碾压算法选择。

September 8, 2026 · 2 min

所有 Skill 都会死:卡比谈驾驭大模型的三层功夫——上下文、方法论与长活 Agent

GitHub 中国区 Top 100 开发者、Open CLI 作者卡比在 B站 Builder Club 交流日分享如何驾驭大模型:AI 的能力不只来自模型,也来自 Harness(运行时脚手架)。他给出三层可操作的功夫——理解并主动管理四层上下文与「有效上下文」,用方法论名字替代冗长 Skill(断言「所有 Skill 都会死」),以及在开源社区用长活 Agent 与 Swarm/Graph/Team 三种多 Agent 形态承接真实工作流。核心判断:模型终将吸收一切提示词工程,人剩下的核心位置是编排——拆任务、管上下文、沉淀 AI 友好(AX)的流程。

September 6, 2026 · 2 min