SemaPLC: A Project-Grounded, Verification-Gated Agent Harness for PLC Code Generation 精读

美的AIRC联合KUKA、上海交大、浙大发布SemaPLC——一个项目接地、验证门控的PLC代码生成agent harness。它由常规工具组装而成,却由一条严格的完成纪律统治:agent不许凭自判断宣布完成,只有工具日志确认的规格审计、编译、运行时三类外部检查全部过关才准交付;任何编辑作废全部旧判定并重跑全部检查。在117个独立POU任务上它让全部7个模型拿到最高严格通过率(均值72.6%,超最强基线8.8个百分点);在65个真实工厂项目任务上,其动态行为分52.2碾压基线最高31.4——静态分相近的方法在运行时被彻底分离。编译通过≠跑得对,执行才是生成控制逻辑最忠实的检验。

August 20, 2026 · 6 min

SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读

上海交通大学与小红书合作的论文诊断了agent技能选择失败的结构性根因——selector credit starvation:在广播式序列级优势下,命名技能的少数token在损失中份额趋零、继承的信用随轨迹变长而日益错号(选择正确但执行失败时正确选择被惩罚)。SkillGate把token支持划分为两个不相交信用通道:结果信用只达执行token、动作局部优势只达技能命名token(仅当轨迹唯一一次读取是oracle时为正)。5个agent基准、16候选技能档位下,9B策略试验成功率从40.8%提升到53.2%,超同预算outcome-only RL受控对照,误导技能暴露减少三分之二,读取技能更少。

August 20, 2026 · 5 min

StagedWorkspace: A Versioned Workspace for Knowledge-Work Agents 精读

哈佛大学联合Raycaster AI、斯坦福等机构提出StagedWorkspace——为知识工作agent建立版本化工作区。论文形式化workspace-state contract概念:agent检索的解析视图、编辑的原生文件、审阅的diff、提交的制品可能指向同一工作产物的不同版本,这是PDF/表格/幻灯片等非代码制品长期缺乏的契约。内容哈希绑定使视图与版本显式关联,OfficeQA Pass@1提升8.3-12.1点,SW-AGENT用Gemini 3.1 Pro达OfficeQA 63.9%(同模型已发表分数仅29.3%),证明工作区状态是被忽视的实验变量。

August 20, 2026 · 2 min

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

ClawGym II: Exploring Black-Box RL on Agent Harness 精读

人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架:用临时沙盒把任务环境与harness整体隔离包装(对训练侧完全黑盒),以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励,使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证:30A3B骨干较初始策略分别+9.98/+14.81分,超SFT基线5.80分,PinchBench外部迁移87.32;训练在200-400步内保持稳定,且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench(六域)与PinchBench双评测体系。

August 19, 2026 · 2 min

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 精读

四位独立研究者(含 UT Austin 张satz Atlas 王)在不改模型权重的前提下,用 YAML 状态机运行时 StateM 把 GPT-5.5 在 Terminal-Bench 2.1 上从 83.1% 拉到 92.1%,冻结迁移到 GPT-5.6 Sol 达 95.28% raw,把 DeepSeek-V4-Flash 适配到 88.09% 而最终评测成本仅约 15 美元——对照 GPT 参考运行的 574.68 美元。论文提出 harness scaling 作为与 model scaling 正交的能力轴:把可变状态外置、以状态为上下文与契约双重边界、用受检转换取代 agent 自证完成,将失败分类为认知缺口/程序记忆缺口/程序遵从缺口三类并逐一施加控制点。负迁移分析(RefactorBench -2.78 分)进一步证明控制必须挂在正确的执行边界上。

August 19, 2026 · 3 min

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 精读

长程Agent任务中早期错误同时污染上下文与环境状态,现有方法(计划精化/安全检查)只防错不恢复。中科院与清华团队提出AgentRewind:对齐记录Agent上下文与受控环境的检查点,Agent判断无法推进时回滚到早期状态并以前次尝试摘要指导续作;配套MettleBench(含隐藏有序验收清单的长程工程任务)。Terminal-Bench 2.0全量上成功率83.1% vs Continue的78.7%与Restart的70.8%;回滚增益随执行horizon增长显著扩大。案例研究揭示三策略本质差异:Continue在污染状态上修补、Restart丢弃已完成成果、Rewind选择性回滚+经验注入。

August 18, 2026 · 1 min

Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development 精读

自动化研究Agent的评测长期被“最终分数”主导,无法回答进步从哪来、失败藏何处、经验是否有用。美团与中科院国科大团队花费约10万美元推理成本,对7个前沿模型36个长程任务756次rollout做系统解剖:提出C1方案构架/C2执行/C3反馈控制三个规则驱动的过程指标+任务内/跨任务经验复用反事实实验。结论是当前Agent更像“勤奋的工程优化器”而非自主研究者:avg@3差距0.237而best@3仅0.122(可靠性比峰值更具区分度);252个最优解中真正新颖方法仅3个(1.2%),钻评测空子的却有16个(6.3%);经验迁移使DeepSeek-V4-Pro +0.093却使Gemini-3.1-Pro -0.017;自动harness进化+0.123且可跨模型迁移。

August 18, 2026 · 1 min

Demystifying Agent Skills: Why They Work—Until They Don't 精读

技能已成为增强LLM Agent的热门方案,但“技能为何有效、何时失效”一直缺乏机制层面的回答。Princeton、Stanford、UCSD、USC、JHU五校联合团队通过8135条受控试验与238个开放编码标签,首次给出定量答案:技能的本质作用是程序性锚定(占65.7%)而非知识注入(仅4.5%),比Workflow Memory高6.06分;检索是独立瓶颈——技能池从5增至100时实际使用精确率从29.6%崩至3.3%,但下游成功率却保持稳定;技能还会引入新的调用失败面(误用率10.0% vs 裸执行的0.8%)。本文从背景、定位、问题抽象、解法机制、实验证据到根源解释逐层拆解,并提炼技能生命周期化的通用工程启示。

August 18, 2026 · 1 min

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test 精读

独立研究者 Saveliy Batruin 单人完成的论文,把“智能体组件各自正常、合起来却对不上”的 harness 故障形式化为层论粘合问题:5 个需求作顶点、行为签名作茎、限制映射为字面字段投影,用精确 CSP 判定可粘合性、用相对上同调类作诊断特征,并对隐藏中介状态取商以获得不变性。受控实验中 20 个任务簇全部获益(到首次成功的候选评估数 1.000 vs 2.000,token 降约 71%);但在真实 PatchFuseBench 上候选级商选择器 118/160 仅比匹配对照 116/160 高 2 题(p=0.75 不显著),未过预注册开发门,确认集保持封存。受控环境成立、真实优势尚未证明——论文以罕见的诚实划出了方法的边界。

August 17, 2026 · 4 min