Show-Harness: Just a VLM Agent Can Play Robots 精读

Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。

September 11, 2026 · 2 min

Subagents vs Agent Skills: Executing Reusable Knowledge for Long-Horizon Agentic Tasks 精读

Agent skill(技能包=指令+脚本+资源的多文件包)的主流执行方式是把指令载入主上下文让 agent 遵循;本文系统对照另一种方式——把技能包作为 subagent 在隔离的全新上下文窗口中调用。在 SkillsBench 长程任务上的结论:当技能包有明确输入输出契约、指令编码了履约所需过程知识时,subagent 执行稳定胜出,且随干扰技能增多退化更平缓;代价是主-sub 协调的额外 token。‘可复用知识的价值不仅取决于内容,也取决于组织与调用方式’——这是 skill 工程从’写什么’转向’怎么调’的第一份系统证据。

September 11, 2026 · 1 min

The Double Measurement Confound in Agent Benchmarks 精读

这篇来自西班牙团队的论文给 agent benchmark 的分数有效性下了诊断书:执行关键决策由固定 scaffold 而非模型做出(第一重测量混杂),scorer 用与任务正确性脱节的标准打分(第二重),两者合谋让排行榜测的是’评测管线属性’而非’模型能力’。论文提出测量论框架+审计修复协议三步——把执行决策移交给模型(de-scaffolding)、种子化金标评分替代形状匹配、用最差情形/尾部风险报告超越均值的可靠性。在 ComtradeBench 上:无 LLM 的规则基线得 96.8 分 vs Kimi/Claude 的 97.5,联合干预把平坦排行榜变成’平均性能×种子鲁棒性’的可靠性谱。

September 11, 2026 · 1 min

What Should an Agent Forget? Separating What Is Stored from What Is Used 精读

持久语言智能体面临两个常被混为一谈的决策:记忆里存什么、回答时用什么。本文提出 RD-Forget——档案层保留全部源观察,查询条件化视图层决定本次回答使用哪些证据;槽位替换抑制过期信息(旧雇主让位新雇主)但保留独立关系(地点不变),历史意图与救援开关共同决定被取代条目何时可重新启用。在 AMB-Text/LME-KU/BEAM 三基准四个骨干上,事实固化较最优基线 +11~26 个百分点(Luna +26、Qwen +17、Kimi +14、MiniMax +11)。‘遗忘不是删除,是使用策略’——记忆管理的新范式。

September 11, 2026 · 1 min

XAgent: eXecution-guided Agentic AI for GitHub Issues 精读

XAgent 把仓库级 issue 解决从’读描述猜位置’升级为’跑起来看分歧’:执行引导定位对 buggy/非 buggy 版本做差分执行分析+树编辑距离定位行为分歧点,上下文感知测试增强器生成超越 issue 描述的边缘用例验证补丁。SWE-bench-Lite 上 resolve rate 62.0%(SOTA)、函数级定位准确率 72.8%、每 issue 成本 $1.56(比前 SOTA 便宜 37%)、token 省 40%,并解决 7 个所有顶级基线(SWE-Agent/EXPEREPAIR/Refact)全部失败的问题。本文精读’静态描述→动态执行’范式转移的机制细节。

September 11, 2026 · 1 min

Φ-Bench: Can Large Language Models Engineer the Infrastructure That Powers Them? 精读

USTC×StepFun×北大×HKUST×Yale×UPenn 六机构联合的 Φ-Bench 提出一个自指性问题:LLM 推理所依赖的基础设施(kernel、服务栈、集群)能否由 LLM 自己来工程化?85 个任务、三种渐进格式——Kernel 函数补全(KFC)→长程实现(LHI)→端到端优化(E2EO),双轴评分(性能+实现)+内置作弊检测。最强 Claude Opus 5 总分仅 36.53%(KFC 37.16%/LHI 21.60%/E2EO 62.94%),硬件与边缘类最好模型也仅 5.4%——‘造物者维护造物’的能力缺口被量化暴露。

September 11, 2026 · 1 min

AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing 精读

偷到强 Agent 的技能文件,就能复制它的能力吗?本文给出否定答案并定义了’技能执行鸿沟’:技能规定做什么,而任务分解、工具选择、结果验证等隐式程序行为由强 Agent 在执行中现场补充——弱 Agent 拿到同一技能仍然完不成任务。更关键的发现是:这道鸿沟本身是泄漏面——对比受害 Agent 的成功执行与攻击者的失败执行,缺失的能力关键行为暴露无遗。AgentLeak 据此实现黑盒能力克隆:20 场景 600 实例上,比直接技能复用 pass rate 高 40%+、恢复 80%+ 能力差距,且模型/harness/工具全部不变。

September 10, 2026 · 2 min

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference 精读

KV cache 压缩方法都用’最近的查询’预测未来注意力——本文发现长程推理中这个假设根本不成立:解码会不定期产生’思维重访令牌’(TRT),重新关注数千 token 之前的推理计划,而近期查询无法预知这次重访。关键观察是 TRT 对应的全局查询在嵌入空间聚成少数簇——只需为每簇维护一个’信标查询’(Continual FPS 在线选取),就能预判哪些 KV 将被重访。训练自由、无需改动架构:四个开源推理模型上内存最高压缩 5.8×、精度近全量、吞吐 +4.3×,对 RPC/R-KV 最高领先 31.7 个百分点。

September 10, 2026 · 2 min

CapScope: A Capability-Scoped Harness for Prompt-Injection-Resistant Coding Agents 精读

编码 Agent 沙箱内的工具天然携带’环境权威’——命名一个资源就能操作它,间接提示注入正是利用这一点让 Agent 干用户没让干的事。北大团队的 CapScope 不让模型识别恶意文本,而是在 harness 层做能力作用域授权:从可信输入导出任务级权限上限,每个 sub-agent 持有独立的类型化能力集(存于模型上下文之外),每次工具调用逐主体检查。300 组对照实验:注入生效 ambient 权威 47/75、静态全局策略 33/75、CapScope 仅 3/75,而任务完成度 68/75 基本无损。论文已被 LMPL'26(ACM SIGPLAN 工作坊,Oakland)录用。

September 10, 2026 · 2 min

Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读

harness 进化后,让弱模型模仿更强专家的轨迹——这个’显然正确’的配方在七个企业任务上全部翻车(平均 -14.9 分),而同样的做法在未进化 harness 下却有增益。论文定位出根源:模仿让弱模型学会了专家的知识,却也继承了专家的规划风格,破坏了它与’围绕自身原生风格进化出来的 harness’的拟合。解法是 on-policy 专家修正:meta-MLE agent 定位失败 turn、专家只重写那一轮,平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解’模型-harness 拟合’这一新概念与其共进化配方。

September 10, 2026 · 3 min