COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读

港中文深圳团队把 agent 技能优化重构为’动态候选空间上的预算受限序贯优化’:contextual bandit 优先级评分决定评估哪个候选(exploit 历史得分 + explore 不确定性),证据驱动的进化只做有界精炼不做全局重写。结果:6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp,相对 SkillOpt 总成本砍 55-58%,每 benchmark 只用 50 个优化样本,且对 harness 更换鲁棒。

September 15, 2026 · 2 min

Harness or Model? Isolating the Harness Effect in Agentic Coding with a Contamination-Controlled Private Suite 精读

evolutionID GmbH 用 256 个私有任务的污染控制套件,首次把 agent 编程中 harness(驱动模型的软件层)作为唯一变量隔离测量。结论颠覆直觉:厂商原生 harness 无平均能力优势(±1.25pp 统计不显著),但按任务类型剧烈分化(仓库任务落后 9pp、竞赛任务领先 23.7pp);中立 harness 每解一题成本反而高 1.3-1.6 倍。论文还自曝自家成本遥测存在缺陷并全量重算——测量诚实度的范本。

September 15, 2026 · 2 min

Look Before You Leap: Pre-Action Verification for LLM Agents 精读

针对 agent 动作的’静默失败’(产生貌似合理但错误的效果且不报错),本文提出 success/clean-failure/silent-failure 三分框架与确定性预检层:shell 命令侧 9,930 命令+482 工具上静态验证器捕获 95.8% 无效命令(语法/二进制检查 oracle-exact 零假阳性);代码编辑侧 640 编辑×224 文件基准揭示格式尖锐分化——内容锚定格式(search/replace、diff)近零静默失败,行号/函数名格式高静默失败。护栏微秒-毫秒级、零模型调用,可包裹任何黑盒前沿 agent。

September 15, 2026 · 2 min

Skill Issue: Lessons from Optimizing Repository SKILLs for Coding Agents 精读

TU Munich × JetBrains Research 的产学研负结果研究:在真实 Kotlin 仓库的合并 PR 反向挖掘任务上,GEPA 优化 SKILL 文档仅 +4.9pp(统计不显著)、SkillOpt 仅 +0.1pp——此前文献自报的巨大增益(55%→82%)是在弱模型弱 harness 配置下测出的。论文进一步证明 pass-rate 增益量级与二元判决本身的误标率(10.7% 盲重试通过)同阶,测量仪器而非优化器才是瓶颈。maintainer 盲读却确认 SKILL 含真实项目知识——分数之外的价值。

September 15, 2026 · 2 min

Studying Without a Syllabus: Task-Agnostic Environment Preprocessing 精读

Scale AI 提出并形式化’任务无关环境预处理’设定:agent 在不知道下游任务分布的前提下自主’学习’陌生环境(S: Π×E→E——学习系统在预算内探索环境、产出制品给冻结 solver)。Meta-Agent(±策略 Archive)在 6 个异构 benchmark 的 5 个上取得最高 Avg@3;学习制品显著降低测试时采样需求;但更大学习预算不必然提升——‘学什么’比’学多久’重要。

September 15, 2026 · 1 min

EvoSafeHarness 精读:Agent 安全没有万能线束,那就让线束自己进化

JHU/UC Berkeley/NVIDIA/UIUC/UW-Madison 五机构发布 EvoSafeHarness:为冻结 LLM Agent 自动搜索’模型×领域’专用安全 harness,DecodingTrust-Agent 上 ASR 45.6%→10.0%(utility 仅损 3.3 分),AgentDojo 82.8% utility @ 0 ASR。核心洞察:模型变体决定 enforcement 强度、领域变体决定谓词与状态——universal 安全 harness 在结构上就不存在。

September 12, 2026 · 2 min

Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读

Google 的这篇论文问了一个极简的问题:agent 能否通过’写优化器代码并评估’的可执行实践学会一个搜索策略,然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型?答案是肯定的——自博弈产出的 197 词文本 harness(Harness A)使 Gemini Flash 在黑盒优化上 regret 降低 48%(N=30,p<.001),同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善(regret -43%~-49%),独立复现的 Harness B 性能同档。‘语言是部署搜索策略的便携介质’——harness 自动生成从进化搜索走向了实践蒸馏。

September 11, 2026 · 1 min

RobustSGPO: Search-Space Control for Agent Harness Evolution 精读

语义梯度提示优化(SGPO)让 harness 能用执行反馈自动进化,但其局部更新规则把’这轮该改哪里、怎么改’留给运气——搜索空间悬空导致补丁无效率高、进化易破坏已有能力。武大×快手的 RobustSGPO 给出三步控制:显式指定本轮编辑(choose what to change)、构造并检查补丁(construct & check)、从现任或保留快照继续(防劣化回滚),配合周期性 1→2→3 权限调度。在快手 AgentX 头脑风暴工作流上(120 任务/95 运行/7350 候选),held-out 完成率 60.0%→80.0%、测试质量 3.77→4.14,结构化搜索补丁有效率 77.8% vs 48.9%。

September 11, 2026 · 1 min

Show-Harness: Just a VLM Agent Can Play Robots 精读

Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。

September 11, 2026 · 2 min

AgentLeak: Cloning Stronger LLM Agent Capabilities onto Weaker Agents Beyond Skill Stealing 精读

偷到强 Agent 的技能文件,就能复制它的能力吗?本文给出否定答案并定义了’技能执行鸿沟’:技能规定做什么,而任务分解、工具选择、结果验证等隐式程序行为由强 Agent 在执行中现场补充——弱 Agent 拿到同一技能仍然完不成任务。更关键的发现是:这道鸿沟本身是泄漏面——对比受害 Agent 的成功执行与攻击者的失败执行,缺失的能力关键行为暴露无遗。AgentLeak 据此实现黑盒能力克隆:20 场景 600 实例上,比直接技能复用 pass rate 高 40%+、恢复 80%+ 能力差距,且模型/harness/工具全部不变。

September 10, 2026 · 2 min