GitSkills: A Dataset of Agent Skills on GitHub 精读

深度精读 UCL、霍恩海姆大学与卡利亚里大学合作的 GitSkills——首个对 GitHub 上 Agent Skill 生态做系统性快照的规模数据集。2025年10月 Anthropic 开源 SKILL.md 格式,仅九个月后 GitHub 公开仓库中已沉淀 3,797,117 个 SKILL.md 文件、282,200 个仓库、195,841 个账号。论文的三阶段管线绕过代码搜索 API 每查询 1000 条上限与不可靠的总数估计(报 34.9 万 vs 实际 380 万+),按文件大小递归分区搜索空间完成完整采集;内容哈希去重得 1,877,981 个不同内容,50.5% 的文件是逐字副本——这个无包管理器、靠复制传播的生态,把软件供应链安全命题原样搬进了自然语言工件世界。数据封装为单个自包含 SQLite 文件,采集与解释分离设计让社区可以自定义纳入标准。

August 17, 2026 · 3 min

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior 精读

普渡大学、微软研究院与芝加哥大学团队对编码智能体的工具架构做了受控对比实验:在能力等价前提下比较六种工具架构(BashOnly、Atomic、NLSearch、Python、HypoTrack、Scratchpad),覆盖三个模型共11700条轨迹。结果显示结构化原子工具将弱模型重复运行稳定性最高提升4.7倍,自然语言搜索拓宽仓库探索广度超过11%,代码执行接口在任务表现相近的情况下减少41.6%步数与56.3%token消耗,而轻量认知脚手架几乎无效——接口本身就在塑造智能体行为。

August 17, 2026 · 4 min

SkillEvo: 多轮交互反馈的自更新进化梯度 精读

深度精读腾讯云 Andon 与浙江大学合作的 SkillEvo 论文——把多轮用户模拟从评估终点反转为反馈生成器,让 Agent 技能在生产工单上自进化。从梯度衰减机制、可信反馈三条件(意图状态机、双侧正交评估、集体归因)到双层治理(有界修订、结构退化主动修复),全面拆解这套在腾讯云 9 个生产 Skill 上将 TSR 从 30.0 提升到 81.8 并落地生产环境的自进化框架。

August 16, 2026 · 2 min

A Programming Paradigm for Spatiotemporal Composability 精读

北大与 DeepSeek-AI 合作的 88 页长文,为「插件系统、自进化 Agent Harness」这类动态组合软件给出了第一个完整的编程范式级形式化基础:把经典效应系统提升为可逆效应、把协同效应系统提升为响应式协同效应,统一成一个递归上下文类型,再配上动态组合演算与全套元理论(保持性、恢复精确性、活性、合流性),实现为 Cordis 元框架并在 Koishi(4000+ 社区插件)上验证。本文按背景、定位、问题、解法、评估、根源解释、知识反推、通用灵感八个层面完整拆解。

August 15, 2026 · 5 min

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 精读

把一篇20页论文变成一张合格学术海报,需要上百次工具调用、多轮排版修订与视觉验证——这是典型的长时程智能体设计任务。本文精读美团联合多家高校的 AutoDesign:它不直接训练模型,而是让一个元harness优化器引导 code agent 基于 rollout 反馈递归自改进 harness,经 7 天演化沉淀出可复用、可迁移的学习型 DesignHarness。在自建的 PosterBench 百篇论文基准上,AutoDesign 以 78.32 分超过商业系统 Claude Design 7.45 分,盲测人类偏好 BT 值 64.0% 位列第一;给 7 个模型配置挂载该 harness,平均分从 54.99 提升到 67.39。本精读重点拆解其双层优化循环、五组件 harness 结构,并用因果链解释’学习型 harness 为什么弱模型受益更大’。

August 15, 2026 · 3 min

DarwinX: Evolving Agent Harnesses Through Natural Selection 精读

LLM Agent 的能力不只取决于模型权重,还取决于包裹模型的 Harness(提示词、工具、技能、控制流)。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下,把 Agent 自进化重构为对 Harness 种群的“自然选择”:preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体,树状 archive 保留多条谱系供跨谱系重组,失败/教师/自采三种证据共用同一编辑接口,适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分:Terminal-Bench 2.1 达 83.2%,WebArena-Infinity 从 43.5% 跃升至 93.0%,且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制,并建立“方法差异→机制变化→指标提升”的因果链。

August 15, 2026 · 5 min

SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models 精读

SKILLER 提出语言级强化学习框架:用强模型(GPT-5.4)兼任 actor 与 critic,把小模型智能体系统当作环境,官方验证器提供标量奖励与文本诊断,全部 RL 信号经由自然语言传播,优化变量是技能文本本身而非模型权重。在五个基准上,9B/4B 小模型配 SKILLER 技能全面超越闭源 Manus 与开源技能生成方法,SWE-Skills-Bench 上超人类技能 30.8 分,且零样本迁移到 GAIA/EarthBench 仍保持领先。本精读覆盖其背景脉络、语言级 RL 形式化、actor-critic 机制、消融因果链与可推广灵感。

August 15, 2026 · 5 min

AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses 精读

Salesforce AI Research 联合 Notre Dame、UIUC(Heng Ji)提出强到弱推理时脚手架(Strong-to-Weak Scaffolding):用强 builder 模型为弱 target 模型自动构建推理时 harness,无需任何参数更新即可在四个 Theory-of-Mind 基准(3900 项)上将 GPT-5.4-mini 从 0.488 提升到 0.912(+0.423)。机制分析表明增益主要来自把不稳定的自然语言推理卸载为确定性代码(r=0.72),而非更长推理链或更多采样。这是对传统训练时蒸馏的一条互补路线,也直接印证了 harness 工程作为独立工程对象的价值。

August 12, 2026 · 9 min

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents 精读

ByteDance Seed 团队提出的 Harness-IF 把「编程 Agent 是否真的在遵守指令」这件事第一次变成了可量化、可归因的规则级测量问题。它构造了 642 条原子规则的库,实例化出 60 个多轮编程任务,在 5 个可配置的「指令表面」(系统提示/工具描述/技能描述/项目文件/用户指令)上分别打分;更重要的是,它用 Against-Prior Accuracy(AP-Acc)把「模型本来就是这么做」的巧合从「真正遵从指令」中剥离出来——12 个前沿模型无一例外都在反先验规则上表现更差,平均落差 5.81 分。配套的 E0 冲突实验还揭示了一个反直觉结论:表面优先级并不服从提示深度,SP/PF/UI 同居首位,而工具描述和技能描述垫底。这篇精读从背景、定位、问题、解法、证据、根源、知识反推到通用灵感,完整拆解这项与 Harness 评估方向高度相关的工作。

August 12, 2026 · 9 min

BONSAI: Evolvability-Guided Tree Search over Skills 精读

深度精读论文《BONSAI》——首个以『可进化性(evolvability)』而非当前适应度引导技能搜索的框架。面对『单一验证分数无法区分宽广平台与狭窄尖峰』这一根本盲区,BONSAI 将技能生长为蒙特卡洛搜索树,让节点下的平均分数免费估计变异邻域的可进化性,无需任何额外模型调用。在冻结 30B Agent 上、三个基准平均,BONSAI 比无技能 Agent 提升 23.13 点,比 GEPA 提升 3.87 点,比 SkillOpt 提升 3.97 点;消融实验证明可进化性信号本身在相同树上贡献 +2.14~+7.02 点。

August 11, 2026 · 8 min