Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 精读

自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。

September 4, 2026 · 3 min

Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems 精读

Wavestone AI Lab 对 11 个生产级编码 agent harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw + 元 harness 对照 Omnigent)做源码级解剖:定义 harness 七大子系统、产出 13 条跨系统观察、29 个重复设计模式、18 条设计建议与 90 行最小 harness。关键发现:7/11 系统收敛于阈值触发 LLM 压缩的记忆管理事实标准;提供商抽象呈五档光谱;Codex 已把 per-model 提示作为服务器端数据运行时下发。这是’harness 工程’学科的第一部解剖学图谱。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase 精读

KAIST 与 DeepAuto.ai 的 Super Library Agent 为代码智能提出了一个被所有人忽视的新问题设定:LLM 编码 Agent 逐应用生成时会在代码库间复制共享逻辑,长期自主维护还会积累冗余与结构侵蚀。论文定义’Super Library Agent’问题——顺序生成 N 个相关应用的同时维护一个共享组件库,并用三项技术(候选引导抽取、抽取前巩固、调用图条件化迁移)在 WebGen-Bench/PaperBench 上同时保住功能与可维护性:共享策略更新时补丁量从 936 行降到 256 行。这是把软件工程的’库’概念引入 Agent 时代的开创性工作。

September 2, 2026 · 2 min

WebWorld: The Browser as a World Model for Self-Improving Web Code 精读

北航联合上交、澜舟科技等机构的 WebWorld 直击 VLM 代码自改进的结构性缺陷:提出修复的模型同时是评判修复的模型,这种’自己批改自己’的闭环注定产出视觉可信但功能残缺的页面。解法是引入一个 VLM 骗不了的对手方——浏览器本身:作为确定性可执行模拟器,它扮演 Web 代码的’世界模型’,只有同时满足目标前进与既有能力保持的转换才能获得验收证书,认证数据形成只升不降的质量棘轮。WebWorld-27B 在 MiniAppBench-Val 提升 14.9 分,达到 Kimi-K2.6/GPT-5.4 水平;等尺寸消融证明去掉证书后增益几乎消失。

September 2, 2026 · 2 min

LoopArena: Benchmarking Models as Runtime Controllers for Loop Engineering 精读

深度精读阿里 DreamX 团队联合北邮、UNSW Sydney 与 Data61 CSIRO 推出的 LoopArena:首个把『模型作为运行时循环控制者』的编排能力本身作为被评测对象的基准。它冻结 Worker 编码智能体与全部执行环境,只比较 Controller 模型在 advance/verify/stop 三类决策上的表现;Type I/II/III 三级成本递减设置使其可低成本诊断循环控制能力。关键发现:完整任务上最强 Controller(GPT-5.5)Strict Success Rate 仅 24.69%,机械重复目标的 fixed control 在全任务上与无控制持平(18.52%),证明有用的循环控制必须随运行状态自适应切换;Type II 切片评估平均省 64.4% 成本且与全任务排序高度一致(Spearman ρ=0.9747)。

August 31, 2026 · 5 min

openJiuwen: Beyond Static Harnesses for Long-Horizon Coding Agents 精读

深度精读华为开源的 openJiuwen 编码智能体 harness。论文把 agent harness 提升为一等系统层,用两大设计原则回应长时程编码的挑战:结构可组合性(共享 Inner Loop/Outer Loop 执行基座 + Rail 生命周期钩子上的有序能力组合,同一执行语义从单智能体复用到子智能体与 Swarm Flow 多智能体流)与运行时适应性(在固定模型策略周围改变框架控制的运行时状态:Context Management 渐进压缩、Goal Mode 语义化验收停止、LSP 被动反馈闭环修正、Self-Reflection 跨任务经验蒸馏)。SWE-bench Verified 达 82.6%(超最强榜单 3.4 个百分点)、Terminal-Bench 2.1 达 87.19%;模型对齐对比下 1-4 小时长任务 52.38% vs mini-swe-agent 同设定 35.71%,佐证上下文管理在长轨迹上保住了深推理收益。

August 31, 2026 · 5 min

RealSWE: A Compositional Evaluation of Coding Agents under Realistic User Requests 精读

编程智能体的能力几乎都用 SWE-BENCH 系基准衡量,但其任务来自精修的 GitHub issue——长、结构化、信息丰富;真实用户请求却往往短、随意、信息稀疏。成均馆大学团队先定义六类信息分类学与四个语言学维度,量化出残酷的错位:仅含问题陈述的请求占真实提示的 88% 却只占基准任务的 7%,87% 的真实提示口语化而 94% 的基准问题书面化。据此构造 381 个多变体任务族(族内共享任务与 gold patch、只变信息组合与风格),评估七个模型发现真实输入平均拉低解析率 6.4 个百分点、足以改变排名;受控消融进一步定位:期望行为 [D] 与动机 [M] 是关键信号(+6.8 到 +9.9pp),复现步骤与环境信息只增加 token 却无可测收益,语言风格几乎不影响性能。本文按九部分结构精读这个『表达方式可被逐字段归因』的评估范式。

August 31, 2026 · 4 min

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration 精读

精读上海交通大学、HKUST 与 UC SD 合作的仓库级代码问答框架 DeepRepoQA。它把回答开发者关于整个代码仓库的问题形式化为 MCTS 引导的搜索-验证过程:四个专职智能体负责感知、规划、执行与评估,在 Tree-sitter AST 索引与语义检索构成的六动作空间上做带价值回传的树搜索。在 SWE-QA 基准 15 个 Python 仓库 720 个 QA 对上,四个底座模型全部拿到开源方法第一,GPT-5.1 底座 70.06 分超过通义灵码、逼近 Cursor;消融显示评估智能体用学习价值估计替代昂贵 rollout 是最大贡献者,token 消耗还比 SWE-agent 低 38%。本文逐部分拆解其方法机制、实验证据与效果优势的因果链。

August 29, 2026 · 6 min

Vulnerable Code Search: Transferable Attack for Code Language Models 精读

南加州大学团队针对代码搜索嵌入模型(CLM)提出可迁移对抗攻击:在不改变代码功能的前提下重命名标识符,让无关代码在目标查询的检索排名中挤掉合法结果。攻击只需在 CodeT5+ 等小模型上白盒优化,即可迁移到 Nomic-embed-code、Voyage-code-3 甚至 GPT-5.4-mini 与 Gemini-3.1-Pro 等闭源大模型;CosQA 上替换 10% 无关候选后 MRR 绝对下降最高达 77%,黑盒查询成本仅 1k 次、约为 CodeAttack 的万分之一。实验揭示当前代码检索模型高度依赖词汇特征而非语义理解,规模化并不能带来鲁棒性,标准对抗微调也难以兼顾检索效用与安全。

August 29, 2026 · 6 min