Grounded Skill Synthesis from Code at Scale for Agentic Intelligence 精读

本文精读蚂蚁国际的 Code2Skill:一种从开源代码库大规模合成「接地(grounded)、可验证、可迁移」技能库的全自动流水线。它把 GitHub 上经过人类调试打磨的仓库代码抽象为三粒度技能卡(原子/复合/模式),并用「源码盲重建 + 源码感知裁判 + 仲裁器」的往返验证过滤不可靠记录,最终产出含 1,006,822 条记录的 CodeSkillBank。在 72 组协议匹配评测中 57 组提升、宏平均 +11.7%,并在统一接口下全面超越轨迹派技能库。文章按九部分结构,从 Skill 概念的「岗位操作手册」类比讲起,逐层拆解其问题定义、四阶段解法、实验证据、优势根源与外部交叉验证,并提炼可推广的通用性灵感。

September 22, 2026 · 4 min

SWE-Proof: Can Language Models Resolve Real-World Issues with Machine-Checked Proofs? 精读

SWE-Proof 把 SWE 类基准的判定信号从「隐藏测试」升级为「机器检查的形式化证明」,提出 BENCHPROOFER 流水线(规范合成 + 环境公理化 + 13 道正确性门)与 SWE-PROOF 基准(500 例 SWE-Bench Verified 100% 过门 + 242 例 SWE-Bench Pro)。核心发现:隐藏测试只采样有限输入,会放过四分之一到一半的缺陷 patch;给定正确形式化规范可将解决率从 85.0%/81.2% 提升至 96.2%/94.4%,且对抗审计后仅损失 0.9 个百分点;但让模型自写规范对解决率零收益,瓶颈在于 faithfulness——规范只约束了部分行为面。本文按九部分结构拆解其背景、定位、问题定义、解法、评估、根源与外部交叉验证。

September 22, 2026 · 4 min

信号质量二重奏:CoVer 验证器协同训练与 DENSE 轨迹蒸馏 精读

本文合并精读两篇同主题论文:CoVer(UT San Antonio)与 DENSE(复旦+美团)。二者共同回答 RL 与智能体自改进中「信号从哪来、可不可信」这一核心问题。CoVer 在单策略 GRPO 内协同训练 coder 与 verifier,用协方差门控的互信息奖励挤出退化测试、用三级去重降低估计方差,把「自生成测试的信息价值」变成可证明的训练信号;DENSE 在完全结果盲视(无奖励、无验证器、无标签)下,把一条执行轨迹蒸馏成证据接地的嵌套 shortcut 树,用 REFIT 协议隔离出反馈这一唯一信息通道。文章从背景、定位、问题定义、解法、评估、根源、知识反推到通用灵感和交叉验证表,系统梳理两条「信号质量」路线如何从不同方向逼近同一结论:高质量信号胜过信号特权。

September 22, 2026 · 4 min

Self Improvement via Fast Tree-search 精读

MIT 与 Sakana AI 的 SIFT 把递归自改进(RSI)编码智能体的最大瓶颈从’生成候选’移到了’验证候选太贵’:用 pairwise LLM-as-a-judge(每次 $0.044)+ 正则化 Bradley-Terry 聚合替代 $6.0 的基准子集评估作为中间信号,在完全解耦的树搜索流水线中让扩展与评估并行。Polyglot-225 上以 DGM 约 1/10 的 CPU 小时拿到 31.1%(Qwen3-30B)/35.1%(o3-mini)全面超越 DGM/HGM/SICA,TerminalBench 2.1 从 29.2% 提到 36.7%。本精读覆盖’便宜排名+昂贵验证’分离范式的机制因果、judge 输入格式的消融证据、与 DGM 谱系的定位对比,以及’把验证成本当一等公民’的通用性灵感。

September 21, 2026 · 4 min

An Empirical Study of Harness Design for Coding Agents 精读

UMass Amherst、Emory 联合 Zoom 的实证研究,把编码智能体 harness 从’黑盒整体评估’拆解为组件级受控实验:固定执行循环,只变化规划、动作空间、上下文管理三组件,在 4 个模型 × SWE-Bench Verified + Terminal-Bench 2.1 上跑出 176 组匹配设置。四个条件性发现——上下文管理在预算收紧时价值陡增(主要靠防溢出)、‘规则删略+LLM 摘要’分阶段策略效率最优、规划对弱模型是准确率支架对强模型是成本节省器、bash 熟练模型用纯 shell 更省——为’harness 设计是条件科学而非玄学’奠定第一块实验基石。

September 19, 2026 · 2 min

ProgramDistill 精读:从交互式 Web 应用逆向蒸馏可验证的 SWE 任务基准

KAIST × Microsoft Research Montréal 发布 ProgramDistill:现有 SWE 基准用 issue 文本规定行为,但真实 Web 开发中 Agent 需要从能运行的参考应用反推行为并实现到残缺应用里。mine-craft-patch 流水线把 26 个交互式应用因子化为特性,经 gold patch 回放验证产出 1,975 个可回放行为、4,063 个任务,全程零人工。9 个前沿编码 Agent 评测:GPT-6 Astra 全应用重建 49.2%、Opus 5 28.8%;恢复深度从 1 到 8,成功率从 100%→64% 崩落——难度首次可参数化调控。

September 18, 2026 · 2 min

XConf(Confidence Comes from Experience)与 Not All Agents Are Equal 精读:Agent 可信性的两翼

本篇合并精读两篇互补的 Agent 可信性研究:剑桥×Google DeepMind 的 XConf 提出『置信度不该只看当前推理,还要检索自身历史经验』——Recall 相似任务的过往胜率、Reflect 命名复发失败模式后重述置信度,以 1/10 成本在 24 组对比中 23 组追平/超越 10-sample 自一致性,弃答最不确定 10% 换来 Agent 成功率最高 +8.7 分;德州理工的 Not All Agents Are Equal 则用 37,623 个溯源 PR 首次大规模量化『AI 编码 Agent 的代码落地后发生了什么』——Codex 的 revert 率只有人类一半、Devin 反而更高,质量差异是厂商特定的而非『AI 代码更差』的笼统印象。

September 18, 2026 · 3 min

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries 精读

SWE-bench Verified 榜首之争还是能力之争吗?对 254 个公开提交的逐实例审计给出否定答案:Top10 系统 500 题中 285 题全对、51 题全错,仅 164 题有区分力;29 对相邻排名精确 McNemar 检验 0 对可分;同模型换 scaffold 分差可达 29.8pp 而前十总差距仅 8.8pp。论文提出 n_eff 有效规模、对基线嵌套系数两个新构造,证明’解集嵌套’是分辨率丧失的机制,并给出五步审计协议与修复方案(报 n_eff、记录 model×scaffold、发布 tier、按不一致预算纳新题)——对一切正在构建内部评测选型基准的团队有直接方法论价值。

September 17, 2026 · 3 min

ExecuCritic × AgentGuard × RepoAtlas × Protocol Trimming 精读:编码智能体可靠性四重奏

四篇互补的 coding agent 可靠性研究合读:Intel×北大的 ExecuCritic 给 RLVR 加’校准 critic 塑形’——ρK 秩相关门控让 critic 失准自动坍缩,SWE-bench Lite +3.7pp 且 sandbox 执行省 42%;York 的 AgentGuard 从 642 条异常轨迹自动学条件激活护栏,异常执行率 69.0%→26.7%(代价:过度拒绝 19.3%);北航 RepoAtlas 用 select-project-refresh 演化多模态仓库视图,三 VLM 一致 +2.4pp 且 token -5.8%;Intuit 工程报告量化协议保持裁剪——常规裁剪成功率 66.6-77.3% vs 协议感知 92.2%/自适应护栏 96.0%,临界阈值随复杂度上移。合读视角:可靠 coding agent 的四层防线——训练时(奖励塑形)、执行时(护栏)、探索时(上下文视图)、压缩时(协议保持)。

September 17, 2026 · 3 min

从背调被拒到 65k Star:Archify 作者的开源自证之路

鱼皮直播对谈 Archify 作者橙子(网名「也无风雨也雾晴」):一个高中辍学打过零工、参军退伍、专升本第一名考入重庆邮电大学的开发者,两次在大厂背调环节因学历被拒后,靠开源项目 Archify——AI 生成可验证架构图的 Agent Skill——登顶 GitHub Trending,目前 6.5 万 Star。对谈展开的不仅是逆袭故事,还有 AI 编程时代的真实体感:注意力被稀释、Skill 内化进模型、极简 Harness 的 token 经济学,以及开源作为普通人「第二简历」的机制。

September 17, 2026 · 2 min