Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读

在 IOI 2026 上,一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分,超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径:22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距,以及’纯 SFT 的 Ultra 反超 SFT+RL 的 Nano’背后的并行采样机制。

September 4, 2026 · 3 min

Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills 精读

自主 ML 研究 agent 缺的不是更强的模型或更聪明的流程,而是’怎么把方法跑通’的操作知识层。BAAI 联合中科大、人大、港理工提出 DisCo 蒸馏框架,把 1000 个 GitHub 仓库蒸馏成 5353 个经过验证的技能,构建 AREX-Skill Library。在固定 GPT-5.5+Codex 的对照实验下,技能让 MLE-bench 相对提升 134.3%、PaperBench 提升 34.4%、FrontierCS 提升 9.2%、PassNet 提升 14.0%,并以更低 token 消耗帕累托支配 Claude Code。本精读拆解技能图三层结构、四阶段蒸馏流水线、对照实验设计,以及’试错成本越高、操作知识价值越大’的机制根源。

September 4, 2026 · 3 min

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? 精读

Agent 每天与环境交互积累海量轨迹,但经验真的变成了能力吗?ByteDance Seed 姊篇基准 S3Gym 把’自改进’拆成自测试、自判断、自改进三个可测环节,在 7 个可执行验证的文本游戏上比较三种经验注入通路:原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现:自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5,换摘要记忆暴跌到 33.2;同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录,以及’经验压缩可行性决定通路优劣’的机制规律。

September 4, 2026 · 3 min

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory 精读

港中深联合美团 LongCat 团队提出 DiagEvo:自进化自博弈中 solver 常平台化甚至衰退,现有方法靠难度/多样性信号出题却不指明’该修哪个弱点’。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按’错误原因→主题→实体’三层组织、定向采样未解决错误因生成新题,辅以双置信度过滤与自由探索。三个 solver(Qwen3-4B/8B、OctoThinker-8B)在九个基准上全胜 R-Zero/DARC 等基线;消融显示去掉分层错误记忆数学均值掉 3.8 分(最大组件贡献)。与 HarnessEvolve 同日揭示同一趋势:显式诊断信号优于隐式统计信号。

September 3, 2026 · 2 min

Harness Engineering: Anatomy, Architecture, and Evolution of Coding Agents — A Source-Code Study of Eleven Systems 精读

Wavestone AI Lab 对 11 个生产级编码 agent harness(Claude Code、Codex CLI、Gemini CLI、Mistral Vibe、OpenHands、Aider、Mini-SWE-Agent、Hermes、Pi、OpenCode、OpenClaw + 元 harness 对照 Omnigent)做源码级解剖:定义 harness 七大子系统、产出 13 条跨系统观察、29 个重复设计模式、18 条设计建议与 90 行最小 harness。关键发现:7/11 系统收敛于阈值触发 LLM 压缩的记忆管理事实标准;提供商抽象呈五档光谱;Codex 已把 per-model 提示作为服务器端数据运行时下发。这是’harness 工程’学科的第一部解剖学图谱。

September 3, 2026 · 2 min

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement 精读

上海AI实验室提出 Harness-of-Harness(HoH):在现有编码 agent harness 之上再组织一层’规划-开发-测试’循环,通过双状态传递(制品态+证据态)、有界增量目标与独立 QA 验收,让 LLM 编码智能体实现多日自主软件开发与持续改进。三个 harness-模型对在 GameCraft-Bench/FrontierSWE/ProgramBench 上平均相对提升 52.25%,FrontierSWE 十轮迭代从 22% 升至 72.67%,并用 70+ 迭代自主开发出可玩的 FPS 游戏。本文从问题抽象、机制因果到通用灵感逐层拆解。

September 3, 2026 · 4 min

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? 精读

ByteDance Seed 联合 SUTD/GaTech/M-A-P 发布 HarnessDev——首个把评测单元从’任务输出’改为’可运行基础设施’的基准:creator LLM 从无策略弱种子构建完整 harness(Creation),再基于下游执行反馈迭代改进自己的 harness(Evolution),在 2207 个下游实例上按 capability+efficiency 双轴评估。核心发现:模型自建 harness 在 writing/MLE 域追平甚至反超人类参考系统,但在 code/search 域差距显著;Evolution 的增益不稳定且严重绑定 executor;换 executor 后最高回退 10.32 分。这为’harness 工程能否自动化’提供了第一份系统性体检报告。

September 3, 2026 · 5 min

HarnessEvolve: Learning from Reference Trajectories for Reliable Agent Self-Evolution 精读

华为 ICT AI 能力中心提出 HarnessEvolve:针对自进化 agent 的三大失败模式(终态反馈导致的信用分配失败、捷径学习、灾难性遗忘),用’参考轨迹对齐’提取逐步误差信号、双门控(质量门+性能门)过滤候选更新、epoch 末 held-out 验证选最优快照。在企业内数据集 CloudCoreNetwork-QA 上把 Qwen3.6-27B 从 43.4% 拉到 86.9%(超最强基线 GEPA 21.6 个百分点),开源三数据集全胜 GEPA/ACE/SkillOpt,且在 OpenClaw 上优化的 skill 可迁移到 OpenCode/LAMAgent 等四个框架(SpreadsheetBench 最高 +30.4 分)。

September 3, 2026 · 3 min

Skill Following: Evaluating Actual Skill Use in Retrieval-Enabled LLM Agents 精读

崇实大学提出 Skill Following(SF)评测框架:现有’检索 vs 不检索任务的聚合分差’衡量技能库价值存在严重选择偏差。论文形式化 RAE(Retrieval-Invoked Actual-Use Effect)指标——仅在 agent 主动发生检索的任务上,比较同一任务开/关技能的配对执行差。17 个 LLM × 编码(MBPP+)/数学(Math500)的实测揭示’评测悖论’:多个模型聚合检索提升为正、RAE 却为负——系统层面看似受益,恰恰在真正调用了技能的任务上反而有害。诊断分析证明’上下文出现技能内容’远不等于’模型遵循技能’,当前工具使用能力被系统性高估。

September 3, 2026 · 2 min

WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读

KRAFTON 联合 KAIST/Stanford 提出 WHALE(Weight-Harness Alternating LEarning):把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h),交替执行’当前 harness 下在线拒绝采样微调’与’更新后模型上 Meta-Harness 搜索’两阶段,用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上,比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点,且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从’权重+文本提示’扩展到’权重+完整可执行 harness’的交替优化配方。

September 3, 2026 · 3 min