Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

ReproAgent: Contract-Guided Paper-to-Code Reproduction 精读

ReproAgent(北航+上交+北大等纯高校合作)把论文复现代码生成失败归因于「split-specification」:显式的论文义务在长 agent 轨迹中漂移丢失,隐式的框架默认与仓库惯例根本不在论文里。它用持久化双通道实现契约对症下药——需求通道把论文片段钉成带 id 的代码义务,证据通道从参考文献仓库检索内容与结构证据,双双绑定到文件级契约并贯穿 Prepare–Plan–Generate–Repair 四阶段。在 PaperBench Code-Dev 上以 Claude-Sonnet-4.5 达到 73.7 分刷新纪录,同骨干对比超最强基线 9.2 分,通道消融显示去掉任一通道平均掉 14+ 分。本精读拆解其契约机制、覆盖不变量设计与两通道分工的因果证据。

August 27, 2026 · 3 min

SPECMINE: A Large-Scale Corpus of Spec-Driven Development Artifacts 精读

深度精读 CMU 数据集论文 SPECMINE(MSR 2027 Mining Challenge 数据集):对 GitHub 上 47 万个 spec 文件、7.3 万仓库的全面普查,配合 5992 个 spec 触碰 PR 与 242 万条类型化引用索引,首次让「AI 时代的软件如何被规格化」从诞生之日起可大规模研究——99.7% 的 spec 首次提交于 2025 年之后。

August 27, 2026 · 3 min

The Handoff Tax: Continuing Non-Native Trajectories in LLM Agents 精读

AWS Agentic AI团队用58,000次agent运行、200万次API调用、360亿token的系统实验,测量了coding agent中途切换模型的隐性代价——Handoff Tax。核心发现呈方向二重性:升级(便宜模型→贵模型)时Raw全轨迹移交只恢复不到一半质量差距且成本可达LC的4-6倍,Claude家族下甚至被’弃用重启’严格支配;降级(贵模型→便宜模型)却是甜点区,保住大部分质量同时省下大头成本。最有工程价值的是接口反转现象:升级时应丢弃前模型的轨迹只留代码改动,降级时恰恰相反。本文从实验设计讲到成本机制分解,给出模型切换策略的实操建议。

August 27, 2026 · 2 min

TraceML: An Empirical Analysis of Human-Agent Planning in Machine Learning Development 精读

深度精读 CMU 论文 TraceML:首个任务对齐的人机 ML 开发过程级配对语料,把 4465 条人类 Kaggle 轨迹与 207 条 agent 轨迹放进同一版本级标注体系,量化诊断出 agent 的「无记忆搜索」病症——不转向也不回访,一条约千 token 的规划提示能在 7 个竞赛中 5 个提分,但指令只能关闭「可命名」的那部分差距。

August 27, 2026 · 2 min

Apodex 1.1: Scaling Agentic Intelligence for Complex Work 精读

Apodex 1.1(Apodex Team)提出’双扩展面’范式:把任务环境构建(Environment Scaling)与多智能体协调(Agentic Coordination Scaling)确立为与模型规模并列的两个扩展维度。Agent Team 架构把任务分解、异步委派、非对称验证、重规划训练进模型策略,在 GDPVal 拿到 78.8 win rate、IMO-2026 数学超金牌线、SWE-bench Verified 77.7%,且全部开源(含 35B mini 版权重)。本精读重点拆解其’正向便宜、逆向昂贵’的验证器设计与 Agent Team 协调增益的机制来源。

August 25, 2026 · 2 min

AsmEvo: Agentic Assembly-Level Optimization of AMD GPU Kernels with Functional Equivalence Verification 精读

深度精读 AMD 与南方科技大学合作的 arXiv 2026 论文 AsmEvo:当 GPU 内核源码不可得、部署二进制是唯一行为基准时,用智能体直接在汇编级优化已编译的 AMDGPU code object。恢复可重汇编表示、profiling 定位热窗编辑、ABI 保持重建、差分验证门控接受,在 MI308X 上让 30 个 KernelBench 内核中的 29 个提速,几何均值 1.35 倍、最大 3.88 倍;MI300X 生产负载(AITer、vLLM、SGLang)全部提升且全程保持功能等价。

August 25, 2026 · 4 min

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces 精读

AutoSaddler(Microsoft × POSTECH × KAIST × 南方科技大学)把 Agent harness(提示词/工具/中间件)的优化形式化为离线 mini-batch 学习问题:深度诊断 Agent 读执行轨迹定位根因、生成结构化 patch(Prompt/Tool/Middleware 三类九子型)、Reflection 提炼经验存入 EvoDAG 进化图、泛化感知选择防过拟合。GAIA2 +9.0pp、SWE-Bench Pro +9.6pp、Terminal-Bench 2.0 +10.0pp 全面超越人工与自动基线,且学习轨迹只需最强基线的 1/10。

August 25, 2026 · 2 min

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis 精读

深度精读港中深与西安交大团队的微服务根因分析(RCA)轨迹级研究。指出现有评测只看“是否定位到责任服务”的终点指标,无法揭示诊断证据与故障传播路径。作者人工标注服务级故障传播路径,对齐分析3500条智能体诊断轨迹,发现答案正确性与诊断质量脱节,并将错误诊断归结为三类证据处理失败,进而设计DIAGGUARD两段防御(前置grounding+后置verification),在跨模型、跨基准、跨拓扑的独立验证集上把Acc@1从43.5%提升到52.5%。

August 25, 2026 · 3 min

Disagree to Explore, Agree to Commit: Routing-Guided Test-Time Scaling for Software Agents (Risa) 精读

Risa(复旦大学)首次把稀疏 MoE 模型的原生路由轨迹用作软件 Agent 测试时扩展的’行为坐标系’:把每层每 token 的专家路由权重积分成路由指纹,探索阶段选与历史最不相似的候选(disagree to explore),写补丁阶段在同伴收敛处提交,跨尝试仲裁取’决策 token’上一致性最高者(agree to commit)。SWE-bench Verified 宏平均 44.9%→48.2%,跨家族迁移到 Qwen3.6 仍 +3.5pp——全程无需外部 judge、无需测试执行。

August 25, 2026 · 2 min