SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读

SPADE 由九所高校联合提出,让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色:前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示,后者解题学习。Designer 的奖励是提示前后的回报差(hint-based regret),能持续瞄准学习前沿,配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3(较 base +8.1),工具使用基准 ACEBench-Agent +13.9,验证了环境设计本身可学习这一迈向开放式自提升的关键一步。

August 24, 2026 · 5 min

Credit Without Ground Truth: 步级信用分配的执行回放审计 精读

USC 单作者论文用「执行回放」为 LLM Agent 的步级信用信号建立因果真值:在每个决策点重采样策略自身支持的动作并前滚,度量结局分布的实际改变。审计结论是全面否定——LLM judge 分数、结果条件化 logprob 比、策略自身置信度识别因果关键步骤均不优于随机;implicit 信用实为策略流畅度的回声(秩相关 +0.75),结果条件化不增加任何因果信息(偏相关 -0.004);七臂预注册训练实验中无一臂可靠超过未训练策略,表面差异全由训练剂量解释。本文精读其仪器设计、否定性证据链、剂量匹配协议与完整性分类学,并讨论它对整个步级信用分配赛道的冲击。

August 23, 2026 · 7 min

MidTool: 面向Agent工具使用的中期训练数据合成 精读

工具使用是 LLM Agent 的核心能力,但此前几乎全靠后训练习得。MidTool(华盛顿大学 + Snowflake + UNC,工作完成于 Snowflake 实习)提出首个面向通用工具使用的开放中期训练语料管线:从网页、PDF、代码、真实 API 与 MCP 技能四类源出发,经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix,中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上,两种后训练配方下均一致超过 SFT-only 基线,RL 通常进一步放大增益,MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。

August 23, 2026 · 6 min

MileGPO: 里程碑推断的长程Agent过程级信用分配 精读

北交大团队提出 MileGPO,针对长程 LLM Agent 训练中最棘手的过程级信用分配问题:GraphGPO 等图方法按最短路径距离赋信用,只能刻画「可达性」而非「可靠进展」。MileGPO 从同一 rollout 图中挖出三类被忽视的信号——成功轨迹的候选里程碑、失败轨迹的反复陷阱、同状态兄弟分支对比——经可靠性加权塑形 RCS 与进度对比校准 PCC 两级校准后注入优势估计。ALFWorld 整体成功率 94.60,超 GraphGPO 3.13 点、超 GiGPO 4.43 点;ID–OOD 差距仅 1.69 点;WebShop 同状态平局率达 72.7%,图上 83.0% 的平局可被 RCS 纠正。全程零辅助模型、零额外环境交互,本精读重点拆解「共享状态覆盖率相同、歧义结构决定增益」的机制因果链。

August 23, 2026 · 5 min

One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读

微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准:507 个政策条件化的有状态业务工作流,覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域,用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%,pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%,暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟;79,853 次失败试验中 80.88% 干净终止且含写操作,证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。

August 23, 2026 · 7 min

Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

深度精读 Phantom Gains——一篇审计 LLM 自训练’自我改进’证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时,转移统计本质上是两个噪声估计的差分,极易产生’幻影增益’。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线,识别出七类测量失效——每一类在缺少控制时都会反转结论:单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案(逐问题精确检验 + 合并基线池 + FDR 控制)在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示:外部蒸馏能改善 base 模型未触及的问题而三种自训练不能,回归分析以 p<10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩:每个报告的统计量都需要单独测量的 null。

August 22, 2026 · 3 min

Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读

当低资源语言推理微调只被一个准确率数字评判时,我们到底在测什么?Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验,发现最佳微调 arm 76.5 分竟低于基线 77.2 分,而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导,几乎不携带信息。改用六维行为度量后结论完全翻转:SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍;RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零,且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。

August 22, 2026 · 4 min

Agent Lightning v1.0: Towards Harnessed Agentic RL 精读

微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0,首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时,训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战,以约3500行代码给出参考实现,仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%(+14.6个百分点),并公开完整数据清洗管线与防reward hacking脚手架。

August 20, 2026 · 3 min

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读

新加坡国立大学、南方科技大学与牛津大学团队论证:在长程agent微调场景中,进化策略(ES)不只是更便宜的RL替代品,而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化,GPU显存与推理持平(8.41GB,比GRPO低85.7%),在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点;WebArena-Lite上完成27B模型全参适配(29.47%→36.16%),并支持prompt-参数协同进化。

August 20, 2026 · 3 min

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读

当推理能力超越人类可靠评估的范围,真值标签反而成为最稀缺的资源。Co-RL 给出的答案是:让多个不共享参数、来自不同家族的模型组成『学习共同体』,彼此用多数票伪标签互为奖励源。理论上,论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化;而交叉监督把正确收敛盆从『每题各自 p>1/2』扩大到『pA+pB>1』,互补性可以直接兑换正确性。实验上,4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%,5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%,Gemma-3-12B 甚至反超有真值监督的 GT-Reward。

August 20, 2026 · 7 min