Critical-State RL:为多轮工具调用诊断「可训练的模型调用」 —— 精读

深度精读 Salesforce AI Research 的 Critical-State RL。它指出多轮工具调用失败往往卡在单个模型调用上,但「奖励有差异」并不等于「该调用值得训练」。方法先用训练前三闸门诊断(动作充分性 / 提升空间 / 可训练性),再用嵌套同前缀采样分离「动作依赖奖励方差」与「后续噪声」,最后只对选中的关键调用做 occurrence-local RL(上下文赌博机式训练)。BFCL 上对缺失函数任务 miss_func 恢复率 0.14→0.283(+14.3pp),错位训练反而 −4.5pp;记忆子任务 34.54%→50.54%;Nemotron 重复调用一致性 37%→75%。

September 23, 2026 · 4 min

DSec(DeepSeek Elastic Compute): 面向规模化 Agentic 训练的可扩展沙盒基础设施 精读

DSec(DeepSeek-AI + 清华大学)提出一套面向规模化 Agentic RL 训练的可扩展沙盒基础设施。它用三大支柱解决「海量环境、高密度资源、按需镜像」的难题:可组合环境层(overlayfs + EROFS,把 O(mN) 镜像数降到 O(m))、高密度资源管理(virtio-pmem+DAX+DAMON+核调度,microVM 峰值内存降 40.2%)、3FS 按需镜像加载,并把 Agent 循环与可抢占 GPU 解耦以支持弹性训练。实测 8192 容器突发比 eager Docker 快 1.71×、磁盘写少 57%,规模达 300 万沙盒/日、峰值 38 万并发、>5000 个/秒创建。本文按九部分结构精读其架构、关键技术与实验,并通过外部检索交叉验证 serverless 沙盒(SAND/RunD)与 RL 训练基础设施(AgentGym/AgentScale)等相关工作。

September 23, 2026 · 5 min

FLARE:用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读

深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型(GRM),输出结构化的步级风险诊断(风险等级+错误类+修复建议),在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励,首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%,token 省 5×;ROC-AUC 75.74%;SFT 相对提升 19.13%,RL 平均提升 9.19%。

September 23, 2026 · 4 min

IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读

IER-OPD(MBZUAI + 蚂蚁集团)研究同策略蒸馏(On-Policy Distillation, OPD)中一个反直觉的事实:训练学生模型时,绝大多数 token 的梯度几乎不携带有用学习信号,只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解,定义信息效率比 IER = 信号/噪声,并据此设计候选集近似与 soft OR/AND 多准则融合,用 IER 分数筛选「高信息效率」的 token。实验显示:仅用 0.1% 的 token 预算,AIME26 即可达到全量训练的近乎持平(58.9 vs 59.9);1% 预算下 AIME25 甚至超过全量(17.0 vs 14.4),且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验,并通过外部检索交叉验证 on-policy distillation(MiniLLM、GKD)与稀疏 token 选择等相关工作。

September 23, 2026 · 5 min

One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)

阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。

September 23, 2026 · 6 min

CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读

CodeMidas(小米 LLM Core 联合北大、港大、人大)提出用源代码作为唯一输入,把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习(RL)环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线,CodeMidas 首次做到五项开发记录全免,覆盖 3,185 个代码库、23 种语言、15 个领域,经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5,在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升(DeepSWE +11.7pp、ProgramBench +17pp)。消融证明「质量>数量」:清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。

September 22, 2026 · 6 min

信号质量二重奏:CoVer 验证器协同训练与 DENSE 轨迹蒸馏 精读

本文合并精读两篇同主题论文:CoVer(UT San Antonio)与 DENSE(复旦+美团)。二者共同回答 RL 与智能体自改进中「信号从哪来、可不可信」这一核心问题。CoVer 在单策略 GRPO 内协同训练 coder 与 verifier,用协方差门控的互信息奖励挤出退化测试、用三级去重降低估计方差,把「自生成测试的信息价值」变成可证明的训练信号;DENSE 在完全结果盲视(无奖励、无验证器、无标签)下,把一条执行轨迹蒸馏成证据接地的嵌套 shortcut 树,用 REFIT 协议隔离出反馈这一唯一信息通道。文章从背景、定位、问题定义、解法、评估、根源、知识反推到通用灵感和交叉验证表,系统梳理两条「信号质量」路线如何从不同方向逼近同一结论:高质量信号胜过信号特权。

September 22, 2026 · 4 min

RetireOPD × EOS 终止符失配:在线策略蒸馏动力学二重奏 精读

两篇同日论文从训练动力学层面解剖在线策略蒸馏(OPD)。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突,于是让学生在分歧停止收缩且达到教师成功率阈值时自动’退休’教师,ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级:基座学生与后训练教师可能把停止概率放在不同 EOS token 上(即使声明停止集相同),把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读,构成’OPD 何时该用、何时会坏’的完整图景。

September 19, 2026 · 2 min

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读

上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』:蒙特卡洛估计的状态价值在响应内剧烈变化,critic 预测却近乎水平线。诊断出两大根因(MSE 隐含方差惩罚+相邻状态冗余更新)后提出 SP3O:每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp,K=3 优于 K=64,越稀疏越好——一个『少即是多』的教科书式发现。

September 18, 2026 · 3 min

ExecuCritic × AgentGuard × RepoAtlas × Protocol Trimming 精读:编码智能体可靠性四重奏

四篇互补的 coding agent 可靠性研究合读:Intel×北大的 ExecuCritic 给 RLVR 加’校准 critic 塑形’——ρK 秩相关门控让 critic 失准自动坍缩,SWE-bench Lite +3.7pp 且 sandbox 执行省 42%;York 的 AgentGuard 从 642 条异常轨迹自动学条件激活护栏,异常执行率 69.0%→26.7%(代价:过度拒绝 19.3%);北航 RepoAtlas 用 select-project-refresh 演化多模态仓库视图,三 VLM 一致 +2.4pp 且 token -5.8%;Intuit 工程报告量化协议保持裁剪——常规裁剪成功率 66.6-77.3% vs 协议感知 92.2%/自适应护栏 96.0%,临界阈值随复杂度上移。合读视角:可靠 coding agent 的四层防线——训练时(奖励塑形)、执行时(护栏)、探索时(上下文视图)、压缩时(协议保持)。

September 17, 2026 · 3 min