Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读

Purdue 团队对当下最火的 On-Policy Distillation(OPD)发起了一次釜底抽薪式的追问:教师监督噪声率高达 30%–50% 且随教师规模上升,学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到’低 logp token + 负优势’才是真正驱动力后,论文提出零监督的 OPSA(熵自适应负优势自改进),在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。

September 2, 2026 · 3 min

PaperGym: Rubric-Centered Evolution for Research-Plan Generation 精读

浙江大学与 Apple 联合团队的 PaperGym 把’每篇论文’变成一个完整的 RL 训练环境:问题从研究目标+背景合成、评分准则(rubric)从方法+实验部分导出,从源头把准则泄漏率压到 3.7%(现有数据集为 11.9%–34.1%)。用 rubric 先当 OPSD 自教师的特权上下文、再当 GRPO 的奖励,Qwen3-8B 训练后在 ResearchQA 达 73.48 分超越更大的 Kimi K2.6。这项工作解决的是 AI 科学家落地的核心卡点——研究计划这类’没有可验证答案’的开放任务如何获得可靠的 RL 奖励。

September 2, 2026 · 2 min

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读

美团联合上海交大、中科院自动化所提出 AdaThinking-E,用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化,前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡,后者只关心答案质量,从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上,7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果,OCR-Reasoning 相对基座提升 10.8 个百分点,实现了该想才想、不该想不想的效率与精度兼得。

August 31, 2026 · 3 min

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读

深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot:一个主动上下文管理框架。针对现有方法工具集贫乏(只有搜索/删除/摘要)、探索低效(上下文编辑动作影响悬殊却被均匀采样)、信用分配粗粒度(轨迹级奖励平摊给所有编辑动作)三大缺陷,它扩展出规划、长期记忆、软卸载三类工具,并用上下文变化量+熵变化识别关键编辑决策做分支采样(context-aware partial rollout),再用所有后续分支的平均回报估计动作级优势(细粒度信用分配,方差降为 1/n)。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85;深搜任务上每轮输入 token 稳定在 8-10K(基线线性涨到 30K);消融证明细粒度信用分配贡献最大且在全部基准一致提升。

August 31, 2026 · 5 min

HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读

深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀,逐轨迹独立训练重复计算共享前缀(实测冗余约 5.63 倍);而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型(MLA+KDA 的 Ling-3.0-tiny)上实现任意 rollout 树的前缀共享:联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍,logit 余弦相似度大于 0.9997,在线训练奖励趋势与基线一致。

August 31, 2026 · 4 min

Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification 精读

工具增强 LLM 已经能消灭绝大多数计算与语法错误,但一个隐蔽的失败模式仍在:公式用对了变量却用错了——推理步语法完好、数学可执行、量纲一致,却完全脱离题意。本文提出 NS-PRM,把『推理正确』解耦为符号有效性 V 与语义接地性 G 两个维度:确定性符号验证器(JSON Schema 语法检查+数学等价+Pint 量纲分析,覆盖 128 个计算原语与 15 个逻辑原语)作为硬过滤器保证 V;PRM 只在验证器接受的空间上对 G 条件评分。训练侧引入反事实符号扰动 CSP,算法化生成『完美通过验证器但逻辑错误』的硬负例;推理侧采用验证器优先的约束 beam 搜索。最终 ProcessBench 平均 F1 达 74.2、PRMBench 77.3,均超 9 个 PRM 基线;同等算力下 beam 宽度近翻倍,MATH 零额外成本提升 4.5 个百分点。

August 31, 2026 · 3 min

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读

深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究’无预设问题、无预设证据’的全文科学错误检测:构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K(12,900 样本、6 类错误),用 DAPO 算法与三维奖励(推理完整度+证据对齐+错误精确度)训练 Qwen3-VL-8B,Scan 综合分从 2.0 升至 19.5,超过 235B-Thinking 模型;消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差,三维奖励与混合课程缺一不可。

August 31, 2026 · 4 min

REPLICANT: Learning Policies for Evading and Hardening Malware Detectors 精读

伦敦国王学院、Alan Turing研究所、UCL、鲁汶大学等多机构联合提出REPLICANT,把Android恶意软件的问题空间逃逸从『逐样本优化』重构为『策略学习』:在严格label-only黑盒威胁模型下,用分层PPO学习改什么(能力选择)与何时查(查询时机),产出的策略可跨样本、跨检测器架构、跨特征空间迁移——全部1764个代理/目标组合平均ASR 78.8%,比最强基线相对提升20.9%-39.2%;策略迁移(78.8%)远超样本迁移(43.3%,相对+82%)。反哺防御侧,AT-REPLICANT靠随机策略训练全程收集多样对抗样本,使白盒REPLICANT与APG残余ASR压到17%以下,而AT-APG对REPLICANT_WB仍暴露62.4%漏洞;针对时间漂移提出的RAL把主动学习与对抗训练交织,同时保住性能(49.0)与鲁棒性(0.6%)。总计379,680次攻击评估为该领域迄今最大规模。

August 31, 2026 · 2 min

VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning 精读

长时程智能体 RL 的核心难题是信用分配:稀疏的终端奖励被广播给轨迹里每个动作,成败的原因被抹掉了。现有方法从 rollout 侧构造代理信号(重复状态、轨迹图、语义邻近、事后复盘、分支采样)估计动作重要性,却把判定成败的验证器当成一个标量奖励丢掉了内部结构。清华大学、西安交通大学与嘉兴南湖大学提出 VICT,把程序化验证器拆解为可执行原子,通过写入/揭示/提交/违例四类见证谓词把原子回溯到具体动作,仅沿这些证明边重分配组相对优势。ALFWorld 93.7%、WebShop 严格成功 83.6%,消融排除了稠密原子奖励、仅提交信用、时间邻近等简单解释,且可与 rollout 侧方法叠加。本文按九部分结构精读其机制与证据。

August 31, 2026 · 4 min

WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读

多模态搜索智能体常被环境拖后腿:许多搜索环境只把网页转成文本喂给模型,工具返回的图片直接丢弃,号称多模态的轨迹实际退化成纯文本推理;长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness,把检索图像注册为可寻址的持久状态并跨轮回灌,配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench,基于 30B 模型在 8 个基准上取得 55.97% 平均分,媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。

August 31, 2026 · 4 min