SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读

把长上下文推理教师的能力蒸馏给异分词器短上下文学生,会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD:在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本,仅对占据完全相同文本跨度的token配对监督;配合终止token优势屏蔽+学生参考KL损失,截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2(+21.2分),超越Gemini-2.5-Pro,跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。

August 18, 2026 · 1 min

AQuA: Recursively Self-Improving Quantitative Trading Research Agents 精读

深度精读普林斯顿、蚂蚁集团与斯坦福联合论文 AQuA:用两个互不共享记忆的语言模型研究系统分别做因子发现与模型开发,靠“密封沙盒+非对称自由”把防泄漏做成构造性质——agent 只能写受限 DSL、搜索只看验证集分数、测试窗口冻结后只评一次。加密货币 5 分钟数据组合信号 IC 约 0.190,美股 30 分钟 held-out 每股 IC +0.0843、Sharpe@2bp 最高 +2.50,2021–2025 逐年为正。

August 17, 2026 · 5 min

Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读

深度精读 2026 年 8 月 arXiv 论文 CREST:面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」,让自教师只调幅值、不碰方向,从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%(较基座 +29.88),13/14 项最佳,长上下文与 Session 级指标增益最大。

August 17, 2026 · 5 min

Full-bandwidth transformer 精读

Full-bandwidth transformer(微软+JHU+普林斯顿,含 John Langford)指出自回归 Transformer 的垂直反馈通道极窄:步间只回传一个采样 token(至多 log2|V| 比特),顶层隐状态被直接丢弃。论文提出潜反馈解码(latent feedback decoding),用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端,配合多 pass 训练目标、渐进调度与 prefix mixin,在 1B 模型 400B token 预训练中验证:Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降,每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。

August 16, 2026 · 5 min

Massive Activations in Hybrid Linear Attention Large Language Models 精读

混合线性注意力(HLA)LLM 用少量全注意力层搭配大量线性注意力层来兼顾长上下文与效率,但巨量激活(Massive Activations)在其中如何表现此前几乎无人研究。本精读覆盖首个系统性分析工作:论文发现两种与架构严格对齐的激活形态——注意力前尖峰(PAS)与尖峰间平台(ISP),在 5 种线性架构、6 种混合配置、5 个数据域、1.2B–397B 的 12 个开源检查点上高度复现,Sink-spike 对齐率高达 99.4%–100%;并提出统一的「写入-汇聚-抵消」生命周期机制:MA 的抵消时机决定形态——快速抵消形成 PAS,延迟抵消形成 ISP,全注意力极限下恢复传统 LLM 的稳定 MA。门控实验的不对称效应进一步印证全注意力层是组织 MA 动力学的核心节点。

August 15, 2026 · 5 min

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读

编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改,谁贡献了通过、谁制造了失败,传统方法无法区分。DiDPO 从代码 diff 的结构出发,用「可分组性分数」动态选择锚点,把完整 diff 切成可比较的子 diff 组,把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%,并附带开源 verl-code 代码库。本精读按九部分结构拆解:从背景、定位、问题抽象、解法、实验证据到优势根源的因果链,再到必要知识反推与通用性灵感。

August 11, 2026 · 8 min

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读

当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时,SFT(监督微调)和 RL(强化学习)会表现出截然相反的行为:SFT 在多阶段训练中因梯度方向冲突而性能崩溃,RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式,首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异,并提出 Parallel-RL 范式——各任务独立 RL 后合并参数,在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异,建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。

August 11, 2026 · 9 min

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读

AgentOPSD 把 Agent 强化学习中长期被回避的’信用分配’难题重新拉回中心:在多轮交互、稀疏奖励的 Agent 任务里,GRPO 这类方法只能把最终成败均摊到每个动作上,导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师(注入了成功技能 c+)与学生之间的 token 级对数概率差聚合为 turn 级证据,再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k,最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把’稀疏结果监督’转化为’每一步的密集信用’,在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%(+7.9pp),长程任务每轮交互衰减仅 0.54 点(GRPO 衰减 2.91 点)。消融实验进一步证明:先验锚定贡献 -10.2pp 是最关键设计,贝叶斯方向(符号保持)次之 -8.6pp。

August 8, 2026 · 8 min

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读

CalibForge 提出了一个自主终端任务合成系统,把求解器行为当作’构建时反馈’,通过多求解器校准和对比求解器校准两种对抗式策略,将候选任务反复修订到’可证明可解但又不被统一求解’的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后,Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%,并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起,逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式,并从第一性原理分析’为何校准优于单求解器反馈’。

August 8, 2026 · 7 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min