<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>梯度估计 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E6%A2%AF%E5%BA%A6%E4%BC%B0%E8%AE%A1/</link><description>Recent content in 梯度估计 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 23 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E6%A2%AF%E5%BA%A6%E4%BC%B0%E8%AE%A1/index.xml" rel="self" type="application/rss+xml"/><item><title>IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</guid><description>IER-OPD（MBZUAI + 蚂蚁集团）研究同策略蒸馏（On-Policy Distillation, OPD）中一个反直觉的事实：训练学生模型时，绝大多数 token 的梯度几乎不携带有用学习信号，只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解，定义信息效率比 IER = 信号/噪声，并据此设计候选集近似与 soft OR/AND 多准则融合，用 IER 分数筛选「高信息效率」的 token。实验显示：仅用 0.1% 的 token 预算，AIME26 即可达到全量训练的近乎持平（58.9 vs 59.9）；1% 预算下 AIME25 甚至超过全量（17.0 vs 14.4），且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验，并通过外部检索交叉验证 on-policy distillation（MiniLLM、GKD）与稀疏 token 选择等相关工作。</description></item></channel></rss>