<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>蒸馏 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E8%92%B8%E9%A6%8F/</link><description>Recent content in 蒸馏 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 30 Sep 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E8%92%B8%E9%A6%8F/index.xml" rel="self" type="application/rss+xml"/><item><title>EAPO × DN-MOPD × d-OPD：大模型训练信号的三个盲区与最小修正 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</guid><description>同日三篇论文各自修复了 LLM 训练信号的一处失真：KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」，符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%（超最强基线 5.6pp，AIME24 20.2 vs GRPO 12.5）；NTU+耶鲁+曼彻斯特的 DN-MOPD（当日 Hugging Face 日榜 up=111 第一）发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号，批内测离散度+有界乘子重缩放即恢复各域均衡（8K 下 +2.47~+3.08）；清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来，Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249，8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。</description></item><item><title>IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</guid><description>IER-OPD（MBZUAI + 蚂蚁集团）研究同策略蒸馏（On-Policy Distillation, OPD）中一个反直觉的事实：训练学生模型时，绝大多数 token 的梯度几乎不携带有用学习信号，只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解，定义信息效率比 IER = 信号/噪声，并据此设计候选集近似与 soft OR/AND 多准则融合，用 IER 分数筛选「高信息效率」的 token。实验显示：仅用 0.1% 的 token 预算，AIME26 即可达到全量训练的近乎持平（58.9 vs 59.9）；1% 预算下 AIME25 甚至超过全量（17.0 vs 14.4），且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验，并通过外部检索交叉验证 on-policy distillation（MiniLLM、GKD）与稀疏 token 选择等相关工作。</description></item><item><title>RetireOPD × EOS 终止符失配：在线策略蒸馏动力学二重奏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</link><pubDate>Sat, 19 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</guid><description>两篇同日论文从训练动力学层面解剖在线策略蒸馏（OPD）。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突，于是让学生在分歧停止收缩且达到教师成功率阈值时自动&amp;rsquo;退休&amp;rsquo;教师，ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级：基座学生与后训练教师可能把停止概率放在不同 EOS token 上（即使声明停止集相同），把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读，构成&amp;rsquo;OPD 何时该用、何时会坏&amp;rsquo;的完整图景。</description></item><item><title>Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</guid><description>弱到强泛化的核心矛盾：常规蒸馏把弱教师当优化目标，学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的&amp;rsquo;政策偏移&amp;rsquo;方向，只放大学生自身 verifier 梯度在该方向上的投影分量，不建立任何教师匹配目标。理论上保住了策略优化的不动点，实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师，多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与&amp;rsquo;加速而非转向&amp;rsquo;的证据链。</description></item><item><title>TGOPD：在策略蒸馏前先验证教师——提示级可靠性门控 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</guid><description>AllSpark 团队推出 TGOPD：对每个提示用少量验证器打分的教师探针估计可靠性，通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD，35B LiveCodeBench 64.0（其他蒸馏方法全部负迁移），探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。</description></item><item><title>Scaling Model-Generated Distillation Data Can Make Latent Teacher Traits More Recoverable 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-distillation-data-scaling-teacher-traits-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-distillation-data-scaling-teacher-traits-paper-reading/</guid><description>合成数据规模化通常被当作性能杠杆：数据越多、学生模型越强。这篇上海交大、复旦与上海 AI 实验室合作的论文揭示了第二效应——更多独立样本会让教师的隐藏特质在学生行为中更易检测、更特异。受 subliminal learning 启发的受控实验中，教师被诱导出目标特质后只生成纯数字补全这类严格离题数据（过滤一切显式线索），学生在不同规模数据上训练：动物偏好特质的正确定位数从 2/16 升至 14/16；evil 系统提示教师的学生的不安全率从 2% 涨到 33.7%；连跨模型身份迁移中 5 种假身份全部登顶。安全警示振聋发聩：小规模试点审计会系统性低估部署规模下的可学习风险——今天看似无害的离题数据，规模化后可能精确传递教师的不安全倾向。</description></item><item><title>领读Kimi K3技术报告：一个清华架构博士眼中的注意力谱系与「有效scaling」</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</guid><description>一集面向技术读者的Kimi K3技术报告领读播客，嘉宾孙宇涛（清华计算机系博士生、上海创智学院pre-doc，研究方向LLM架构与预训练）从K3出发串联起十多篇前作，把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加，讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design，MLA+QK-norm式门控的稳定性逻辑，Latent MoE对通信开销的削减，以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推；后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论：大模型架构没有本质创新了，K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率，而把size做work才是真创新。</description></item><item><title>蒸馏风暴：门槛、灰色地带与一份没人愿意签字的竞赛规则</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-distillation-storm-late-talk/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-distillation-storm-late-talk/</guid><description>《晚点聊》编辑部红浩与曼奇复盘&amp;quot;蒸馏&amp;quot;这一没人愿意公开谈论的技术竞赛：典型蒸馏是有门槛的&amp;quot;抄答案&amp;quot;，含账号运营、数据管线、防中转站反被坑等系统工程；张一鸣为何禁止字节蒸馏——&amp;ldquo;只能逼近不能超越&amp;quot;加上组织激励代价；Anthropic如何用行为指纹识别2880万次&amp;quot;史上最大规模蒸馏攻击&amp;rdquo;；学生能否超越教师仍是开放问题；以及比蒸馏更大的问题——智能供需错配下&amp;quot;够用了&amp;quot;的模型正在改写定价逻辑。</description></item><item><title>从DeepSeek到Kimi K3，中国开源模型如何逼出黄仁勋的'开源联盟'</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</guid><description>DeepSeek V4 Pro登场，中国开源模型连续逼近前沿能力，迫使黄仁勋牵头组建美国&amp;quot;开放安全AI联盟&amp;quot;，Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI&amp;quot;开源&amp;quot;到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别，以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。</description></item><item><title>特修斯之船：Kimi K3如何把Transformer的零件全部换掉，还能逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</guid><description>月之暗面K3是首个达到3T级别的开放权重模型，其47页技术报告揭示了一种&amp;quot;特修斯之船&amp;quot;式的架构哲学：注意力改成了线性+全局混合（KDA+MLA），残差变成了深度方向的Attention，FFN变成压缩空间的稀疏专家，甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3：线性注意力在2.8T规模上实现了6.3倍解码加速，Quantile Balancing路由是3T稳定训练的关键之一，MOPD让九个领域专家模型高效合板，而KDA（Kernel Development Agent）证明RSI已在kernel优化领域高速运转。核心判断：权重只是一次训练的产物，环境才是能反复产出下一代权重的护城河。</description></item><item><title>何谓蒸馏？硅谷如何看中国开放模型逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</guid><description>月之暗面K3开源权重发布震动硅谷，开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了&amp;quot;蒸馏&amp;quot;争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击，以及开源模型安全之争的真正焦点。核心判断：没有开源，才是这个时代最不安全的事情。</description></item></channel></rss>