EAPO × DN-MOPD × d-OPD:大模型训练信号的三个盲区与最小修正 精读

同日三篇论文各自修复了 LLM 训练信号的一处失真:KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」,符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%(超最强基线 5.6pp,AIME24 20.2 vs GRPO 12.5);NTU+耶鲁+曼彻斯特的 DN-MOPD(当日 Hugging Face 日榜 up=111 第一)发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号,批内测离散度+有界乘子重缩放即恢复各域均衡(8K 下 +2.47~+3.08);清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来,Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249,8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。

September 30, 2026 · 5 min

IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读

IER-OPD(MBZUAI + 蚂蚁集团)研究同策略蒸馏(On-Policy Distillation, OPD)中一个反直觉的事实:训练学生模型时,绝大多数 token 的梯度几乎不携带有用学习信号,只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解,定义信息效率比 IER = 信号/噪声,并据此设计候选集近似与 soft OR/AND 多准则融合,用 IER 分数筛选「高信息效率」的 token。实验显示:仅用 0.1% 的 token 预算,AIME26 即可达到全量训练的近乎持平(58.9 vs 59.9);1% 预算下 AIME25 甚至超过全量(17.0 vs 14.4),且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验,并通过外部检索交叉验证 on-policy distillation(MiniLLM、GKD)与稀疏 token 选择等相关工作。

September 23, 2026 · 5 min

RetireOPD × EOS 终止符失配:在线策略蒸馏动力学二重奏 精读

两篇同日论文从训练动力学层面解剖在线策略蒸馏(OPD)。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突,于是让学生在分歧停止收缩且达到教师成功率阈值时自动’退休’教师,ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级:基座学生与后训练教师可能把停止概率放在不同 EOS token 上(即使声明停止集相同),把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读,构成’OPD 何时该用、何时会坏’的完整图景。

September 19, 2026 · 2 min

Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读

弱到强泛化的核心矛盾:常规蒸馏把弱教师当优化目标,学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的’政策偏移’方向,只放大学生自身 verifier 梯度在该方向上的投影分量,不建立任何教师匹配目标。理论上保住了策略优化的不动点,实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师,多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与’加速而非转向’的证据链。

September 10, 2026 · 3 min

TGOPD:在策略蒸馏前先验证教师——提示级可靠性门控 精读

AllSpark 团队推出 TGOPD:对每个提示用少量验证器打分的教师探针估计可靠性,通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD,35B LiveCodeBench 64.0(其他蒸馏方法全部负迁移),探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。

September 9, 2026 · 2 min

Scaling Model-Generated Distillation Data Can Make Latent Teacher Traits More Recoverable 精读

合成数据规模化通常被当作性能杠杆:数据越多、学生模型越强。这篇上海交大、复旦与上海 AI 实验室合作的论文揭示了第二效应——更多独立样本会让教师的隐藏特质在学生行为中更易检测、更特异。受 subliminal learning 启发的受控实验中,教师被诱导出目标特质后只生成纯数字补全这类严格离题数据(过滤一切显式线索),学生在不同规模数据上训练:动物偏好特质的正确定位数从 2/16 升至 14/16;evil 系统提示教师的学生的不安全率从 2% 涨到 33.7%;连跨模型身份迁移中 5 种假身份全部登顶。安全警示振聋发聩:小规模试点审计会系统性低估部署规模下的可学习风险——今天看似无害的离题数据,规模化后可能精确传递教师的不安全倾向。

August 28, 2026 · 2 min

领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

蒸馏风暴:门槛、灰色地带与一份没人愿意签字的竞赛规则

《晚点聊》编辑部红浩与曼奇复盘"蒸馏"这一没人愿意公开谈论的技术竞赛:典型蒸馏是有门槛的"抄答案",含账号运营、数据管线、防中转站反被坑等系统工程;张一鸣为何禁止字节蒸馏——“只能逼近不能超越"加上组织激励代价;Anthropic如何用行为指纹识别2880万次"史上最大规模蒸馏攻击”;学生能否超越教师仍是开放问题;以及比蒸馏更大的问题——智能供需错配下"够用了"的模型正在改写定价逻辑。

August 18, 2026 · 2 min

从DeepSeek到Kimi K3,中国开源模型如何逼出黄仁勋的'开源联盟'

DeepSeek V4 Pro登场,中国开源模型连续逼近前沿能力,迫使黄仁勋牵头组建美国"开放安全AI联盟",Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI"开源"到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别,以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。

August 13, 2026 · 1 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min