EAPO × DN-MOPD × d-OPD:大模型训练信号的三个盲区与最小修正 精读
同日三篇论文各自修复了 LLM 训练信号的一处失真:KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」,符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%(超最强基线 5.6pp,AIME24 20.2 vs GRPO 12.5);NTU+耶鲁+曼彻斯特的 DN-MOPD(当日 Hugging Face 日榜 up=111 第一)发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号,批内测离散度+有界乘子重缩放即恢复各域均衡(8K 下 +2.47~+3.08);清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来,Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249,8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。