Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读
本文精读 arXiv 2608.20290《Phantom Gains: Auditing Self-Improvement Against a Measured Null》。论文指出:逐题得失(transition-level)分析已成为自我改进研究的标准证据,但一次得失是两个含噪估计之差,极易产生测量伪影。作者让一个从未训练的冻结模型走完完全相同的评估管道,实测每个统计量的噪声底,识别出七种测量失败——单次贪心解码、m=1 扩展统计量、固定 token 上限、欠功效、单训练种子、欠功效探针、只测一次的零假设——每一种在缺少对照时都会反转一个结论。受控审计表明:外部蒸馏能真正改进基模型几乎够不到的题,而三种自训练不能;自训练毁掉的题远超噪声底;其全部新增解均为锐化而非能力扩张。论文主张:逐题审计必须为每个统计量单独实测零假设。