Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读

论文链接:https://arxiv.org/abs/2608.20290 代码与评估工件:https://github.com/chengxuphd/phantom-gains 发表时间:2026 年 8 月(arXiv 2608.20290v1,2026-08-20 提交,Preprint, Under review) 机构:都柏林大学(University College Dublin)+ 佐治亚理工学院+ 大连理工大学——一篇纯高校合作的研究,没有企业实验室参与 一句话总结:一个从未训练的模型,在标准评估流程下也会凭空“学会”6 道题、“毁掉”9 道题——你报告的自我改进,有多少是这种幽灵收益?


一、研究背景:当“自我改进”的评价从平均分走向逐题得失

大模型的自我改进是近两年最热闹的方向之一。STaR 让模型对自己答对的推理路径做微调(Zelikman et al., 2022);TTRL 用自己多次采样的多数投票替代真实标签做训练(Zuo et al., 2025);更复杂的方案让模型自己生成课程、甚至编辑自己的权重。这些方法的共同卖点是:不需要新的监督信号,模型就能变强。

过去评价这类方法,看的是两个数字:训练前准确率、训练后准确率。但社区已经普遍意识到这不够——平均值分不清“模型新学会了一道题”和“模型本来就会、只是这次发挥好了”,也看不到“平均分上涨的同时有多少题被毁掉”。于是出现了第二代分析:逐题得失追踪,也就是记录哪些题进入了模型的能力圈、哪些题掉了出去。这一代工具包括本文审计对象的“扩展统计量”(expansion statistic,来自 Math-Beyond, Mayilvahanan et al., 2026),以及“自训练毁掉了多少题”的腐化计数(corruption counting)。

方向是对的。但本文作者指出,它同时制造了一个新问题:一次“得失”(transition)是两个含噪估计的差,而你关心的事件——某道题恰好越过及格线——恰恰是噪声最活跃的地方。这就像用两次体重秤读数之差来判断你是否瘦了一斤:如果秤本身有 ±2 斤的抖动,那么“重了 1.5 斤”的结论毫无意义。更糟的是,这类逐题分析已经成为文献中报告“惊人发现”的来源,比如“自训练毁掉的题比学会的还多”——而本文将证明,一个从未训练的模型也能在这个框架下得到同样形状的惊人发现。

论文的方法论直觉非常朴素:想知道你的尺子有多少噪声,就拿一个确定没变的东西反复去量。作者把未经训练的 Qwen3-8B 冻结副本推过与训练臂完全相同的评估管道,它报告的每一次“得失”按构造都是伪影——这就是“实测零假设”(measured null)。以它为噪声底,论文审计出七种测量失败,并重新审视了自我改进的核心争议。


二、核心问题:transition 是两个噪声估计之差

把论文的核心问题拆开,是三层递进的追问:

第一层:你报告的“能力获得/损失”有多少是测量噪声? 一道题“学会”被定义为“训练前错、训练后对”,但前后两次判断本身都基于有限采样。如果前后各只采样一次(贪心解码),那么判定翻转可能纯粹来自解码端的非确定性——模型根本没变。

第二层:用来修正第一层问题的手段,自己是否也需要被检验? 论文最精彩的一击在这里:社区已经意识到 m=1 的扩展统计量有噪声,自然的修正是“要求训练后至少 2 次答对(m≥2)”。作者实测发现这个修正本身就是一个陷阱——某个冻结对照里 m=2 的零假设恰好是 0,看似修复成功,但把全部 110 个对照对池化后,零假设是 0.058 [0.038, 0.078],而不是 0。对噪声的修正如果只测一次,就是把自己的采样误差又复制了一遍。

第三层:在把尺子校准之后,自我改进的真相是什么? 排除伪影之后:自训练到底有没有引入新能力?毁掉的题是真实的吗?不同的自训练方法之间有差别吗?

论文的四个贡献可以概括为:(i)七种测量失败模式,每一种都在某个真实运行上反转过一个结论;(ii)一个无阈值(threshold-free)的替代检验,其零假设是实测的,并且在多种检验规则下稳健;(iii)一个让实测零假设几乎零成本的关键观察——每个训练臂的 checkpoint 0 都是对未训练模型的一次独立评估,多臂研究天然拥有这些复现,只是数量往往不够(论文实测需要约 9 个基线才够);(iv)一个带噪声底和效应量核算的逐题账本,外加一个三种训练种子在“是否崩塌”上不一致、但“会崩塌”上一致的政策梯度臂。


三、方法拆解:冻结对照、七态账本与匹配阶梯

3.1 实验骨架:三条训练臂 + 一个永远不训练的影子

所有臂共享同一个底座:Qwen3-8B + rank-32 LoRA,三轮训练,每轮从同一条无标注数据流抽 256 道题,评估时每题采 k=128 个样本(T=0.8、top-p 0.95),另加一次贪心解码。被审计的方法:

  • STaR:用真实答案过滤自采样推理路径(信号 100% 正确);
  • 多数投票自训练:按 TTRL 的思路用 8 次采样的多数投票过滤(无标签),注意是 SFT 版本——输掉投票的样本被丢弃而非压低;
  • 政策梯度臂:真正的 TTRL 式 RL,把多数投票当奖励,同一条流同一预算;
  • 外部蒸馏(正对照):用 gpt-oss-120b 做教师,过滤标准与 STaR 完全一致。

正对照的设置是这篇文章设计上的巧思:如果你连“一个真正带来新能力的信号”都检测不出来,那你的检测流程就没有意义。蒸馏臂就是那个“确定有真货”的阳性样本。

3.2 七态账本与核心统计量

每题每检查点算一个解决率 π̂,用滞回带(hysteresis,z=2 时为 [0.41, 0.59])离散化为二值状态,于是每道题落入七类之一:稳定对、稳定错、学会、毁掉、恢复、短暂、振荡。核心指标是腐化学习比 CLR(毁掉数 ÷ 学会数),CLR>1 意味着毁多于学。扩展统计量 ER_m 则定义在基模型 128 次采样全错的题上:训练后至少 m 次答对的比例。

3.3 冻结对照:整个方法论的支点

**一个冻结的 θ0 副本,在每个检查点被推过与训练臂完全相同的评估路径。**它报告的每个 transition 按定义都是伪影,因此它为每个统计量、每个 benchmark 实测了一个噪声底。论文的规则是:任何主张的计数不超过这个底,就不予承认。

这里有一个让成本几乎归零的观察:每个臂的第 0 个检查点都是对未训练模型的一次独立 k=128 评估。匹配阶梯建起来后,仅 AIME 就有 11 个这样的基线,池化成每题 1,408 次采样的共同分母——不需要任何新实验。

3.4 三个评估集各司其职

腐化只在“模型本来会做的题”上可观测,扩张只在“模型够不到的题”上可观测,两类题总体不相交,因此论文用了三个集合:

评估集规模特点承载的问题
MATH-500(分层抽 200 题)200严重污染(168–170 题已会)腐化
AIME 2025/202660最少污染,2026 半场晚于底座训练截止扩张
难度带(difficulty band)1,163从 10,999 道 held-out MATH 训练题按 k=8 解决率筛出 [0.25, 0.75] 的边界题腐化的统计功效

难度带的存在是因为 AIME 上只有 8 道题可被腐化——想测量腐化,必须刻意凑出一批处在及格线附近的题。论文也诚实声明:它的计数因此不是自然分布下的遗忘率。


四、七种测量失败:每一处都能反转一个结论

这是论文的主体,也是它最实用的部分。七种失败(F1–F7)每一种都在本研究的一个真实运行上被演示,且在缺少对照时会支持一个自信但错误的结论。其中两种(F1、F2)是当前社区的标准做法,还有一种(F7)藏在另一种失败(F2)的修正逻辑内部。

编号失败模式不加控制会得出的错误结论纠正手段边际成本
F1单次贪心解码当状态“冻结模型 CLR=1.5”冻结底 + 估计量$27
F2m=1 扩展阈值“多数投票扩展了 0.143 的 AIME”扩展统计量的冻结底$0
F3固定 token 上限“蒸馏是最毁模型的方法”逐检查点记录截断率$0
F4账本欠功效“两种方法没有差别”先行功效分析$88
F5单一训练种子“多数投票比 STaR 毁得更少”≥3 个种子$282
F6欠功效探针“自训练让拒答率降 10 个点”先把探针规模算够$2
F7零假设只测一次“ER2 的零假设是零”把每个基线都当复现$0

七种控制里有三种是对已有记录的再分析、成本为零;两种在任何多臂研究里天然免费。整篇论文的核心论点就藏在这张表的最后一列:测量自己的零假设,几乎不花钱。

F1:单次解码不是状态

温度为零的贪心解码在 batching 下并不确定(He & Thinking Machines Lab, 2025)。一个未训练的模型、同样的 200 道题、两次贪心评估:9 道题判“毁掉”、6 道题判“学会”,CLR=1.5——这正是“自训练毁掉的能力比学会的多”这类文献警告的形状,凭空制造了出来。按题算,7.5% [4.6, 12.0] 的题翻转了判定,而且同一对比独立跑三次分别是 7.5%、8.0%、4.5%,自身都不稳定。

机制不是引用来的,是测出来的:把同样的题分别用 64 请求并发和严格串行各跑一遍,判定翻转从 16/200(8.0%)降到 4/200(2.0%),Fisher p=0.005——batching 是主因,但不是全部原因。即使一个请求一个请求地发,冻结模型仍有 2% 的贪心判定会翻。原因在服务端:跨租户的 batch 或 API 之下的非确定性,调用方无法控制。在 1,163 题的难度带上差距更大:贪心协议下 18.9% 的题变状态,解决率估计量下只有 0.8%。结论:单解码账本没法靠“更小心地解码”修复,只能换成估计量。

附录 F 里给了一个漂亮的实锤案例:同一道几何题、T=0、固定种子,两次解码前 1,523 个字符完全相同,然后在一个句子中间分岔——一次答对 180,一次答错 120。机制是 batching 下浮点运算的非结合性:不同的 batch 组合让归约顺序不同,末位小数扰动一个 logit,arg-max 在近似平局处翻转,之后的一切都不一样了。

F2:没有阈值能修复扩展统计量

m=1 的 ER 定义是“基模型 128 次采样 0 次对、训练后至少 1 次对”。这是用不对称阈值比较两个二项估计,它在一个什么都没发生的模型身上返回了 0.280:冻结的 Qwen3-8B 在 k=128 下评估两次,“扩展”了 25 道 AIME 未达题中的 7 道。全部 110 个冻结对照池化后是 0.176。而阶梯上 STaR 的 ER1=0.320、多数投票三个种子 0.364/0.167/0.192——全部落在冻结模型自己就能产生的范围 [0.000, 0.364] 之内。正确的解读不是“它们为零”,而是 ER1 把它们高估了约一倍,并且无法把“没训练的模型”和“训练过的模型”区分开。(唯一被区分开的是蒸馏:0.545–0.667。)

显然的修复不奏效。那 7 个伪“扩展”恰好都只有 1 次答对,所以 m=2 在这个对照里把伪影清零——但这个结论建立在 25 道题的单次实现上。把所有臂的 checkpoint 0 池化,AIME 上有 11 个独立基线、110 个有序对:ER2 的零假设是 0.058 [0.038, 0.078],最差的一对达到 0.136。多数投票自训练实测的 1/21=0.048 与它自己的零假设(Wilson 区间 [0.008, 0.23])不可区分——不是低于噪声,而是落在噪声里。抬高阈值也无济于事:ER3 的零假设是 0.023 [0.009, 0.038],要到 m=5 才接近零(0.003)。MATH-500 上 m=2 的零假设高达 0.128。那个看似修复了统计量的阈值,是在它自己要修正的噪声上拟合出来的。

有效的做法是停止阈值化:把未训练模型的每一次独立评估池化成一个基线(AIME 上 11 次、每题 1,408 次采样),给所有臂一个共同分母,然后对每道题做单侧 Fisher 精确检验,在 FDR(错误发现率)控制下判定。检验的零假设也用同样的方式实测:留出一个基线当“训练后”,跑完全相同的检验——11 个留出复现上检出为零,且在 Bonferroni、跨臂联合程序、固定阈值下均不变(两臂实际达到的 cutoff 是 0.0095 对 0.0094,被同一标准衡量)。

F3:固定 token 上限把最有效的方法判成最毁模型的

蒸馏学生在难度带上录得 177 次腐化、CLR=1.10,名义上是全研究最毁模型的方法。但它的截断率从 16.5% 漂移到 65.3%——学生学会了 120B 教师的啰嗦文风,不断撞上 token 上限,答案被截断后自然判错。只看未截断的补全,它从 0.656 提升到 0.845:它是最有效的方法,不是最毁的。诊断只需要每个检查点记一个数字(截断率),成本为零。该臂的腐化计数被整段排除出能力分析,而不是加个脚注。

F4:transition 指标的统计功效比准确率低一个数量级

只有及格线附近的题才能产生事件。检出 STaR 与多数投票之间的腐化率差异,80% 功效需要每臂约 249 个事件;一个 112 题的试点只有 24 个事件,在任何显著性水平下都不可能分辨。这解释了为什么主对比要用 1,163 题的难度带。

F5:方法间的比较在训练种子间不稳定

同一方法、同一数据、同一预算,只是换了 adapter 初始化和训练顺序:STaR 的 CLR 在三个种子上是 0.70/0.74/0.45(准确率每种子 +5.6 到 +6.9 点),稳定;多数投票自训练是 0.55/1.53/1.33,准确率变化 +4.0/−2.8/−1.0——跨过了 CLR=1 这条“毁多于学”的分界线,两次落在毁多于学一侧。单种子比较的结论(“多数投票毁得更少”)完全被推翻。可辩护的结论反而更有用:多数投票方法的结果不由设计单独决定,跑两次能落在 CLR=1 的两侧。种子方差比按题 bootstrap 的区间大 3 倍——只报后者的单种子研究把不确定性低估了约三倍。

F6:欠功效探针造出幽灵安全发现

一个 10 提示词的拒答探针显示拒答率下降 10 个点、且轨迹非单调(噪声的特征)——一次就能产出一个可发表的安全声明。扩到 50 个提示词,效应消失。三个复现读数是 −0.015、−0.115、−0.005,中间那个显著、两个邻居都不复现。诚实的报告是一个界限(“任何变化小于约 11 个点”),而不是零结果。探针的设计效应 1.8–2.8×(同一提示词的 4 次采样不独立),簇稳健标准误 0.044–0.057——朴素 z 检验本来就是错的工具。

F7:只测一次的零假设是个点估计,不是参数

一切测量的东西都带采样误差,零假设也不例外——这是把 F2 的教训向上再推一层。论文给出三个实例:ER2 的零假设从单冻结对的 0/25 变成 110 对的 0.058 [0.038, 0.078];难度带的腐化底从 5 变成与臂同检查点数的对照的中位数 8;冻结模型解决率移动的包络从 0.188 变成 20 对的 0.234。第一个直接摧毁了 F2 里的修正。补救不需要新实验:每个臂的 checkpoint 0 都是对未训练模型的独立评估。但需要多少个?论文穷举了 11 个基线的所有子集:G=4 时 ER2 零假设仍在 0.022–0.098 之间摇摆——一个三臂研究恰好有 4 个基线,足以让你认证一个不是零的零假设;要到 G=9 才能稳定在 11 个基线值的 ±0.02 以内。推荐的做法因此是:报告区间和它的复现数。


五、受控审计的结果:解离、锐化与真实破坏

尺子校准了,现在看风景。匹配阶梯(matched ladder)是结果的载体:一条共享数据流、相同的保留量(各臂每轮 246–254 例,差距在 2% 以内)、相同评估、三个种子,唯一变化的是正确性过滤的来源——自己的多数投票 / 真实答案 / 外部教师。这消除了原版协议里蒸馏与自训练之间 4.9 倍的训练量差异和流不匹配问题。

5.1 解离:蒸馏够得着自训练够不着的地方

用逐题精确检验对 1,408 次池化基线做 FDR 控制检验,核心发现是一个清晰的解离:

过滤器种子准确率变化base=0 检出base 1–5 检出base>5 检出
多数投票 SFT0/1/2+3.3 / −1.5 / +0.70 / 1 / 02 / 0 / 017 / 3 / 4
真实答案(STaR)0+1.8019
外部教师蒸馏0/1/2+13.0 / +14.7 / +15.83 / 4 / 27 / 7 / 626 / 26 / 25
政策梯度0+1.60111
冻结对照(11 个复现)——000

在 22 道基模型在 1,408 次采样中最多够到 5 次的低基线题上,蒸馏每个种子检出 8–11 道,而三种自训练全部只有 0–2 道;冻结对照在全部 11 个复现上检出为零。而且这个解离不是教师整体增益大的副产品:对逐题计数做 logistic 回归(含臂、分层及其交互项),教师在低基线题上获得额外的 β=1.91 [1.25, 2.56](p<10⁻⁸)——超出其整体提升的部分;多数投票 SFT 是 0.21 [−0.60, 1.03]、政策梯度 −0.49,都不可区分于零。用通俗的话说:统一按比例放大的改进模型可以解释自训练臂的全部行为,但解释不了教师。教师是在“质”上不同,而不只是“量”上更大。

论文对主张的边界非常克制:在那 10 道基模型一次都够不到的题上,种子合并计数是 5 对 2,不显著(p=0.35);2026 无污染半场的低基线题上也不显著(p=0.17)。所以这是一个低基线结果,不是扩张结果——措辞上一字之差,论文始终分得很清。

蒸馏的检出确实是教师真正引入的新解。附录 D.2 逐题列出了全部 29 道相关 AIME 题的原始计数:最醒目的是 AIME 2025/21,蒸馏学生从基线的 0/128 到训练后的 49/128;而冻结对照的全部 7 个伪“扩展”都恰好是 1 次答对、没有一个是 2 次。附录 F 的案例研究把这同一道题的三个版本并排展示:基模型的失败是系统性的——分子算对了却除以 2^15−1 而不是 2^15;冻结对照的“那一次答对”只是伯努利过程的小概率尾巴;而蒸馏学生的 49 次答对走的是教师教的正确路径。一个字符之差(32767 对 32768)和一种新解法,在 m=1 的账本里被记成同一个事件——这就是 F2 的全部内容。

5.2 锐化:自训练做的一切新增,都是把已有的解变稳

难度带按构造不含基模型够不到的题,所以它测的是另一面。在扩张可观测的全部评估集上,自训练臂每一道 pass@1 新学会的题,都是基模型在 128 次采样里至少对过一次的题:2/2、3/3、4/4、9/9——全部,无一例外。这就是“锐化”假说的直接证据:自训练没有把概率质量放到基分布之外,只是把质量集中到模型本来就有偏好的序列上。

无阈值检验把这个主张带上功效:11 个池化基线下,检验对真实训练后解决率 0.024 有 80% 功效,而没有任何自训练臂在任何 base-0 题上产出超过 1/128 的正确采样——所以这是一个界限(没有臂把 base-0 题抬到约 2.4% 之上),而非简单的“什么都没测到”。锐化本身是有价值的——第一次尝试就对当然比第五次才对有用,这正是这些方法可靠交付的东西——但它与排行榜数字所暗示的“能力扩张”是两个不同的主张,而这个差别花不了多少钱就能测出来。附录 F 的 Case 5 给了锐化的具象样本:基模型 24/128 对(加法算错答 0),STaR 后 128/128 对(加对了答 6)。正确答案本来就在基模型的输出分布里,训练只是把质量移了过去。

5.3 破坏是真实且巨大的

难度带上,STaR 毁掉 106 道基线已会的题,多数投票毁掉 88 道,而设计匹配的冻结底是中位数 8(四检查点对照、120 个排序)——臂超出噪声底 11–13 倍,且这发生在 STaR 平均分上涨 5.6 点的同一轮训练里:总体改进和大规模破坏是同一次运行,不是二选一。

更重要的是效应量核算:把 20 个冻结对全算上,从未训练的模型在任何一道题上的解决率移动都不超过 0.234;而 STaR 的 106 次腐化里有 58 次、多数投票的 88 次里有 60 次超过了这个包络——超过一半的“毁掉”事件,其幅度大于冻结模型在整个集合上产生过的任何移动。这不再是阈值抖动,是真实的能力损失。附录 F 的 Case 4 展示了一次真实腐化的样子:基模型 104/128 对,三轮多数投票后 8/128 对——二进制转换一字不差,但数错了 1 的个数(数出 6 个而不是 5 个),推理的其余部分连小标题都没变。没有任何东西被“遗忘”,只是某个子步骤变得不可靠,并自信地产出错误答案——而且错答案恰恰是多数投票的众数,这道题的伪标签从此就是错的。

5.4 政策梯度臂:监督信号在读数健康时模型正在死

TTRL 原版是 RL,输掉投票的样本被压低而非丢弃——一个审计 RLVR 文献的研究不能只测 SFT,所以论文跑了真政策梯度臂。难度带上它表现正常(19 学 9 毁,CLR=0.47);AIME 上三个种子全部崩塌进无界重复,截断率 76–100%。三个种子看到完全相同的数据、相同的顺序,第一轮几乎相同(投票正确率 77.0–77.9%),然后彻底分岔:一个种子一次更新后就 100% 截断、一个两次、一个三次。崩塌属于这个配置,但到达轮数属于种子——这是 F5 的极端形态。训练 loss 第一轮三个种子是 169.9、8.5、145.1:仅 adapter 初始化就带来 20 倍的差距。

最有警示价值的是 seed 2 的诊断:在上一次伤害模型的更新与杀死它的更新之间,多数投票变得更准(77.9%→85.1%)更一致(份额 0.78→0.86),而评估侧从 47% 截断走向 96%。一个读起来健康、正在监督一个垂死模型的监督信号——这就是论文标题所说的幽灵,只不过这次伪装成了训练诊断。它的含义很直接:这套自监督统计量不能用来决定何时停止训练。


六、深度解读:这篇论文到底改变了什么

6.1 方法论层面:从“分析”到“计量学”

这篇论文做的不是又一个自我改进方法,而是给整个 transition-level 分析范式做了一次计量学校准。它的核心主张可以用一句话装下:**你报告的每一个统计量,都需要一个单独实测的零假设。**这句口号之所以可行,是因为一个成本上的幸运事实——每个臂的 checkpoint 0 就是对未训练模型的独立评估,多臂研究天然拥有这些复现。论文同时给这个便宜货标了价:四个复现不够(ER2 零假设在 0.022–0.098 间摇摆),九个才稳。而一个标准三臂研究恰好只有四个。这个“多少才够”的数字,是论文最有普适价值的输出之一。

值得强调的是论文对“实测 vs 解析”零假设的诚实态度。对解决率估计量,解析的二项零假设(Yuan et al., 2026 的做法)与实测底几乎一致(中位数 3/4 对 4/3,包络 0.203 对 0.234)——论文直说解析够用,不抢占无法证明的优势。两者分手的地方恰是噪声不服从二项分布的地方:单解码协议(解析预测零翻转、实测 18.9%)和扩展统计量(解析计算在 m=2 给 0.044、实测 0.058,一个信了计算的作者会认证恰好被 F7 排除的阈值)。解析零假设在它对的地方够用,在它错的地方错得足以翻转结论——而你不测就不知道自己在哪一边。

6.2 科学层面:为“锐化 vs 扩张”之争补上了关键对照

自改进研究最尖锐的争论是:无教师的自训练到底在获取新能力还是仅仅表达已有能力?锐化理论、生成-验证差距、pass@K 交叉、多样性崩塌……双方都有证据。这篇论文的贡献不是站队,而是指出这个争论的测量基础本身有七处漏洞,然后在补漏之后给出了与锐化阵营一致的答案:三种自训练的全部新增都是锐化(9/9),而外部教师确实带来新解(0/128 到 49/128)——并且带了一个此前双方都没跑过的正对照:如果连蒸馏的新能力都测不出来,任何“自训练没有新能力”的零结果都不可信。蒸馏臂的存在让零结果从“没测到”升级为“有功效的界限”。

与同期工作的对比也有说服力:Strozzi (2026) 在一个有自由验证器的 DSL 域上独立得到 pass@K 交叉的类似结论,本文视自己为跨域、跨监督范式的复现并附正对照;Lin et al. (2026) 报告 TTRL 毁多于学,本文的 seed 0 与之相反、另两个种子与之相符——论文给出的调解框架是:腐化需要不可靠的监督和此前的胜任两个条件同时成立,这个区间很窄,弱底座(投票不准)落在里面、Qwen3-8B(带内投票 91–95% 正确)坐在边上,所以结论随种子摆动。一个被自己数据证伪的预注册预测(“投票越不可靠的地方腐化越多”——实际 AIME 上投票正确率跌到 26–30%、腐化却为零,因为只有 8 道题可毁)反而成了这个框架的最好证据。

6.3 工程层面:七条可以立即采用的报告标准

论文结尾给出了七条实践标准,每一条都曾在本文数据上抓住一个被反转的结果:为每个统计量报告无操作对照并附区间;对照的设计要与臂匹配;用解决率估计量而非单次解码定义正确;用对池化基线的逐题检验替代任何阈值化扩展统计量;逐检查点记录生成长度;transition 对比先做功效分析;至少报告三个训练种子并在相同题目上打分。前五条不需要新实验。

成本核算也值得注意:全研究 48 个运行、3.44M 次采样、5.30B 生成 token、约 $3,171。测量基础设施只占 13%;暴露四个失败模式的小试点一共 $2;而论文结论所依赖的全部对照——实证零分布、设计匹配底、无阈值检验、种子分析——成本为零,因为它们都是对已有记录的再计算。钱买到的是匹配阶梯($415,消除一个混淆)和政策梯度臂($266,审计一个 SFT 替代不了的方法族)。另一个结构性事实:transition 审计的成本由评估而非训练决定——1,163 题 × k=128 × 4 检查点是每臂 60 万次生成,对比约 270 步优化器更新。统计功效来自边界题,到达它们靠的是采样宽度而不是更长训练。


七、局限性:论文自己划的边界

论文的局限 section 写得 unusually 诚实,值得原样转述并稍作展开:

**训练量太短。**三轮、约 270 步 rank-32 LoRA,远短于它所对标的方法的训练日程。论文证明的是“这个日程下不扩张”,不是“自训练不能扩张”。同时进化流比 AIME 容易得多(STaR 在真实答案过滤下保留约 90%),一个只在自己已会的题上训练的方法,先验上就不太可能扩张进 AIME 难题区——自己生成课程的方法恰恰是为了逃出这个限制而设计的,本文的零结果不覆盖它们。

**扩张主张的样本太小。**扩张证据是单一 benchmark 上 22 道低基线题(其中仅 10 道基率为零、且在 2026 无污染半场上只有 10 道低基线题中的部分)。解离显著,但不精确。在严格 base-0 子集上比较不显著(5 对 2,p=0.35),论文因此把主张限定为“低基线”而非“扩张”。

**腐化证据的载体有污染风险。**难度带取自 MATH 训练题,虽然与进化流互斥,但几乎肯定在底座的预训练数据里——部分“腐化”可能是被扰动的记忆答案而非被扰动的推理。避免这个问题的 AIME 臂又没有腐化功效。

**单一底座家族。**所有实质主张都在 Qwen3-8B 上。第二个底座(gpt-oss-20b)做了表征和底测量,但按 F4 的功效分析,负担得起的规模只有所需事件的约三分之一——给一篇以欠功效为第四失败模式的论文加一个欠功效的臂,是错误的交易,所以论文选择把跨底座泛化声明为未检验。

**蒸馏对照的残余不匹配。**流、保留量、评估都匹配了,但教师的能力和啰嗦程度无法匹配,而 F3 证明后者是真实起作用的(蒸馏臂即便在 8,192 token 上限下仍截断 36–46%,这个截断只会压低它的检出数,所以解离是被低估而非被制造的——保守方向错误,尚可接受)。

另外,安全探针的阴性结果只在其标记规则下成立:一个从明确拒绝滑向软性敷衍(无标记短语)的模型会被记为配合,这一层没有被审计。论文伦理声明因此明确拒绝把界限结果读作安全背书。


八、总结与启发

8.1 三句话总结论文

  1. 逐题得失分析是对的,但它是一个独立的测量问题:一个 transition 是两个含噪估计之差,本文冻结对照实测出七种测量失败,其中单解码账本和 m=1 扩展统计量是现行标准做法,“修正只测一次”(F7)甚至藏在修正逻辑内部。
  2. 校准之后,自改进的图景是:三种自训练的全部新增解都是锐化(基模型 128 次内至少对过一次,9/9),它们真正做的是把已有解变稳;而匹配阶梯下的外部蒸馏在低基线题上每种子检出 8–11 道(自训练 0–2 道),回归分析证明这不是教师整体增益大的副产品(β=1.91,p<10⁻⁸)。同时自训练毁掉的题超出实测噪声底 11–13 倍,过半数事件的幅度超出冻结模型产生过的任何移动。
  3. 测量零假设几乎免费:每个臂的 checkpoint 0 都是对未训练模型的独立评估,但四个复现不够、九个才稳——报告区间和它的复现数。

8.2 更广的启发

这篇论文的价值远超自我改进这一个领域。它描述的失败模式——用单次测量之差定义事件、用阈值比较两个噪声估计、在噪声上拟合修正参数、用欠功效的零结果支持正面主张、只跑一个种子——存在于一切“前后对比”型评估里:能力编辑、模型合并、量化压缩、安全微调、对齐税测量。任何一个报告“X 之后哪些题变好哪些变坏”的研究,都值得问一句:你的冻结对照在哪?你的噪声底是多少?

对初学者,它还是一个统计直觉的训练场:为什么单侧 Fisher 精确检验配上 FDR 控制是逐题检验的合理选择(小计数、精确分布、多重比较);为什么 FDR 程序是自适应的、以及为什么这里两臂实际达到的 cutoff 几乎相同消除了这个疑虑(0.0095 对 0.0094);为什么“零检出”本身是一个需要 Clopper–Pearson 界的估计;为什么种子方差和题目抽样方差要分开报。这些工具没有一样是新发明的——Fisher 精确检验 1922 年就有了——发明的只是把它们用在正确的位置、并先量一量自己的尺子。

最后是那个最值得记住的画面:政策梯度臂的多数投票,在模型从 47% 截断滑向 96% 截断的路上,正确率从 77.9% 升到 85.1%、一致性从 0.78 升到 0.86。监督信号一切向好,模型正在死去。自我改进研究最深的风险从来不是失败得很明显,而是失败的形态恰好长成成功的形状。这篇论文卖的不是一个新的改进方法,而是一副眼镜:戴上它,你能在置信的结论里看见幽灵。


参考资料

  • 原文:Xu C., Yan N., Chen L., Kechadi M-T. Phantom Gains: Auditing Self-Improvement Against a Measured Null. arXiv:2608.20290, 2026.
  • 代码与逐题记录:https://github.com/chengxuphd/phantom-gains
  • 文中引用的关键先行工作:Zelikman et al. 2022(STaR);Zuo et al. 2025(TTRL);Huang et al. 2025(锐化机制);Yue et al. 2025(RLVR 边界之争);Mayilvahanan et al. 2026(Math-Beyond 与 ER 统计量);Yuan et al. 2026(解析零假设账本);Strozzi 2026(pass@K 交叉);He & Thinking Machines Lab 2025(推理非确定性)。