论文链接:TTPO: Test-Time Policy Optimization (arXiv:2608.27448) 发表时间:2026年8月27日 机构:浙江大学、阿里巴巴集团——企业与高校合作 领域标签:cs.CL,LLM 推理 / 无标签测试时训练(TTT) 开源资源:github.com/ZJU-REAL/TTPO

一、论文背景

1.1 从后训练到测试时训练

RLVR(可验证奖励的强化学习)与 OPSD(on-policy 自蒸馏:把真值答案作为特权信息注入同一个模型的 prompt,构造出「教师」,对学生自己 rollout 的 token 逐位打分监督)驱动了大模型数学推理的进步。但它们都依赖真值标签:RL 要它做验证,蒸馏要它当特权上下文。

测试时训练(Test-Time Training, TTT) 是更极端的设定:模型在没有任何标签的测试问题上直接训练自己、提升这些问题的推理表现——标签永远不会到来。这是「开卷考试现学现卖」的极限形态。

1.2 伪标签的困境与关键观察

没有标签时监督只能来自模型自己:对每题采样一组 rollout,把多数答案当伪标签。先行工作 TTRL 用它当 RL 奖励,但奖励是每条轨迹一个标量,且多数派错了就强化错误。自然的下一步是让伪标签顶替 OPSD 里的真值——但论文一句话点破要害:密集监督会放大标签错误——被污染的奖励每条轨迹误导一次,被污染的教师每个 token 都在误导。

而错误是常态而非例外:竞赛级题目上(AIME 2026,Qwen3-1.7B),伪标签平均约 85% 是错的。从这种标签里学习似乎不可行。

转机是一个结构性观察:即使伪标签是错的,与它不同意的 rollout 里约 79% 也不是真答案——它们既不等于伪标签也不等于真值,是货真价实的错误。所以「惩罚不一致的 rollout」在约 79% 的情况下是对的,且这个判断只用「不一致」这个事实、完全不用伪标签的内容。惩罚不需要伪标签正确,蒸馏不行。

二、论文定位和关联工作

谱系代表监督形式与 TTPO 的区别
TTT + 多数投票 RLTTRL(及 Hi-TTRL 分层奖励、SCRL 选择性伪标签)单序列级标量奖励纯 RL、奖励广播到所有 token;多数错时强化错误
无标签自蒸馏OPSD-TTT(温度 0 输出当特权信息)蒸馏所有/不同意 rollout教师条件在错误答案上,逐 token 放大错误
标签蒸馏 + RL 混合样例路由、蒸馏-失败处等(均用真标签)路由两种信号全部假设有真标签,TTT 场景不可用
噪声标签学习负学习(NLNL):说「不是什么」在标签错时仍可靠类别级负监督TTPO 把负学习的不对称性引入 TTT 的 token 级更新
token 级加权TIP(<10% token 蒸馏)、STAPO(掩蔽虚假 token)token 选择TTPO 在两个分支同时做 token 级选择

定位结论:TTPO = 「蒸馏用在它可靠的地方 + RL 用在它可靠的地方」的不对称组合,是对 TTT 场景下监督信号可靠性结构的针对性设计。

三、问题定义

给定:无真值标签的测试问题集 $\{x_i\}$,策略 $\pi_\theta$。

每题流程:采样 $K$ 条轨迹,按数学等价聚类答案,取最大簇为伪标签 $\hat{a}$(共识数 $c$),划分同意集 $P = \{k: a_k = \hat{a}\}$ 与不同意集 $N = \{k: a_k \neq \hat{a}\}$。

教师构造(沿 OPSD):教师与学生共享参数,只差 prompt 前缀——教师看到 $[x; \hat{a}]$(特权信息、不回传梯度),学生看到 $[x]$,对同一份 rollout token 序列逐位比较分布。

目标:设计一个联合损失,在伪标签频繁出错的条件下仍然每一项都「有依据」(well-grounded),并把 TTT 场景的推理准确率提上去。

四、问题解法

4.1 正样本:OPSD 蒸馏分支 + token 降权

对每条 $y_k \in P$,前向 KL 逐 token 对齐教师与学生分布,附 token 权重:

$$w(t) = \tilde{H}(t) + \tilde{\Delta}(t) - \tilde{H}(t)\cdot\tilde{\Delta}(t)$$

其中 $H(t)$ 是学生熵、$\Delta(t)$ 是师生散度,各自 min-max 归一化后用 Soft-OR 组合——任一信号指出学习价值(学生不确定、或自信地错了)权重就高,两个都低(学生已收敛且与教师一致)权重趋零。直觉:别在学生已经会的位置浪费梯度。

为什么这个分支对错误伪标签也安全:教师条件在的答案正是这些正样本自己产出的答案——即使它是错的,更新也退化为「thinking 模式蒸馏到 non-thinking 模式」的形态(把慢思考的推理模式迁移给快答),而不是被拖向一个任意的错误。

4.2 负样本:GRPO 惩罚分支 + token 掩码

对每条 $y_k \in N$:二值奖励 $r_k=0$,组相对优势保证 $A_k<0$,形成惩罚。掩码打分:

$$s(t) = -\log \pi_\theta(y_k^{(t)} | x, y_k^{(以未归一化的 $-\log p$ 为主排序锚——局部正确的 token(通常高概率)天然排除,模型自信地输出的异常内容被优先选中;取分数 top-50% 构造二值掩码 $m(t)$,梯度只落在这些「高置信错误」token 上。

为什么只罚一半:标准 GRPO 里正优势梯度会抵消对失败轨迹中局部正确 token 的误伤;TTPO 里 GRPO 独占负样本、没有这层抵消,必须主动减少附带伤害。

4.3 统一目标与训练配置

$$L_{\text{TTPO}} = \frac{1}{|B|}\Big(\sum_{k\in P} L_{\text{OPSD}}(k) + \lambda \sum_{k\in N} L_{\text{GRPO}}(k)\Big),\quad \lambda = 0.1$$

实现细节:Qwen3-1.7B/4B/8B + LoRA(r=64, α=128)全线性层;每题 $K=64$ 采样(保证低通过率难题的多数投票可靠性)、最大 16k token 防截断导致提不出答案;从 64 条中选 8 条(正负各半)做梯度更新。评测五个竞赛级基准(AIME 2025/2026、HMMT 2025/2026、BRUMO 2025),Avg@12、温度 1.0。

五、评估指标与实验证据

5.1 有标签数据的无标签用法:追平并超过用标签的基线

OpenThoughts 设置(数据有标签但 TTPO 不用;OPSD/GRPO 用):

模型Base+GRPO(用标签)+OPSD(用标签)+TTPO(不用标签)
Qwen3-1.7B34.635.739.740.1
Qwen3-4B56.057.558.458.6
Qwen3-8B58.661.261.762.6

三个规模全部反超:伪标签 + 不对称目标可以替代真值监督。附带里程碑:TTPO 的 4B(58.6)已等于 8B base(58.6)。

5.2 纯 TTT 设置:无标签场景的明显领先

直接在测试题上训练(无任何方法用标签):

模型Base+TTRL+OPSD-TTT+TTPO
Qwen3-1.7B38.040.241.945.2
Qwen3-4B57.458.859.461.1
Qwen3-8B60.763.063.765.3

1.7B 上领先 TTRL +5.0、OPSD-TTT +3.3,对 base 绝对增益 7.2 个点。TTPO 的 4B(61.1)再次超过 8B base(60.7)。无 thinking 模式下增益 +25.2% 到 +36.4%,是用标签 OPSD 增益的数倍。

5.3 消融:每个设计选择都有独立证据

  • 更新策略分配(1.7B AIME26 TTT,Avg@12):完整 TTPO 48.9 > 只有 FKL 46.7 > OPSD+多数投票 46.3 > 负样本 FKL 43.9 ≈ 正样本 GRPO 37.2 = 反转分配(pos=GRPO, neg=FKL)37.2。反转最差——正样本上脆弱的强化 + 负样本上被污染的蒸馏双重叠加。
  • token 级选择:去掉正样本降权 46.5→43.3;去掉负样本掩码 46.5→45.4(且 BRUMO 掉到 50.0)。
  • 特权信息形态:thinking 教师 + 答案注入最佳(46.5);注入完整轨迹反而 41.1(挤占教师自己的推理);non-thinking 教师 + 答案 33.6(分布差距太小,答案推不动)。

5.4 三个深度发现

  • 伪标签 > 真标签(反直觉):把伪标签换成真标签(TTPO w/ GT)反而低于 TTPO;直接在 AIME26 上泄漏训练的 OPSD 只有 44.4。原因一:真标签太难匹配——难题上正样本极少甚至为零,FKL 分支饥饿、GRPO 优势近零,两个分支都失活;多数投票标签更容易被匹配,维持健康的正负划分。原因二:AIME 答案是短数字,对 thinking 教师的分布推动太弱。
  • 自进化循环:训练中 Avg@12 稳步升到 base 的 Maj@12(多数票的集体知识被蒸馏进单样本性能);随后 Maj@12 自身也上升——模型变强→rollout 质量变高→伪标签更准→训练上限抬高。初始监督的天花板被自我抬升。
  • 跨基准泛化:在 AIME26 训练同时提升 HMMT26(+3.5)与 BRUMO25(+2.9);任一基准训练均提升另两个——学到的是通用推理能力而非题目特化。

六、效果优势的根源解释

链条一:不对称分配让两种监督各就各位 → 伪标签错误的两类暴露面同时被压缩。伪标签错误时:纯 FKL 污染全部 $K$ 条轨迹(教师整体条件在错误答案上);TTPO 只有小集合 $P$ 受影响,且教师条件在学生自己的答案上——错了也退化为安全的 thinking→non-thinking 蒸馏(消融证据:positive-only FKL 46.7 > all-FKL 46.3 > negative-FKL 43.9)。负样本上 GRPO 只用「不在多数簇」这个与伪标签内容无关的事实,79% 的负样本惩罚是对的。反转分配(37.2)把脆弱的强化放在正样本、被污染的蒸馏放在负样本,两类错误同时爆发——反向验证了分配方向本身携带大部分增益。

链条二:token 级选择把梯度聚焦到学习价值高的位置。蒸馏侧降权已收敛位置(学生熵低 + 师生散度低),梯度不被白开水 token 稀释;惩罚侧掩码只打高置信错误,规避了无正优势抵消时的附带伤害。两个消融(-3.2 与 -1.1/BRUMO -4.7)分别量化。

链条三:多数投票的自校准 → 与模型当前能力匹配的课程。伪标签由模型自己的输出分布决定:模型弱时伪标签温和(容易匹配、正负均衡,两分支都活跃);模型变强时伪标签自动变准。对比真标签——永远高出模型能力一截,难题上正样本饥饿。这解释了「伪标签超过真标签」的反直觉结果,也解释了自进化循环:监督难度随能力水涨船高。

链条四:熵的证据。训练中 TTPO 的策略熵持续高于用真标签的版本——多数投票与蒸馏联合促进探索,而探索最终转化为超过「完美标签」的最终性能。

七、必要知识反推

7.1 领域知识层

  • OPSD 的机制细节:特权信息如何构造教师、前向 KL 逐 token 比较、on-policy 蒸馏与普通蒸馏的区别——TTPO 的正分支直接建立其上。
  • GRPO 的组相对优势计算:组内相对基线如何产生负优势、正优势梯度在标准 GRPO 里的抵消作用——不知道这一点就理解不了负样本独占时的掩码必要性。
  • 噪声标签学习中的负学习思想(NLNL, 2019):「说不是什么」在标签错时仍可靠——TTPO 在 token 级的现代化转译。
  • 竞赛级基准的伪标签统计:85% 错误率与 79% 负样本错误率这类一手测量——没有这类数据驱动的观察,不对称设计无从谈起。

7.2 方法论知识层

  • 信号可靠性分析:对每种监督信号问「它在标签错误时还成立吗」,把 85/79 两个统计量转化为设计依据。
  • 消融矩阵设计:更新策略 2×2 全组合(FKL/GRPO × P/N)、token 选择的两个独立消融、特权信息 2×2(答案/轨迹 × thinking/非 thinking 教师)。
  • TTT 评测的防泄漏纪律:OpenThoughts 设置里标签只给基线不给 TTPO;泄漏实验(OPSD Leakage)作为对照明确标出。

7.3 工程知识层

  • LoRA 微调设施:r=64/α=128 全线性层,小模型上跑百步级训练。
  • 采样预算管理:K=64 采样 + 16k token 上限 + 8 条选入梯度(正负各半)——可靠投票与计算预算的平衡。
  • 数学等价聚类:答案按等价类而非字符串聚类,才能正确统计共识。

八、论文中可以提取的通用性灵感

8.1 不完美的监督源要按「错误暴露面」分配用法(方法论级)

核心思想:面对一个不可靠的监督信号,不要问「它能不能用」,要问「它的错误在哪种用法下伤害多大」——把它用在错误不敏感的用法上,绕开敏感用法。 论文证据:同一伪标签,用作 GRPO 的「不一致判据」安全(79% 负样本确实错)、用作蒸馏教师的条件答案危险(逐 token 放大);反转分配立刻从 48.9 掉到 37.2。 推广场景:① 众包标注的用法设计(适合当负例筛选不适合当金标准);② 弱监督学习;③ LLM 评审分数的用法分层(当 rerank 信号 vs 当训练标签)。

8.2 「不是什么」往往比「是什么」更可靠(机制级)

核心思想:当正面判断容易出错时,负面判断(排除法)常常依然可靠——因为错误答案的空间远大于正确答案,随机命中的负判断大概率真负。 论文证据:伪标签 85% 错误,但惩罚不同意 rollout 在 79% 情况下正确——负判断与伪标签内容无关。 推广场景:① 噪声标签分类的互补学习;② 安全校验(证明不安全比证明安全容易);③ 医疗诊断的排除法;④ 代码评审的「这样写必错」类意见。

8.3 自生成的监督要与当前能力匹配(战略级)

核心思想:超出能力太多的「完美监督」可能反而不如与能力匹配的「不完美监督」——前者让学习信号饥饿,后者维持健康的学习流量。 论文证据:真标签的 TTPO w/ GT 与泄漏 OPSD(44.4)都低于伪标签 TTPO(48.9);难题上真标签几乎产生不了正样本。 推广场景:① 课程学习的难度设定;② 教练给运动员的分组对抗强度;③ 自训练数据的选择阈值(只选模型接近能做的题)。

8.4 自监督飞轮:监督质量随能力共同上升(战略级)

核心思想:如果监督信号由系统当前输出生成,那么训练提升能力→能力改善监督→更好的监督进一步拉升能力,天花板可以高于初始监督。 论文证据:Maj@12 在训练中与 Avg@12 同步上升,最终超过用真标签训练的版本。 推广场景:① self-play 与自博弈;② 合成数据的迭代生成;③ 用户反馈系统的冷启动演化。

8.5 token 级选择:梯度也要讲性价比(工程级)

核心思想:无论蒸馏还是 RL,token 不是平等的——已收敛位置不值得教,低概率异常位置不该罚;用熵与散度两个免费信号做筛选就能显著提效。 论文证据:去掉正样本降权 -3.2、去掉负样本掩码 -1.1(BRUMO -4.7)。 推广场景:① 蒸馏系统的 token 采样预算(TIP 的 <10% 结论);② RL 的信用分配精细化;③ 数据清洗中的难例挖掘。

8.6 小模型的无标签越级路径(工程级)

核心思想:测试时训练 + 好的自监督设计,可以让 4B 追平 8B、让 1.7B 提升 7 个点——推理算力可以换模型规模。 论文证据:TTPO-4B(58.6/61.1)分别等于或超过 8B base(58.6/60.7);无 thinking 模式增益 +25.2%~+36.4%。 推广场景:① 端侧模型部署前的领域内适配;② 无标注垂直领域(法务、医疗、内部代码)的定制;③ 竞赛/考试类一次性任务的算力换分策略。