Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读
RLVR 训练有个广为人知的暗面:策略熵不断下降、模型越来越自信,大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法(熵正则、梯度校准、奖励设计)都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路:让一个 2B 小模型先生成部分推理前缀,再让目标大模型接着写完——而且小模型的前缀大多质量堪忧(多数『无实质指导』甚至『误导』),收益恰恰来自这种『不熟悉』而非『正确』。方法极简:按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练,pass@128 即从 67.76 恢复到 70.71(接近 base 的 72.15)。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』,这是本文最干净的洞察。