ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读
测试时强化学习(TTRL)靠答案自投票构造奖励,但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL:从题面自构造无输出探针输入,用候选程序行为一致性构造 Probe Consensus Reward;再用 ERPO 把 PCR 当作’负信号为主’的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序,配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3,零样本迁移 CodeContests 25.1→42.1,是唯一同时提升 pass@1 与 pass@k 的无标签方法。