论文链接:J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 发表时间:2026年8月(arXiv:2608.26582v1,2026-08-27提交) 机构:KAIST(韩国科学技术院),单一高校,无企业合作。Gyouk Chu 与 Myeongho Jeon 为共同一作,通讯作者 Eunho Yang 领域标签:LLM 自进化 · 自博弈训练(cs.LG / cs.CL)
一、论文背景
1.1 自进化大模型:为什么要摆脱人类监督
大语言模型的训练 traditionally 依赖人类标注:人类设计任务、人类写出标准答案、人类对回答排出好坏。这条路径有一个根本性瓶颈——成本与天花板。如果 AI 系统最终要在能力上超越人类,那么依赖人类标注的监督方式既昂贵(聘请专家标注数学题、写作范文代价极高),又在逻辑上自相矛盾:你无法让水平有限的人类为超越自己的模型提供可靠的改进信号。这就是自进化(self-evolving)LLM 研究的出发点:让模型自己产生训练任务、自己产生学习信号,减少甚至完全消除人类监督。
1.2 自博弈训练:Challenger 与 Solver 的对抗共舞
自博弈(self-play)是自进化的核心技术之一,思想源自围棋 AI(AlphaGo Zero 的左右互搏):从同一个模型出发实例化两个对立角色,让它们在对抗中互相把对方推向更高水平。在大模型语境下,这两个角色通常是:
- Challenger(挑战者/出题者):生成训练任务,目标是出"能让 Solver 得低分"的难题;
- Solver(解题者):回答 Challenger 出的题,目标是拿高分。
这个过程类似师生对抗:老师专攻学生的薄弱环节出题,学生则见招拆招。随着 Solver 变强,Challenger 被迫出更难的题;更难的题又逼出更强的 Solver。任务的难度前沿在博弈中不断向外推进,全程不需要任何外部数据。
1.3 可验证域与不可验证域:一道分水岭
自进化方法目前主要在可验证域(verifiable domains)成熟落地,例如数学、代码——这些任务有客观的标准答案,可以用规则(答案比对、代码执行)直接判定对错,学习信号明确且廉价。但现实中的大量任务属于不可验证域(unverifiable domains):写一封辞职信、给出旅行规划、创作小说片段。这类任务没有唯一正确答案,质量由人类偏好定义,无法用检查条件来判定。
在不可验证域,学习信号只能来自 Judge(裁判/奖励模型):用一个打分模型给回答打分,代替验证器。这是 RLHF(人类反馈强化学习)的标准做法。
1.4 Bradley-Terry 奖励模型训练:Judge 是怎么炼成的
主流奖励模型(Judge)通过 Bradley-Terry(BT)损失训练:给定同一个任务的两个回答——一个较好的(chosen,记 $y^+$)和一个较差的(rejected,记 $y^-$)——训练 Judge 给 $y^+$ 的打分高于 $y^-$。BT 损失形式为:
$$L_J(\phi) = -\mathbb{E}_{(x, y^+, y^-)}\left[\log \sigma\left(J_\phi(x, y^+) - J_\phi(x, y^-)\right)\right]$$直觉上就是"排序学习":不断惩罚 Judge 打反了的偏好对,直到它的打分顺序与人类偏好一致。BT 训练的前提是有可靠的偏好对——谁好谁坏必须事先知道。这正是本文要解决的核心难题(见下)。
1.5 核心矛盾:固定 Judge 是自进化的天花板
把 Judge 引入自进化循环后,出现了一个结构性矛盾:冻结不动的 Judge 只能把 Solver 推向 Judge 自己已经内化的偏好。Judge 的判别能力有上限,一旦 Solver 强到饱和了 Judge 能做出的所有区分,Judge 的打分就不再能区分好回答与坏回答,奖励信号退化为噪声,继续训练不再有收益——自进化的程度被 Judge 自身的评估能力所限定。
直觉类比:一个只有初中阅卷能力的老师,无法把学生培养到大学水平——不是因为学生不行,而是老师批不出卷子的优劣了。要让师生系统持续进步,老师的阅卷能力必须跟着学生的水平一起长。但让 Judge 在闭环里自己训练自己,马上会遇到"循环论证"问题:如果所有信号都来自同一个模型,系统中还能进入什么新的偏好信息?如果用 Judge 自己的打分构造偏好对(高分者为 chosen),只会不断强化 Judge 已有的偏见。J-Zero 正是针对这个难题提出的。
1.6 GRPO:本文的策略优化引擎
GRPO(Group Relative Policy Optimization) 是 DeepSeekMath 提出的强化学习算法,也是当前 LLM 强化学习训练(如 DeepSeek-R1)的主流选择。其核心思想是:不用单独的 Critic 网络估计基线,而是对同一任务采样一组(group)回答,用组内奖励的相对优劣计算优势:
$$\hat{A}_{i,j} = \frac{r_{i,j} - \text{mean}(\{r_{i,j}\})}{\text{std}(\{r_{i,j}\}) + \varepsilon}$$即组内高于平均的回答被强化、低于平均的被削弱,再配合 PPO 式的裁剪与 KL 约束保证训练稳定。GRPO 天然适合自博弈场景——每个任务本来就采样多个回答,组内相对比较即可驱动策略更新,无需额外的价值网络。J-Zero 中 Challenger 与 Solver 的每一次更新都用 GRPO 完成。
二、论文定位和关联工作
J-Zero 处于"零数据自进化"研究脉络的最前沿。按对外部资源的依赖程度,这条脉络可以分为三条谱系:
谱系一:依赖外部任务与标签的自进化
早期工作(STaR、ReST、ReST-EM、ReST-MCTS*、Iterative Reasoning Preference Optimization 等)用带标准答案的现成任务集迭代训练 Solver,重点是根据模型当前能力自适应调整训练过程。这类方法受限于人类标注的规模与范围——监督之外没有直接的改进路径。
谱系二:依赖外部种子资源的自进化
第二条谱系减少了对标签的依赖,但仍需要外部数据源:SPIN(Self-Play Fine-Tuning)用 SFT 语料中的参考回答与模型自己的回答对比构造偏好;Self-Rewarding 系列(Yuan et al. 2024 及大量后继)让模型既当策略又当裁判,但提示词来自外部种子数据集;SPICE 等工作从原始语料中挖掘新任务。共同局限:自进化的范围锚定在初始资源上,真正可学的新信息有限,还可能强化模型已有的偏见。
谱系三:零数据自进化(本文所在)
第三条谱系彻底移除外部数据依赖,分歧主要在奖励从哪里来:
- Absolute Zero:用代码执行器验证自己出的编程题,奖励来自执行反馈——只适用于可验证域;
- R-Zero:用对采样回答的多数投票(majority vote)替代外部验证器,多数派答案视为正确。后续 Tool-R0、Dr. Zero 等将此策略推广到工具使用、搜索 agent 等场景。多数投票廉价且难以被钻空子,但本质上仍是"伪验证器",难以延伸到没有事实答案的开放域;
- Kuba et al. 2025:把零数据自进化扩展到不可验证域,但依赖静态的 Judge——正如背景所述,这会给改进设上限;
- G-Zero(同期工作):同样注意到固定 Judge 的上限问题,解法是用 Challenger 生成的提示(hint)在 Solver 回答之间构造偏好对,然后用 DPO 直接训练 Solver——它完全绕开了 Judge,评估信号本身并没有"学习能力"。
定位对比
| 维度 | R-Zero | G-Zero | J-Zero(本文) |
|---|---|---|---|
| 外部数据需求 | 零 | 零 | 零 |
| 奖励来源 | 多数投票(伪验证器) | 提示构造的偏好对 + DPO | 共同进化的 Judge 打分 |
| 评估信号能否进化 | 不能 | 不能(DPO 一次性使用) | 能(Judge 逐迭代更新) |
| 不可验证域 | 弱(多数投票不适用) | 弱(几乎不超过 base) | 强(+11.23 分) |
| 峰值迭代 | 第 2 迭代后退化 | 第 2 迭代后退化 | 第 10 迭代仍在单调改进 |
定位结论:J-Zero 填补的空缺是——零数据、且评估信号本身可学习并持续改进、同时覆盖可验证与不可验证域的自进化框架。与最接近的同期工作 G-Zero 相比,J-Zero 的关键差异在于直接让 Judge 在自博弈闭环内共同进化(co-evolve),评估信号本身逐轮变强,而不是用一次性的偏好对绕过评估问题。
三、问题定义
3.1 从具体场景到抽象问题
具体场景:在没有外部数据和人类反馈的条件下,让一个 LLM 在数学推理和开放生成这两类任务上持续自我提升。
核心洞察:零数据自进化的瓶颈不在"任务从哪来"(Challenger-Solver 对抗已解决),而在"评估信号从哪来、且不会枯竭"。J-Zero 发现了一类此前未被利用的监督来源——闭环内的结构性不对称(structural asymmetries):存在一些特殊配置,其中两个回答谁好谁坏由构造方式先验决定,不需要任何外部打分。
两类结构性不对称:
- 角色不对称(role asymmetry):Solver 被显式优化来答题,Challenger 只被优化来出题、从未学过答题——所以对同一道题,Solver 的回答系统性优于 Challenger 的回答。好与坏由角色分工决定。
- 子任务放大(subtask amplification):把难题分解成 3–5 个简单子任务、分别解答再组合(分治法),得到的回答系统性优于一次性直出的回答。好与坏由分治原理决定(弱者做简单子任务比做整体更可靠,来自 iterated amplification 思想)。
3.2 形式化定义
给定初始 Challenger $C_{\theta_c}$、Solver $S_{\theta_s}$、Judge $J_\phi$(三者均可训练,无外部数据),求三者的联合进化策略,使 Solver 最终能力最大化,形式化为对抗博弈加 Judge 适应:
$$\min_{\theta_c} L_C(\theta_c; \theta_s, \phi), \quad \max_{\theta_s} R_S(\theta_s; \theta_c, \phi), \quad \text{Judge 更新:} \min_\phi L_J(\phi; \theta_c, \theta_s)$$其中 Solver 目标就是 Judge 打分的期望 $R_S = \mathbb{E}[\sigma(J_\phi(x, y))]$;Challenger 损失为负的复合奖励(难度 + 多样性 + 格式);Judge 的 BT 损失只依赖闭环内构造的两类偏好对 $\mathcal{D} = \mathcal{D}_{role} \cup \mathcal{D}_{amp}$。
约束(Judge 共进化的两条铁律):(i) 偏好对完全在闭环内构造,无外部监督;(ii) 偏好标签不依赖 Judge 自身产生的信号——否则就是自我强化。
3.3 这个抽象的精妙之处
妙处在于打破了"闭环训练无新信息"的直觉。表面上看,三个模型互相训练是循环论证;但两类偏好对的标签来源不是任何模型的打分,而是角色分工与分治结构这两条先验成立的不等式($y_S \succ y_C$ 恒成立、$y_{amp} \succ y_S$ 结构性成立)。相当于在一个封闭系统里找到了两个不依赖系统自身输出的"信息注入口",让 Judge 每轮都能获得新的、非自指的监督信号。这是整篇论文最核心的智力贡献。
四、问题解法
J-Zero 的每次自进化迭代包含三个阶段,循环执行。
4.1 阶段一:Challenger 训练——学会出难题
类比:像出卷老师根据学生答题率调整题目难度——全班平均分高的知识点要多出题、出难题。
做法:Challenger 采样一批任务(每批 N 个),Solver 对每个任务生成 M 个回答,Judge 打分后取平均分 $\bar{r}_i$。Challenger 的难度奖励定义为 $1 - \bar{r}_i$:Solver 越做不好的题,奖励越高。为防止 Challenger 偷懒(生成重复题或格式崩坏的题),复合奖励还叠加:
- 重复惩罚:用 1−BLEU 计算任务间两两距离,把相似任务聚类,按簇的相对大小施加惩罚 $r^{rep}_i = \lambda|C_k|/N$——出的题跟别人撞车就扣分;
- 格式检查:回答必须包在
<question>标签内且格式完好,否则直接记 −1 分。
由于所有任务都来自同一条生成指令,它们天然构成一个 GRPO 组,用 GRPO 最大化复合奖励(即最小化负奖励损失)更新 Challenger。输入:任务批 + Judge 打分;输出:更新后的出题策略,任务前沿外推。
4.2 阶段二:Solver 训练——在能力前沿上做题
类比:像分层作业——只做"分数方差大"的题,即那些有时做对、有时做错的题,因为太简单的题和完全不会的题都学不到东西。
做法:更新完 Challenger 后冻结它,采样更大的候选任务池。对每个候选任务让 Solver 生成 M 个回答,计算 Judge 打分的组内标准差 $s_i = \text{std}(\{r^S_{i,j}\})$,选标准差最大的 top-K 任务训练 Solver。这个准则有理论背书:Bae et al. (2026) 证明了在一个任务上训练的期望策略改进下界于该任务奖励的方差——分数方差大的任务正是学习空间大的任务,它们位于 Solver 当前能力前沿附近。这也可以看作 R-Zero"信息带"(中等正确率的题)过滤器在连续打分下的推广。
随后在选出的 K 个任务上,每个任务采样 G 个回答、Judge 打分作奖励,用 GRPO 最大化奖励更新 Solver。输入:前沿任务 + Judge 打分;输出:更新后的解题策略。
4.3 阶段三:Judge 训练——评估能力跟上进化(核心创新)
类比:阅卷老师也要进修——而且进修教材不是自己以前的打分记录(那只会原地踏步),而是两份"标准答案对照卷":一份是"专人答题 vs 出题人顺手答题"的对照,一份是"分步骤精做 vs 匆匆直做"的对照。
做法:在一批留出任务(held-out tasks,不与 Solver 训练任务重叠)上构造两类偏好对,用 BT 损失从上一轮的 Judge 参数出发继续训练:
(1)角色不对称偏好对 $\mathcal{D}_{role}$
$$(y^+_{role}, y^-_{role}) = (y_S, y_C), \quad y_S \sim S_{\theta_s}(\cdot|x), \quad y_C \sim C_{\theta_c}(\cdot|x)$$chosen 来自 Solver,rejected 来自让 Challenger 答自己出的题(用与 Solver 相同的答题提示)。偏好方向由训练目标的结构保证:Solver 一直被优化来答题,Challenger 从未获得答题信号,所以 $y_S \succ y_C$ 系统性成立。关键性质:这个标签与 Judge 当前打分完全无关,因此可以在 Judge 失准的区域重新注入有判别力的监督。
(2)子任务放大偏好对 $\mathcal{D}_{amp}$
三步流水线:
- 分解:Challenger 把任务 $x$ 拆成 $n_x$ 个更简单的子任务 $\{q_k\}$(3–5 个,每个都比原任务简单且必要,前后有序);
- 分治:Solver 在原任务上下文中逐个解答子任务;
- 组合:Challenger 把各子答案整合成一个完整回答 $y_{amp}$。
chosen 是分治组合出的放大回答,rejected 是同一 Solver 的一次性直出回答。偏好方向由分治原理保证:弱模型做简单子任务比做整体任务更可靠,聚合后的回答更完整准确。
两类偏好对的作用方向不同:角色不对称对教会 Judge 区分Solver 当前能力之下的回答质量;子任务放大对则把 Judge 的视野推到 Solver 单次回答能力之上——分治回答是"超越当前 Solver 前沿"的样本,让 Judge 的评估标准先行到达 Solver 即将进入的区域。这正是 Judge 能持续领先 Solver 一步、奖励信号不枯竭的机制来源。
BT 更新:两类偏好对等比例混合,最小化式(13)的 BT 损失,从上一轮 Judge 出发微调。Judge 训练始终聚焦在自进化当前前沿上——这里恰恰是回答质量差异最难评估、Judge 最需要进步的地方。
4.4 全景机制表
| 组件 | 训练算法 | 奖励/监督信号来源 | 信号是否依赖 Judge 打分 | 作用 |
|---|---|---|---|---|
| Challenger | GRPO | 1−平均分 + 重复惩罚 + 格式检查 | 是(用 Judge 度量难度) | 外推任务难度前沿 |
| Solver | GRPO | Judge 对 G 个回答的打分 | 是(最大化) | 提升回答质量 |
| Judge | BT 损失 | 两类结构性偏好对 | 否(标签先验决定) | 评估能力跟上/领先 Solver |
| 任务选择 | — | 分数标准差 top-K | 是(用打分离散度) | 聚焦能力前沿任务 |
注意一个精巧的分工:Judge 打分被用作难度与选择信号(这没问题,因为它只要求打分有相对意义),而 Judge 自身的训练信号完全独立于自己的打分——从而在利用 Judge 的同时避免了自我强化循环。
五、评估指标与实验证据
5.1 实验设置
- 模型:Qwen3-4B-Base 与 Qwen3-8B-Base(Challenger 与 Solver 共用同一生成式初始化);Judge 用现成的 Skywork-Reward-V2-Llama-3.1-8B 初始化(判别式奖励模型)。verl 框架,4×B200 + 4×H200。每迭代 Challenger 训 5 步、Solver 训 15 步、Judge 训 8 步。
- 基准:11 个可验证 benchmark(7 个数学:GSM8K / MATH500 / Minerva / OlympiadBench / AMC23 / AIME24 / AIME25;3 个通用推理:MMLU-Pro / SuperGPQA / BBH;IFEval 指令遵循四指标)+ 3 个不可验证 benchmark(AlpacaEval 2.0、Arena-Hard-v2.0、EQ-Bench Creative Writing v3——分别衡量通用指令跟随胜率、难题/创意写作胜率、创意写作质量分)。任何一侧平均分开始下降即停止训练,取下降前最优 checkpoint。
- 主指标:域平均分(可验证 Overall = 三类域均分的均值;不可验证 Overall = 三 benchmark 均分),衡量自进化的幅度;
- 过程指标:逐迭代平均分曲线,衡量自进化的持续性——这是区分 J-Zero 与 baseline 的关键;
- 信号质量指标:偏好对 chosen 方的外部裁判(Claude Opus 4.8)胜率,衡量 Judge 训练数据是否可靠;
- 消融指标:逐组件去除后的 Overall 分。
5.2 主结果:两个域的全面提升
可验证域(Qwen3-4B-Base):
| 指标 | Base | R-Zero | G-Zero | J-Zero |
|---|---|---|---|---|
| 数学推理均分 | 44.31 | 48.36 | 45.66 | 51.20 |
| 通用推理均分 | 43.04 | 49.51 | 46.87 | 52.93 |
| 指令遵循均分 | 47.38 | 51.05 | 49.71 | 58.99 |
| Overall | 44.91 | 49.64 | 47.41 | 54.38(+9.47) |
代表性单项:AIME24 从 8.96 提升至 16.15(接近翻倍),AIME25 从 6.67 至 15.83,BBH 从 50.88 至 70.85。值得强调的是,R-Zero 是专为可验证域设计的方法,J-Zero 仍然超过它 4.74 分——说明更好的评估信号(进化中的 Judge)连可验证域也能反哺(可验证域中判断解题过程与表达质量的维度同样受益于判别式奖励模型)。
不可验证域(Qwen3-4B-Base)——差距最大的战场:
| 指标 | Base | R-Zero | G-Zero | J-Zero |
|---|---|---|---|---|
| AlpacaEval 2.0 | 6.22 | 11.38 | 9.20 | 28.56 |
| Arena-Hard (H.P.) | 2.50 | 2.50 | 3.00 | 4.80 |
| Arena-Hard (C.W.) | 0.90 | 1.50 | 1.40 | 2.20 |
| EQ-Bench C.W. | 20.83 | 24.59 | 21.26 | 30.36 |
| Overall | 9.58 | 12.66 | 10.89 | 20.81(+11.23) |
R-Zero 的多数投票奖励延伸不到开放任务,只涨 3.08 分;G-Zero 不用 Judge,只涨 1.31 分、几乎不超过 base;J-Zero 涨 11.23 分,其中 AlpacaEval 从 6.22 跃至 28.56。Qwen3-8B 上趋势一致(可验证 50.67→58.55,不可验证 13.23→23.41)。
5.3 持续性实验:十个迭代不封顶
这是本文最有说服力的实验。逐迭代曲线显示:R-Zero 与 G-Zero 都在第 2 迭代达峰后转入退化;J-Zero 在两个域上单调改进至第 10 迭代(训练预算上限),10 轮共涨 9.47 / 11.23 分。冻结 Judge 消融(只去掉 Judge 更新,其余保留)前 3 个迭代紧跟完整版,随后平台化,最终落后完整版 1.66 分(可验证)/ 4.44 分(不可验证)——分歧点正是 Solver 达到固定 Judge 评估上限之处。这组对照直接证明了 Judge 共进化是持续改进的充要成分。
5.4 偏好对可靠性:用外部裁判验证"标签先验成立"
论文没有假设两类偏好对的标签可靠,而是每一轮都把 Judge 训练对交给外部 LLM 裁判(Claude Opus 4.8)评判 chosen 是否真的更好(双向呈现消位置偏差、去掉平局):
- 角色不对称对:全程胜率 >60%,首轮高达 87.9%,随训练降到约 66%——下降不是标签不可靠,而是对抗课程越来越难,双方都答不好、差距自然收窄;
- 子任务放大对:前 3 轮不可靠(首轮仅 21.1%——分解的价值要等 Solver 能可靠解出子任务才兑现),第 4 迭代起越过 50%,后期稳定在 70–80%。
两条曲线在中期交叉:早期角色不对称对扛信号,后期子任务放大对接管——Judge 在整个训练过程中始终有可用的监督来源。这个实验同时解释了为什么两类偏好对缺一不可。
5.5 消融与副产品
4B 规模消融(Overall=37.59 为完整版):去掉整个 Judge 共进化 → 34.54(−3.05,其中不可验证掉 4.44);去掉子任务放大对 → 35.95(−1.64);去掉角色不对称对 → 36.62(−0.97)。子任务放大贡献更大,因为它负责把 Judge 推到 Solver 前沿之外——恰是持续改进最关键的方向。
副产品:共进化的 Judge 在独立奖励模型基准 RM-Bench 上也从 92.61 单调升至 93.95,其中 Hard 难度对提升 4.77 分(85.08→89.85)——Judge 在适应闭环的同时,绝对判别力不降反升,且增益恰好集中在"强策略继续进步最需要 Judge 分辨"的难度级别上。
六、效果优势的根源解释
本节从机制层面解释:为什么 J-Zero 能在幅度上超 R-Zero 4.74 分、在持续性上十个迭代不封顶,而所有 baseline 两迭代就退化。
6.1 baseline 的根本局限在哪里
R-Zero 的多数投票奖励是"伪验证器":它把可验证域的答案比对逻辑用共识近似。这在数学题上成立(多数答案通常是对的),但不可验证域没有可投票的事实答案——开放任务的"好"是风格、结构、受众适配、创造性等偏好的复合,多数投票无法度量。所以 R-Zero 在开放域的增益只有可验证域的一半左右。更深层地,多数投票信号本身不随训练进化:第 10 轮的投票信息量与第 1 轮同构,当 Solver 的错误模式从"答案错误"转为"答案正确但表达平庸"后,投票就再也无法区分好坏——信号先于能力枯竭。
G-Zero 的静态偏好对 + DPO绕开了 Judge,但代价是评估能力被一次性消费:DPO 把偏好对的信息转移进 Solver 后,系统内不存在任何随能力成长而成长的评估机制,下一轮面对更难的 Challenger 任务时,构造偏好对的难度激增而判别资源没有增加。
6.2 J-Zero 的因果链
核心因果链(持续性):
- 前提:Solver 的学习信号 = Judge 打分的组内相对优劣(GRPO 优势)。信号有效的充要条件是 Judge 打分在当前 Solver 的回答分布上仍有区分度。
- 固定 Judge 的失败路径:固定 Judge 只能把 Solver 推向 Judge 已内化的偏好上限 → Solver 饱和该上限后,其采样出的回答在 Judge 眼中难分高下 → 组内标准差坍缩、优势归零 → 训练信号消失 → 曲线平台化(这正是冻结 Judge 消融在第 3 迭代后与完整版分歧、最终落后 4.44 分的机制刻画)。
- J-Zero 的修复路径:Judge 跟随进化,且训练焦点始终是"当前前沿上的难分辨对"(BT 损失直接以纠正误排为目标)→ Judge 的评估标准始终高于 Solver 当前水平(子任务放大对提供的 chosen 是超越 Solver 单次前沿的样本)→ 打分在演进后的回答分布上保持判别性 → 组内标准差不坍缩 → 改进得以持续十个迭代。
为什么 Judge 的闭环训练不会自我强化(信息从哪进来的):
- 偏好标签由构造方式先验决定——角色分工(一个被训来答题、一个没有)与分治原理(解简单子任务更可靠)——而不是 Judge 打分 → Judge 每轮学到的是"独立于自己已有偏见"的排序信息 → 无自我强化循环。这与 Self-Rewarding(用自己打分最高/最低的回合作偏好对)形成本质对比,后者等于让 Judge 复读自己。
- 两类偏好对时间互补(5.4 节的双曲线交叉验证)确保 Judge 在任何阶段都有可靠信号——早期分治不可靠时角色不对称扛起(87.9% 首轮胜率),后期 Solver 变强、角色差距收窄时(66%),分治对超越单次前沿(70–80%)接管。
幅度优势的因果链:更可靠的逐轮评估 → 更干净的组内优势估计(GRPO 的关键输入)+ 更精准的前沿任务筛选(分数标准差在判别性强的打分下才有意义)→ 每一步策略更新都更接近真实的质量梯度 → 同样步数下涨幅更大。AlpacaEval 上 6.22→28.56 的跨越尤其体现了这一点:开放任务的质量提升完全由 Judge 驱动,Judge 的判别力上限直接变成了 Solver 的能力上限。
6.3 反事实验证
反事实链条在消融中完整闭合:去掉 Judge 共进化(冻结)→ 恰在第 3 迭代(Solver 触及固定 Judge 上限之时)分歧 → 最终落后 4.44 分;去掉子任务放大对(Judge 只能学到 Solver 能力之下的区分)→ 掉 1.64 分且主要损失在持续性上;去掉角色不对称对(Judge 早期缺乏可靠信号)→ 掉 0.97 分。三个反事实分别对应因果链中的三个环节,互相印证。
一句话总结根源:自进化系统的改进上限等于其评估信号的分辩上限——J-Zero 把评估者从常量变成变量,把上限从静态变成了随训练推进的动态前沿。
七、必要知识反推
假设让一个没有相关知识的人从零做出这项工作,他最少必须掌握什么?
7.1 领域知识层
- LLM 后训练与 RLHF 全景:必须知道 SFT、奖励模型、RLHF/PPO/DPO/GRPO 各自的位置与缺陷——尤其要清楚"不可验证域的学习信号 = 奖励模型打分"这一行业默认设定(Ouyang et al. 2022),否则无法定位"固定 Judge 上限"这个问题。
- 自博弈的机制与失效模式:理解 Challenger-Solver 对抗如何外推任务前沿(来自 R-Zero、Absolute Zero 一脉),也要知道现有零数据方法的奖励来源(执行器、多数投票)及其不可验证域失灵的原因。
- 奖励模型的训练原理:BT 损失、偏好对构造、判别式 vs 生成式 Judge 的区别。不理解 BT 训练对"可靠偏好对"的依赖,就不会意识到"标签从哪来"是核心难题。
7.2 方法论知识层
- Self-Rewarding 的教训:知道 Yuan et al. (2024) 用 Judge 自身打分构造偏好对的风险(自我强化偏见),才能推导出"标签不得依赖 Judge 信号"的设计铁律——这是本文最重要的负面前提知识。
- Iterated amplification / 分治思想:Christiano et al. (2018) 的"弱专家靠分解与组合被放大"原理,及其在递归摘要(Wu et al. 2021)与 least-to-most prompting(Zhou et al. 2023a)中的验证。没有这个知识,想不到"分治回答 > 直出回答"这条结构性不等式。
- 课程学习/难度筛选理论:Bae et al. (2026) 关于"期望策略改进下界于奖励方差"的理论结果,直接支撑了分数标准差 top-K 的任务选择准则。
- GRPO 的组相对优势机制:本文所有策略更新的引擎,必须理解其无 Critic、组内归一化的特性才理解为什么 Judge 打分的区分度(标准差不坍缩)是整个系统的命脉。
7.3 工程知识层
- 大规模 RL 训练栈:verl 框架、多卡(B200/H200)训练、Challenger/Solver/Judge 交替更新的调度(5/15/8 步配比)、KL 约束与裁剪超参的稳妥继承(沿用 R-Zero 配置)。
- 评估协议设计:14 个 benchmark 的官方评测细节(AlpacaEval 长度控制胜率、Arena-Hard 风格控制、EQ-Bench rubric 分、IFEval 四指标、avg@32 等),以及"任一域开始下降即停"的公平 checkpoint 选择规则。
- 裁判评估的方法学:用外部 LLM 裁判验证偏好对可靠性时必须双向呈现消位置偏差、剔除平局——没有这个意识,5.4 节的结论不可信。
7.4 知识融合的关键节点
- 节点一(问题发现):RLHF 领域知识(Judge 是不可验证域唯一信号)× 自博弈知识(闭环训练无外部信息)→ 识别出"固定 Judge 上限 + 闭环信息枯竭"的双重矛盾。
- 节点二(核心洞察):Self-Rewarding 的失败模式 × 系统内角色分工的结构 → 意识到"偏好标签可以由构造方式先验决定"——把监督来源从"模型的输出"换成了"系统的结构"。
- 节点三(持续性设计):分治放大原理 × Judge 需要领先 Solver 一步的需求 → 用 subtask-amplification 对把 Judge 的训练分布推到 Solver 前沿之外。
- 节点四(验证闭环):外部裁判方法学 × 逐迭代过程分析 → 用双曲线交叉证明两类信号的时间互补性,把"设计合理"升级为"实证成立"。
八、论文中可以提取的通用性灵感
灵感一:评估者必须与被评估者共同进化
核心思想:任何依赖内部评估驱动的自改进系统,其改进上限 = 评估器的判别上限;要让改进不封顶,评估器本身必须是被训练的变量而非固定常量。
论文证据:冻结 Judge 消融在第 3 迭代后平台化、最终落后 4.44 分;完整版单调改进至第 10 迭代。
推广场景:(1) 自动化机器学习——神经架构搜索中的性能预测器应随搜索推进持续再训练;(2) 教育 AI——自适应学习系统的诊断模型需随学生成长更新;(3) 代码生成 agent——测试生成器(评估器)应与编码模型共同进化,而不是用固定测试集;(4) 内容推荐——审美/质量打分模型需跟随创作者生态的演化。
灵感二:从系统结构中挖先验标签,而非从模型输出中挖
核心思想:封闭系统缺乏外部监督时,应寻找"由构造方式决定优劣"的结构性不对称——角色分工、计算路径的复杂度差异——它们是独立于模型当前信念的可靠标签源,天然免疫自我强化。
论文证据:role-asymmetry 对首轮 87.9% 外部裁判胜率、全程 >60%;其标签与 Judge 打分完全无关,避免了 Self-Rewarding 式的偏见复读。
推广场景:(1) 数据合成——用"精心构造 vs 随手生成"、“分步 vs 一步"自动造带标签的训练数据;(2) 多 agent 系统——不同专化角色的输出质量排序可作为免费的监督信号;(3) 自监督学习——增强视图 vs 原视图的角色不对称本质上是同一原理的视觉版本;(4) 机器人技能学习——“分解后执行的子技能成功率高于整体执行"可用于构造技能偏好。
灵感三:分治 = 超越当前能力前沿的样本生成器
核心思想:一个弱系统通过"分解—逐个击破—组合"能产出超越自身一次性上限的结果;这些"超前沿样本"是训练评估器(或教师信号)面向未来的最佳教材。
论文证据:subtask-amplification 对在 Solver 成熟后胜率达 70–80%,把 Judge 视野推到 Solver 单次回答之上;消融中去掉它掉分最多(−1.64)。
推广场景:(1) 知识蒸馏——用 ensemble/分治产生的伪标签训练单模型超越自身;(2) 合成数据——用慢思考(长流程)输出作为快思考模型的训练目标;(3) 搜索与规划——MCTS 中分解评估引导的树搜索;(4) 科学发现自动化——把大假设拆成可验证的小假设再组合。
灵感四:互补信号的时间错峰调度
核心思想:当单一监督源只在部分训练阶段可靠时,可以组合多个"可靠期错峰"的信号源,让系统在任何阶段都有可用监督——前提是明确每个信号的适用窗口。
论文证据:role-asymmetry 早期可靠(87.9%→66%)而 subtask-amplification 后期可靠(21.1%→70–80%),两曲线中期交叉,Judge 全程无监督空窗。
推广场景:(1) 课程学习——不同难度的数据源按训练进度切换权重;(2) 多教师蒸馏——强弱教师的贡献随学生水平动态调整;(3) 迭代自训练——早期用保守信号(共识、规则)、后期用激进信号(模型自评)。
灵感五:用组内方差定位学习前沿
核心思想:“输出质量方差最大处 = 学习空间最大处”——选择训练样本时,方差(而非均值或错误率)是期望改进的理论下界,应作为数据选择的一级准则。
论文证据:任务选择用 Judge 打分的组内标准差 top-K,理论依据为 Bae et al. (2026) 的方差下界定理,是 R-Zero 二值"信息带"的连续推广。
推广场景:(1) 主动学习——选模型预测最不确定(方差大)的样本标注;(2) 强化学习探索——优先探索回报方差高的状态—动作区域;(3) A/B 测试——方差大的策略差异最值得投入流量分辨;(4) 个人学习——刻意练习应聚焦"时对时错"的能力边界,而非已掌握或完全不会的内容。
附录:迭代流程速览
一轮 J-Zero 迭代的三阶段(以 4B 规模为例):
- Challenger 更新:出 N 道题 → Solver 各答 M 次 → Judge 打分取均值 → 难度奖励 1−r̄ + 重复惩罚 + 格式检查 → GRPO 更新(5 步);
- Solver 更新:冻结 Challenger,扩大候选任务池 → 按打分标准差选 top-K 前沿任务 → 每题采 G 答、Judge 打分 → GRPO 最大化奖励(15 步);
- Judge 更新:留出任务上构造 role-asymmetry 对(Solver 答 vs Challenger 自答)与 subtask-amplification 对(分解-分治-组合 vs 一次性直出)→ 等比混合 → BT 损失微调(8 步)。
如此循环十轮,三个角色互为阶梯:Challenger 推任务前沿、Solver 推能力前沿、Judge 推评估前沿——最终结论也正在于此:一个自进化模型的改进极限,就是它的评估者所能看见的极限。