Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读
- 论文链接:arXiv:2608.17253v2
- 代码仓库:https://github.com/DrStranded/Co-RL
- 发表时间:2026 年 8 月(v2 更新于 2026-08-19)
- 机构:Johns Hopkins University、UC San Diego、University of Exeter、Independent Researcher;通讯作者 Yijiang Li / Nuno Vasconcelos(UCSD)
- 领域标签:cs.LG(强化学习、后训练、多智能体、推理)
一、论文背景
这一部分回答一个问题:为什么"无标签的推理强化学习"是一个真问题,而且是一个越来越紧迫的问题?
RLVR(Reinforcement Learning with Verifiable Rewards)是过去两年大模型推理能力跃升的核心引擎。以 GRPO 为代表的策略优化方法配合可验证奖励,催生了 DeepSeek-R1 这样的推理模型。但这条路线有一个结构性前提:每个训练样本都要有一个真值答案,奖励函数本质上就是"最终答案与真值比对"的布尔值。
这个前提正在成为瓶颈,而且是以一种有些反直觉的方式:模型的推理能力越强,真值标签越稀缺。原因很直接——当目标能力接近或超过人类能可靠评估的水平时(论文引用 Yue et al. 2025 的分析),标注本身就成了不可能任务。研究生级别的 GPQA 题目、前沿竞赛数学、复杂代码正确性验证,这些恰恰是 RLVR 最想攻坚、而人类标注者最无法可靠覆盖的区域。标签的稀缺度与任务的价值密度成正比,这是 RLVR 的根本困境。
为了摆脱真值依赖,学界发展出了"自奖励 RL"(self-rewarding RL)路线:模型从自己的生成结果中构造奖励信号。论文梳理了三条主要支线:
| 支线 | 代表方法 | 奖励信号来源 |
|---|---|---|
| 多数票一致性 | TTRL(Test-Time RL) | 自己采样 K 个回答,多数票答案当伪标签,与自己一致的回答得奖励 |
| 自确信度 | Intuitor | token 级预测分布与均匀分布的 KL 散度(置信度) |
| 预测熵 | RENT | 自己预测分布的熵,熵低得奖励 |
| 跨输入一致性 | Co-rewarding | 改写后的问题、或慢更新的 EMA 模型副本 |
这三条支线形式各异,但有一个共同的软肋:所有信号都源自被优化策略自身的预测分布。没有外部参照的训练会放大已有偏见、压缩回答多样性,最终导致输出同质化甚至训练坍缩。论文在训练动态图中给出了直接证据:TTRL 长时间训练后退化坍缩,RENT 奖励方差迅速归零并伴随长度爆炸,多个基线直接发散离场。
这里可以用一个类比讲清楚问题的本质。自奖励 RL 就像学生自己给自己批改作业:做得多的题型越批越顺,错得一致的题目越批越自信——批改标准本身是从自己的答案里长出来的,错题不会被纠正,只会被巩固。Co-RL 则像让两个不同背景的学生互相批改作业:一个代数直觉强、一个几何训练多,各自的盲区恰好是对方的舒适区,交叉批改让双方都能在自己会做错的地方拿到矫正信号。
这个类比背后有一个严格的理论对应物(论文 Proposition 2):自奖励的更新方向由 sign(p−1/2) 决定——只要当前犯错的概率超过一半,错误就会被继续放大而不是修正。这就是"越批越自信"的数学结构。
论文要解决的核心问题由此浮出水面:**如何在不接触任何真值标签的前提下,为每个模型获得一个"足够独立"的学习信号?**Co-RL 的答案是把监督源从"自己"换成"另一些独立训练的模型"——既然不同模型族的错误不完美相关,每个模型都能提供对方无法从自身生成中推导出的矫正反馈。
二、论文定位和关联工作
Co-RL 站在四条研究脉络的交汇点上。理解它的定位,需要看清它从每条脉络中各取了什么、又拒绝了什么。
第一条脉络:自奖励 RL 谱系。 从早期的 self-rewarding language models、self-play fine-tuning,到 TTRL 的多数票伪标签、Intuitor 的自确信、RENT 的预测熵,再到零数据自进化系统(如 R-Zero、Absolute Zero)。这条谱系的共同局限在第一节已经分析:信号永远在单一模型的自身视野内循环,缺乏外部矫正信号是结构性缺陷而非工程缺陷。Co-RL 与它们的关系是"替换奖励源":保留 GRPO 优化器,把"自己给自己打分"换成"同伴给我打分"。
第二条脉络:co-training 两视图监督的经典理论。 这是论文真正的思想源头。1998 年 Blum 与 Mitchell 在 COLT 上提出 co-training:如果数据有两个条件独立的视图,两个学习器可以互相教学、从无标签数据中学习。但后续分析(Li et al. 2023——值得注意的是,这篇《Diverse co-training makes strong semi-supervised segmentor》的作者 Yijiang Li 正是本论文的通讯作者兼项目负责人)给出了关键反例:两个视图越相似,它们越会在同样的题目上犯同样的错,互相教学就退化为错误互相确认。这个理论直接预言了 Co-rewarding 的局限:改写问题或 EMA 副本构造出的"第二视图"毕竟源自同一个模型,误差强相关,只部分满足两视图学习所需的独立性。Co-RL 的选择是把"视图独立性"推到极限——不同模型族、不同规模、不同输入形式的独立模型,才是真正分离开的视图。
第三条脉络:对比学习中的坍缩与预防。 自监督表示学习早已直面过"自我监督导致坍缩"的问题:SimCLR 靠强数据增强加负样本对、BYOL 靠动量更新的 target 网络、DINO 靠 stop-gradient 操作来防止表示坍缩到平凡解。这些设计的共同精神是在教师与学生之间制造不对称性,切断自我强化的回路。Co-RL 的交叉奖励在机制上与 stop-gradient / 动量目标同构:监督信号来自一个不由当前梯度更新的对象(独立同伴),这正是它保持奖励方差不坍缩的机制根源。深度互学习(Deep Mutual Learning, Zhang et al. 2018)让对等网络互相提供监督,Co-RL 可视为这一思想在 RLVR 时代的复兴与理论化。
第四条脉络:多智能体 RL。 推理时多智能体辩论(multi-agent debate、round-table consensus)已经证明多个模型互评能提升推理,但那是推理时技术。训练侧的 CoMAS 把 LLM judge 打分的交互过程转化为奖励,MAPoRL / MARFT 共同训练多个 agent 对抗一个学习到的或共享的奖励模型。这些方法的共同依赖是额外评分基础设施:要么一个更强的 LLM judge,要么一个专门训练的奖励模型。Co-RL 与它们划清界限的方式非常彻底:零交互(除奖励阶段外 agent 之间无任何通信)、零 judge、零奖励模型——监督信号就是同伴的多数票,框架轻量且对称,每个 agent 同时是学习者也是监督源。
下面这张对比表浓缩了 Co-RL 在方法谱系中的位置:
| 方法 | 奖励来源 | 是否同一模型 | 是否需要 LLM judge / 奖励模型 | 坍缩风险 |
|---|---|---|---|---|
| TTRL | 自身多数票伪标签 | 是(同策略) | 否 | 高:自确认动力学,长时间训练退化 |
| Intuitor / RENT | 自身置信度 / 熵 | 是(同策略) | 否 | 高:奖励方差衰减,RENT 长度爆炸 |
| Co-rewarding | 改写问题 / EMA 副本的多数票 | 是(同源两视图) | 否 | 中:视图误差相关,仅部分独立 |
| CoMAS | LLM judge 给交互打分 | 多模型 | 需要 LLM judge | 较低,但基础设施重 |
| MAPoRL | 学习的奖励模型 | 多模型 | 需要奖励模型 | 取决于奖励模型质量 |
| Co-RL | 指定同伴的多数票伪标签 | 否(独立模型) | 否 | 低:更新方向由同伴决定 |
一句话总结定位:Co-RL 用 1998 年 co-training 的理论洞察,替换了 2025 年自奖励 RL 的奖励源,同时省掉了 2026 年多智能体 RL 的全部评分基础设施。
三、问题定义
核心问题的严格表述:在没有任何真值监督(无标注 prompt、无外部验证器、无 LLM judge、无奖励模型)的条件下,如何让每个策略获得一个"足够独立"的学习信号,使其推理能力持续提升而非自我强化退化?
这个问题的抽象本质是:把 co-training 的"两视图独立性"从数据增强层面提升到独立训练的模型层面。传统 co-training 用同一个模型看两个增强视图;Co-rewarding 用同一模型的问题改写和 EMA 副本;Co-RL 则直接用两个(或多个)参数、梯度、优化器状态完全分离的策略作为彼此的"视图"。视图之间的差异不再是数据层面的扰动,而是架构、预训练语料、 tokenizer、容量带来的系统性差异——这些差异恰恰是误差去相关的保证。
形式化地,设有 N 个独立参数化的策略 {π_θn},对无标签问题 x,每个 agent 独立采样 K 个 completion,并抽取最终答案。agent n 的监督目标完全由其指定同伴(agent n−1,下标循环,agent 1 由 agent N 监督)的多数票伪标签构成:
â₋ₙ(x) ∈ argmax_b Σ_{j=1..K} 1[aⁿ⁻¹ʲ = b] (式 3)
rₙᵏ = 1[aₙᵏ = â₋ₙ(x)] (奖励:与同伴伪标签一致得 1)
J_CoRL(θ) = (1/N) Σₙ J_GRPO(θₙ; {yₙᵏ, rₙᵏ}) (式 4)
其中 J_GRPO 是标准的 GRPO 目标:组内奖励归一化为相对优势 Âᵏ = (rᵏ − mean)/std,配合裁剪的重要性采样比和 KL 正则。整个系统的耦合只发生在奖励这一层——没有共享参数、没有梯度交换、没有联合损失,每个策略维护自己的优化器状态。
值得强调定义中的一个细节:每个 agent 完全不参与自身监督目标的构造。â₋ₙ 只统计同伴 n−1 的回答,agent n 自己的 K 个采样一个都不算进去。这是"独立性"在算法层面的最小实现——哪怕两个 agent 初始化自同一个基座模型(Same family 设定),只要监督目标不含自身采样,交叉监督就成立。论文发现仅此一点就足以让训练稳定并显著超过基座模型。
为什么独立性是有效性的前提? 直觉论证:如果两个监督源的误差高度相关(比如 Co-rewarding 的 EMA 副本,它就是同一个模型的缓慢平均),那么当被监督者犯系统性错误时,监督者大概率犯同样的错,伪标签就会确认这个错误而不是纠正它——相关性让交叉监督退化回自奖励。论文附录 A 用 500 道 MATH 题的实测数据把这件事量化了:同族模型对(或同一模型换采样种子)的 Cohen’s κ 一律 ≥ 0.51,而跨族模型对的 κ 一律 ≤ 0.42,两组之间没有任何重叠;跨族配对的"互补率"(恰好一方答对的题目比例)平均从 23.2% 提升到 30.8%。独立性不是奢侈品,是交叉监督产生净矫正信号的必要条件。
四、问题解法
4.1 方法机制:五步闭环
以两 agent 为例(Figure 3),每个训练步的流程是:
- 采样:对无标签问题 x,agent 1 和 agent 2 各自独立 rollout K 个 completion(LLM 实验用 K=12,VLM 用 K=8),抽取每个 completion 的最终答案。
- 同伴多数票:agent 2 的 K 个答案做多数投票,得到伪标签
â₋₁;agent 1 的 K 个答案做多数投票,得到伪标签â₋₂。所有 rollout 和伪标签在任何策略更新之前全部算完(这一点对理论分析中的独立性假设至关重要:伪标签条件独立于被监督者的 rollout 组)。 - 交叉奖励:agent 1 的第 k 个回答与
â₋₁(agent 2 的多数票)比对,一致得 1、不一致得 0;agent 2 同理对â₋₂。 - 独立 GRPO 更新:各自的奖励在自己组内归一化为相对优势,分别做一步 GRPO 更新(论文也验证了与 REINFORCE++ 的兼容性)。两策略之间无梯度流动。
- N=3 时沿有向环传递:agent 1 的伪标签来自 agent 3,agent 2 的来自 agent 1,agent 3 的来自 agent 2——监督关系构成一个有向环,每个 agent 既被一个同伴监督、又监督另一个同伴。论文在三 agent 异构实验中验证了这个拓扑的可行性。
这个设计的精妙之处在于其对称性与极简性:每个 agent 同时是学习者(接受同伴奖励)和教师(为另一同伴提供伪标签),整个"多智能体系统"没有任何角色分工、没有通信协议、没有辩论轮次——唯一的交互媒介就是每步一次的多数票交换。
4.2 多样性三轴:降低相关误差的三种机制
Co-RL 的另一半是"diverse cohort"——多样性不是锦上添花,而是方法有效性的前提。论文沿三个轴系统地制造差异,每一轴都有明确的去相关机制:
第一轴:异构模型家族(主来源)。 不同家族在模型开发管线的每一环都不同——架构选择、tokenizer、词表规模、预训练语料、后训练流程。Qwen2.5 与 Llama 3 的 tokenizer 和预训练语料完全不同;Gemma 3 引入 256K 词表和交错局部-全局注意力。对 VLM 更是如此:三个家族的视觉编码器完全不同(Qwen2.5-VL 用原生动态分辨率 ViT、InternVL 用 InternViT、Gemma 3 用 SigLIP)。不同的归纳偏置和决策边界 → 不同的错误分布 → 更强的矫正信号。附录 A 的实测确认:这是"性价比最高"的多样性来源——换一个家族伙伴,κ 平均下降 0.18(以 Qwen2.5-3B 为锚点),互补率提升 9.2%。
第二轴:模型规模。 不同容量的模型表现出不同的推理与预测行为,配对不同规模的模型(如 7B 配 8B、三 agent 的 3B+3B+1.7B)产生不同错误画像,让每个策略能在对方做对而自己做错的题目上获得信息量。
第三轴:输入形式(数据改写)。 即使模型与优化全部解耦,两个 agent 训练时看到的仍是相同的 prompt。论文用 DeepSeek-V3 改写每道 MATH 题:保持答案和题目顺序不变,但通常把问题重新铸入一个不同的具体场景——不是表面词汇替换,300 对抽样中每个改写都保持了答案与行对齐,题目长度约翻倍(附录 C 给出了实例:把抽象函数图像题改写成化学反应温度场景)。两个 agent 解的是语义等价但表述不同的问题,消除 prompt 特定措辞诱导的相关错误。
隐藏的第四轴:解耦的策略优化本身。 独立更新防止两个策略被直接耦合——即使初始化相同的 Same family 设定,训练过程中的独立轨迹也维持了较低相关的预测。论文明确把这算作多样性的一个来源,并展示它足以支撑稳定训练。
4.3 与 Co-rewarding 的关键区别
这是最容易被忽视但最重要的一处对照。Co-rewarding(ICLR 2026)已经引入了"两视图"思想:视图 1 是问题改写,视图 2 是慢更新的 EMA 模型副本。但它的两个视图都源自同一个模型——改写后的输入仍进同一个策略,EMA 副本仍是同一策略的参数平均——所以两视图的误差强相关,只部分满足两视图学习的独立性要求。Co-RL 把视图彻底分离到"独立训练的模型"层面,误差相关性由附录 A 的 κ 数据证实大幅下降。实验上这个差别是可测的:Co-RL(Different family+)在 Table 1 中对两个 3B 家族都取得了最强无标签平均性能,超过 Co-rewarding-II。
4.4 理论框架:把 GRPO 写成常微分方程
论文的理论分析做了一次教科书级的简化:固定一道题 x,把答案分布约化为二元(正确答案 a* vs 聚合错误答案),令 p_n 为 agent n 答对的概率,K 取奇数保证多数票无平票,在 log-odds 坐标 ℓ = log(p/(1−p)) 下推导 GRPO 在无穷小更新极限(忽略裁剪与 KL)的概率动力学。核心中间结果是:在固定伪标签 Z(Z=1 表示伪标签正确)下,GRPO 的奖励诱导梯度为
g_ℓ(C, Z) = (2Z − 1) · √(C(K−C)/K)
其中 C ~ Bin(K, p) 是 K 个 rollout 中正确的个数,√(C(K−C)/K) 恰是二元奖励的组内标准差——更新幅度由组内方差决定,更新方向由伪标签正确性 (2Z−1) 决定。由此得到 Proposition 1:
- [1] 自奖励:伪标签就是自己这组的多数票,Z_self = 1[C > K/2],于是
ṗ = η p(1−p) · E_C[ sign(C − K/2) · √(C(K−C)/K) ] (式 7)
- [2] Co-RL:伪标签来自同伴,Z₋ₙ 与自己的 rollout 组独立(Z₋ₙ ⊥ Cₙ),期望可分解。二 agent 对称情形化简为
ṗ_A = q_K(p_A) · φ_K(p_B)
ṗ_B = q_K(p_B) · φ_K(p_A) (式 9)
其中 q_K(p) = η p(1−p) E[√(C(K−C)/K)] > 0 恒为正,φ_K(p) = 2V_K(p) − 1 是带符号的多数票方向(V_K(p) 是 K 票多数投出正确答案的概率)。
式 9 是整篇论文最核心的一个方程,值得逐字解读:由于 q_K(p_A) 严格为正,agent A 的更新方向完全由 φ_K(p_B)——即 agent B 的多数票方向——决定,与 A 自己当前倾向哪边无关。自奖励(式 7)的更新方向则由自己的多数票决定。一行之差,把"自确认"换成了"交叉确认"。
五、评估指标与实验证据
5.1 主实验:4 款 LLM × 7 个纯文本基准
训练设定:LLM 在 MATH level 3–5 划分上训练(遵循 MARTI 的设定),K=12,2 个 epoch,学习率 3e-6,每 agent 有效批 128 prompts,AdamW,8×H100 单节点(每 agent 4 卡)。评测覆盖 7 个纯文本基准:数学(GSM8K、MATH-500、AMC)、代码(HumanEval、MBPP、LiveCodeBench)、科学(GPQA)。
四个 LLM(Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen2.5-7B、Llama-3.1-8B-Instruct)上的平均增益为 +3.0 到 +8.6,超过最强自奖励基线(TTRL / Intuitor / RENT / Co-rewarding-II)0.8 到 2.0 个百分点。3B 档的完整对照(Table 1 摘要):
| 方法(Qwen2.5-3B) | GSM8K | MATH-500 | AMC | HumanEval | GPQA | MBPP | LCB | Avg |
|---|---|---|---|---|---|---|---|---|
| Base | 73.4 | 56.6 | 28.9 | 39.0 | 52.2 | 21.2 | 13.7 | 40.7 |
| GT-Reward(有真值参考) | 76.2 | 64.6 | 36.1 | 65.2 | 60.4 | 20.7 | 14.5 | 47.4 |
| TTRL | 80.4 | 66.4 | 31.3 | 63.4 | 59.2 | 22.2 | 15.9 | 47.3 |
| Co-rewarding-II | 75.5 | 63.4 | 30.1 | 61.0 | 54.9 | 24.8 | 11.0 | 45.6 |
| Co-RL (Different family+) | 81.0 | 66.6 | 36.1 | 62.8 | 59.2 | 25.8 | 17.2 | 49.3 |
| 方法(Llama-3.2-3B-Instruct) | Avg |
|---|---|
| Base | 38.7 |
| GT-Reward | 43.0 |
| TTRL | 43.1 |
| Co-RL (Different family+) | 43.9 |
三个值得注意的读数:
- 消融阶梯清晰:Same family(同基座两副本互监)就已给 Qwen2.5-3B 带来 +8.0 的平均提升——交叉监督本身即有效;Different family(跨族配对)与 Different family+(再加数据改写解耦)进一步把最优无标签平均成绩推到两个家族的双第一。多样性的三轴各有独立贡献,方向单调一致。
- 无标签方法逼近甚至反超有真值监督:7B/8B 档(附录 Table 8),Co-RL(Different family+)把 Qwen2.5-7B 从 49.0 提到 53.6、Llama-3.1-8B-Instruct 从 44.7 提到 47.7——后者超过了用真值奖励训练的 GT-Reward(47.1)。
- 代码与科学推理同步受益:增益不局限于训练域(数学),在 HumanEval、MBPP、LiveCodeBench、GPQA 上普遍为正,说明交叉监督学到的是可迁移的推理行为而非领域记忆。
5.2 VLM 侧:5 款模型 × 4 个多模态基准
VLM 的家族差异比 LLM 更彻底——视觉编码器都不同——是对"异构 cohort"更强的检验。训练数据为 MMR1-Math(对齐基线 MM-UPT 的训练数据)与 multimodal-open-r1(验证非特定数据集),K=8、1 个 epoch。评测基准:MathVision、MathVerse、MathVista、We-Math。
五款 2B–12B 的 VLM(Qwen2.5-VL-3B、InternVL3.5-2B、Qwen2.5-VL-7B、InternVL3.5-8B、Gemma-3-12B)平均提升 +2.3 到 +7.2。三个大模型(附录 Table 9,open-r1 训练,InternVL3.5-8B 作为共享训练伙伴):
| 模型 | Base | TTRL | Co-RL | GT-Reward |
|---|---|---|---|---|
| Qwen2.5-VL-7B | 43.94 | 48.88 | 51.13(+7.2) | 51.68 |
| InternVL3.5-8B | 48.06 | 54.16 | 54.40(+6.3) | 55.85 |
| Gemma-3-12B | 41.78 | 44.45 | 47.56(+5.8) | 45.17 |
Gemma-3-12B 的 47.56 反超 GT-Reward 的 45.17,差 2.4 个百分点——一个完全不用真值标签的方法超过了用真值训练的同型模型,这是全文最有说服力的单点数据之一。
5.3 等预算对照:排除"算力多"与"集成效应"两种解释
Co-RL 训练两个模型,天然比单模型自奖励多一倍训练预算;推理时若做集成,又多了集成增益。**如果不排除这两个混淆变量,“交叉监督有效"的结论就站不住。**论文的对照设计(附录 D.4)非常干净:用同样两个基座模型独立跑 TTRL,推理时同样把两模型各 4 个 rollout 汇成 8 票多数投票(maj@8)——训练预算相同、推理预算相同。结果(文本侧,Table 10):
| 设定(Qwen2.5-3B + Llama-3.2-3B) | GSM8K | MATH-500 | AMC | 宏平均 |
|---|---|---|---|---|
| TTRL (Qwen 单模型) | 88.2 | 68.8 | 39.8 | 65.6 |
| TTRL (两模型集成) | 88.2 | 68.0 | 38.6 | 64.9 |
| Co-RL (Qwen 单模型) | 87.4 | 72.8 | 37.4 | 65.9 |
| Co-RL (两模型集成) | 90.1 | 70.8 | 39.8 | 66.9 |
注意一个反直觉的细节:TTRL 的两模型集成(64.9)反而低于较强的单模型(65.6)——独立自奖励训练出的两个模型预测合并并无增益;而 Co-RL 训练出的两个模型合并后达到最优(66.9)。多模态侧同型结论(Table 11:Co-RL 集成 50.88 vs TTRL 集成 48.80,MMR1 上 52.30 vs 49.19)。这证明 Co-RL 的增益来自交叉监督本身,而不是"多训了一个模型"或"推理时多了几票”——Co-RL 训出的模型在同等预算下组合得更有效。
5.4 CoMAS 受控比较:多智能体 RL 内部的对决
在 CoMAS 的受控评测设定下(相同 prompt 混合、官方实现与评测协议),Co-RL 以 62.97 的平均分超过 CoMAS 的 58.94 达 4.0 个百分点,在 7 个基准中的 5 个上领先,而使用的 agent 数量只有一半,且不需要 CoMAS 依赖的 LLM judge。这个比较还顺带暴露了 CoMAS 评测协议在代码基准上的一个漏洞(引用多个候选代码块会被按 pass@5 计分,对未训练基线虚高 7.3%),论文做了相应修正以保证公平——这种对评测细节的较真程度值得肯定。
5.5 训练动态:稳定性本身就是证据
Figure 4 横跨四个骨干(Qwen2.5-3B、Llama-3.2-3B、Qwen2.5-7B、Llama-3.1-8B)追踪三条曲线:验证精度、组内奖励标准差(归一化到初始值)、平均 completion 长度。
- Co-RL:奖励标准差全程保持非退化、completion 长度稳定、验证精度稳步上升——三条曲线都是健康的训练形态。
- RENT:奖励方差迅速压向零(组内全同 → GRPO 相对优势消失),completion 长度急剧膨胀,精度退化乃至发散。
- Intuitor:奖励方差大幅缩减,部分模型出现长度退化。
- TTRL:相对稳定但奖励方差总体下降,且验证精度持续低于 Co-RL。
VLM 侧(Figure 5)还有一条机制性证据:训练全程两个 agent 的一致率始终保持在"远低于完全一致"的水平,而交换伪标签的精度却稳步上升。这说明两个模型没有坍缩成相同的行为——它们保持着有意义的差异,同时互相提供的监督越来越准。这正是理论预言的"互补监督"形态。
5.6 三 agent 异构扩展
Qwen2.5-3B + Llama-3.2-3B-Instruct + Qwen3-1.7B 三个不同家族不同规模的模型在单次 Co-RL 运行中沿有向环共同训练(Table 3):
| 模型 | Base | GT-Reward | TTRL | Co-RL | 相对 Base |
|---|---|---|---|---|---|
| Qwen2.5-3B | 40.7 | 47.4 | 47.3 | 48.5 | +7.8 |
| Llama-3.2-3B | 38.7 | 43.0 | 43.1 | 44.7 | +6.0 |
| Qwen3-1.7B | 39.1 | 47.2 | 47.3 | 47.3 | +8.2 |
三个模型全部同时超过 GT-Reward 或与之持平(48.5>47.4;44.7>43.0;47.3≈47.2),Qwen2.5-3B 和 Llama-3.2-3B 同时超过 TTRL。这说明框架不局限于两两配对,异构群体可以在一次训练中共享交叉监督红利。
5.7 互补专长算例:Theorem 1 的直接验证
论文在 Theorem 1 之后给了一个极端算例,它是连接理论与实验的桥梁:设一半题目上 (p_A, p_B) = (0.9, 0.2),另一半 (0.2, 0.9)。两个 agent 的平均准确率都只有 0.55,但优势完全互补。逐题检验收敛条件:
- 自奖励:每题只有一个 agent 满足 p > 1/2,另一个 p < 1/2 被推向 0——最终每个 agent 只保住自己擅长的那一半,准确率 0.5。
- Co-RL:每题 p_A + p_B = 0.9 + 0.2 = 1.1 > 1,落入正确收敛盆,双方都被推向 1——最终准确率 1.0。
这个算例的价值在于它把"p_A+p_B>1 即全收敛"从抽象定理翻译成了可感的能力图景:两个各自只比随机猜好一点点的模型,只要错得足够不一样,交叉监督就能把双方都推到全对。附录 A 的实测数据(跨族配对互补率约 30%、κ 低至 0.38)说明真实模型对天然具备这种互补结构,这正是主表增益的微观基础。
六、效果优势的根源解释
有了理论(第四节)和数据(第五节),现在可以完整地回答:为什么交叉监督比自奖励好?优势的因果链是什么?
第一环:自奖励的更新方向由自身当前多数票决定,这在数学上注定是自确认的。 Proposition 2 证明:对奇数 K,自奖励的期望 GRPO 更新的符号恒等于 sign(p − 1/2)。证明的关键一步是把 C > K/2 的每个事件与其对称事件 C’ = K − C < K/2 配对——两者更新幅度相同(√(c(K−c)/K) 在 C ↔ K−C 下不变),方向相反,而二项分布概率之比 [p/(1−p)]^(2c−K) 在 p>1/2 时偏向多数侧事件。于是 p < 1/2 ⟹ ṗ < 0:错误答案在模型本来就更倾向它时,会被训练进一步放大,正确答案被系统性压制直至消失。这不是实现缺陷,是"用自己监督自己"这一结构的必然动力学。它精确预言了实验中观察到的坍缩形态:随着模型越来越认同自己的伪标签,rollout 奖励趋于同质化,组内方差(GRPO 的学习信号)衰减,最终要么输出同质化、要么长度爆炸发散——RENT 与 TTRL 的失败曲线就是这条定理的实验注脚。
第二环:Co-RL 的更新方向由独立更新的同伴的多数票决定。 式 9 中 q_K(p_A) > 0 恒成立,agent A 的更新方向完全由 φ_K(p_B) 签名。这意味着:同伴答对的题(p_B > 1/2),无论我自己当前多错(哪怕 p_A = 0.2),我都被推向正确答案——同伴的正确预测为我方的错误提供了自奖励结构下不可能出现的矫正信号。同伴答错的题我同样会被带偏,但只要错误不完美相关,两方向的净效应为正——附录 A 的互补率数据给出了净矫正信号的规模。
第三环:收敛盆从"每题各自过半"扩大到"两人之和过半",互补性可以兑换正确性。 自奖励的正确收敛盆是 B⁺_self = {p_A > 1/2 且 p_B > 1/2}——两道独立门槛,缺一不可。Co-RL 的正确收敛盆是 B⁺_Co-RL = {p_A + p_B > 1}——一道总量门槛,允许用 A 的富余 (0.9−0.5=0.4) 补贴 B 的赤字 (0.5−0.2=0.3)。论文严格证明了后者是前者的真超集(B⁺_self ⊊ B⁺_Co-RL),分隔线 p_A + p_B = 1 恰是 (1/2, 1/2) 鞍点的稳定流形。用经济学的语言:自奖励要求每个个体都及格,Co-RL 只要求群体的"正确性总量"及格——专长互补可以兑换成集体正确。
第四环:宏观表现——稳定的奖励方差与长度、无发散。 理论预言映射到训练曲线上:交叉监督下组内奖励永远存在有意义的方差(同伴伪标签不会全盘认同我的 rollout),GRPO 的相对优势信号不枯竭;同伴的监督方向不随我的坍缩而坍缩,所以不会出现"越训越同质"的死亡螺旋。Figure 4 与 Figure 5 的曲线形态(Co-RL 方差平稳、基线方差归零;VLM 一致率低于 1 而伪标签精度上升)逐条对应理论预言。
反事实检验:为什么 Co-rewarding 的增益不及 Co-RL? Co-rewarding 已经做了"第二视图"(问题改写、EMA 副本),为什么 Table 1 里 Co-RL(Different family+)仍稳定压过 Co-rewarding-II?按上述因果链,答案在独立性折扣:改写输入仍流经同一策略、EMA 副本仍是同一策略的权重平均,两视图误差强相关——同伴(视图)在关键题目上与本体"同错"的概率高,矫正信号被相关误差稀释。附录 A 提供了量化标尺:同族/同源视图的 κ ≥ 0.51 vs 跨族 ≤ 0.42。**视图独立性每差一档,交叉监督就向自奖励退化一步。**这也解释了消融阶梯(Same family < Different family < Different family+)的单调性:三轴多样性各自降低一档误差相关,各自兑换一份增益。
七、必要知识反推
如果把这篇论文当作一个知识源,反推读懂它(以及复现它)需要的知识储备,可以分三层:
领域层(论文在说什么)
- RLVR 与 GRPO:策略优化目标(式 1-2)、组相对优势
Âᵏ = (rᵏ − mean)/std的作用(省去 critic、天然适配 0/1 奖励)、裁剪的重要性采样与 KL 正则。关键理解:GRPO 的学习信号完全来自组内奖励方差,方差归零即训练死亡——这是解读训练动态图的钥匙。 - 自奖励方法谱系:TTRL 的多数票伪标签、Intuitor 的 token 级 KL 自确信、RENT 的预测熵、Co-rewarding 的双视图——以及它们共同的"信号内循环"缺陷。
- 多数投票 / self-consistency(Wang et al. 2023):作为伪标签构造的基础件。
方法论层(论文怎么想的)
- co-training 条件独立理论(Blum & Mitchell 1998)及其现代反例(Li et al. 2023:相似视图同错)——Co-RL 的全部设计围绕"最大化视图独立性"展开。
- 对比学习的坍缩预防设计(SimCLR 的增强+负样本、BYOL 的动量目标、DINO 的 stop-gradient)——交叉奖励与 stop-gradient 在"切断自我强化回路"上同构。
- ODE 训练动力学分析:二元简化 + log-odds 坐标 + 无穷小更新极限 + 常微分方程相图分析(不动点、鞍点、分隔线、守恒量
F_K(p_A) − F_K(p_B)、线性化 Jacobian 特征值)。这套工具把"训练会不会坍缩"变成可证明的命题。 - 分析设定的两个技术细节:奇数 K 保证多数票无平票(实验用偶数 K 时平票确定性解决);伪标签与被监督组条件独立(Co-RL 靠"先全部采样后更新"保证,自奖励靠同组多数票天然破坏)。
工程层(论文怎么落地的)
- 多模型并行训练基础设施:单节点 8×H100 每 agent 4 卡、独立优化器状态、同步-更新两阶段循环;vLLM rollout 与训练前向的对齐。
- VLM 配对与数据集选择:按可比规模配对、三个家族三种视觉编码器;MMR1-Math 对齐基线训练数据、open-r1 验证泛化。
- 等预算对照设计:训练预算配平 + 推理预算配平(maj@8)+ 单模型/集成拆开报告——这是排除混淆变量的范式。
- 大量评测工程细节(附录 D.5):两阶段评分(规则优先、LLM judge 只救假阴性)、CoMAS 代码基准聚合漏洞的修正、Gemma-3 的 rollout-policy log-prob 漂移(约 0.13/token)与重要性采样截断——复现者的避坑清单。
融合节点:这篇论文的核心洞察可以压缩成一句话——把 1998 年 co-training 的"视图独立性"从数据增强层面移植到独立训练的模型层面,用多模型互为视图,为无真值 RL 提供足够独立的监督信号。领域层告诉我们为什么需要独立信号,方法论层告诉我们独立性从哪来(模型族/规模/输入三轴)以及为什么有效(收敛盆扩大),工程层告诉我们怎么在多卡多模型的真实约束下把它跑通。三层的交汇处正是这篇论文的原创性所在。
八、通用性灵感
灵感一:独立性是伪监督有效的前提。 Co-RL 的全部机制建立在一个可以完全脱离 RL 语境的原理上:任何"伪标签/代理信号"的价值,取决于它与被监督者误差的相关程度;相关性越高,监督越退化为回声。论文用 κ ≤ 0.42 vs ≥ 0.51 的硬边界证明了"换一个模型族"是性价比最高的独立性来源。这个原理可以直接推广:众包标注中,标注者背景同质化会让"多数票共识"失去纠错力,质量控制应先度量标注者间的错误相关性;集成学习中,多样性与准确性同等重要是老结论,但 Co-RL 给出了"多大差异才够"的可操作标尺(κ/互补率);多模型交叉验证、红队测试的成员选拔,都应优先"错误分布解耦"而非单纯堆人数。选监督者,先看你们的分歧有多大。
灵感二:互补性可以兑换正确性(p_A + p_B > 1 即全收敛)。 Theorem 1 的收敛条件是一个总和不等式而非逐项不等式——A 的富余可以补 B 的赤字。极端算例(互补专长的两个 0.55 平均准确率模型协同收敛到 1.0)把这个原理展示得淋漓尽致。推广到团队科学:组队时"两人都 75 分"未必优于"一个 90 分 + 一个 60 分但盲区互补",前提是总分过线且存在交叉反馈机制;师生互助、多专家会诊的有效性条件同样是"专长互补 + 双向矫正通道",而非单纯的水平叠加。判断一个协作系统有没有前途,看成员长板的分布,而不是看平均分。
灵感三:自我确认的数学结构——任何"用自己输训自己"的系统都受 sign(p−1/2) 动力学支配。 Proposition 2 的力量在于其普适性:只要更新信号源自系统自身的当前倾向,概率低于 1/2 的状态就会被推向 0——与对错无关,只与当前是否占多数有关。推荐系统的过滤气泡(点击数据训练推荐、推荐又塑造点击)、组织决策的回音室(观点经自己筛选的信息强化)、自监督学习的表示坍缩,都是同一数学结构在不同介质上的投影。诊断方法也是通用的:看"信号源是否独立于被优化对象"——一个系统若无法指出任何独立于自身的矫正来源,它就在积累自确认风险。定期引入一个真正独立的批改者,是所有自我改进系统的免疫机制。
灵感四:多样性是可设计的工程量,三轴提供了设计模板。 Co-RL 没有把"多样性"停留在口号上,而是拆成三个可操作的轴:来源(模型家族=不同的归纳偏置)、容量(规模=不同的错误画像)、输入(改写=消除表述诱导的相关错误),外加流程性的第四轴(解耦的独立更新),并用 κ/互补率给了它度量衡。这个模板可以直接迁移:数据增强的组合设计(语义改写优于词汇替换,因为前者改变的是场景而非表面形式)、模型集成的成员选择(先测错误重叠再定成员)、红队测试的人员构成(背景差异比人数更重要)。凡是要"多"的地方,先定义"多"在哪一轴、怎么度量、为什么这一轴的去相关机制与目标匹配。
灵感五:等预算对照是因果结论的守门员。 Co-RL 面对的最强质疑是"你用了两个模型,赢了也是算力赢的"。论文的回应堪称 A/B 实验设计的范本:训练预算配平(同样两个模型独立跑 TTRL)、推理预算配平(同样 maj@8 集成)、然后展示反直觉结果(TTRL 集成 64.9 反而低于单模型 65.6,Co-RL 集成 66.9 最优)——增益只能归因于交叉监督本身。任何"新方法 vs 基线"的比较,若不把方法隐含使用的额外资源(算力、采样次数、参数量、数据量)配平,结论都可疑。推广到产品实验、模型评测、学术对比:先列出方法隐含消耗的全部资源,再逐一配平,最后让差异只剩下你主张的那个机制。
结语:Co-RL 的贡献可以概括为一句话:它把"找一个足够独立的监督源"这个无标签学习的根本问题,用"训练一群足够不同的模型互相监督"给出了理论上可证、工程上可跑、预算上公平的答案。1998 年 co-training 的两视图思想在多智能体 RL 的土壤里重新发芽——视图不再是同一数据的不同增强,而是带着不同归纳偏置、不同错误画像的独立学习者。当模型的推理能力逼近人类评估的边界,也许继续前进的方向不是更聪明的自我审视,而是找到一群与你错得不一样的同伴。