论文题目区
- 标题:Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
- 论文链接:https://arxiv.org/abs/2608.17253
- 代码:https://github.com/DrStranded/Co-RL
- 发表时间:2026 年 8 月(arXiv v2 更新于 2026-08-19)
- 机构:Johns Hopkins University + UC San Diego + University of Exeter + 独立研究者(纯高校合作,无企业实验室参与)
- 热度:HuggingFace Daily Papers 当日 92 票,社区关注度相当高
- 一句话概括:不让模型自己给自己发奖励,而是让一群彼此独立的异构模型互相当老师,无标签也能把推理练出来。
一、研究背景:当推理 RL 遇上「没标签」的墙
强化学习(RL)已经成为提升大模型推理能力的主流路径:DeepSeek-R1 用可验证奖励(RLVR)把数学和代码能力推上新台阶。但 RLVR 的命门写在名字里——可验证。你得先有正确答案,才能算奖励。数学题可以人工标注答案,代码题可以跑测试用例,可是当模型的推理能力逼近甚至超过人类评估者的水平时,标注本身成了瓶颈:请谁去给一道连领域专家都会做错的题目打分?
一条出路是自奖励(self-rewarding):不给标签,让模型从自己的输出里提炼学习信号。代表方法有:
- TTRL:对同一道题采样 K 个回答,取多数投票的答案当伪标签,谁跟多数派一致谁得分;
- Intuitor:用模型自身 token 级的置信度(KL 散度)当奖励;
- RENT:用预测熵当奖励——越笃定越高分;
- Co-rewarding:用改写后的题目或模型的慢速平均副本(EMA)提供第二个视图。
这条路线的隐患是:所有信号都出自同一个模型。就像考试后自己批改自己的卷子——你答错了,大概率也会批错,因为批卷的人就是答题的人。具体表现为三类症状:放大已有偏见、回答多样性下降、最终训练崩溃(输出同质化、奖励方差塌缩为零、回答长度爆炸)。论文中 Figure 4 的训练曲线把这些症状拍得很清楚:RENT 的奖励标准差迅速归零后爆炸增长回答长度,Intuitor 方差塌缩,TTRL 也会阶段性退化。
于是核心问题来了:在没有任何真值标签、没有外部裁判的前提下,一个模型如何获得足够独立的学习信号?
二、核心洞察:错误不相关,就能互相当老师
论文的答案是:独立信号来自独立训练的同伴。
这个想法有一个古老的血统——1998 年的 co-training(Blum & Mitchell)证明两个条件独立的视图可以互相教学;2023 年 Li 等人在半监督分割中发现,两个视图越相似,就越倾向于在同一样本上犯同样的错、互相强化错误。多智能体辩论(debate)和 CoMAS 这类方法也用了多个模型,但它们依赖多轮交互和一个 LLM 裁判来打分——裁判本身又成了新的监督瓶颈。
Co-RL 的洞察可以浓缩成一句话:两个由不同团队、在不同数据上训练出来的模型,会在不同的题目上翻车。A 做对的题里有一部分是 B 做错的,反之亦然。这部分「互补区域」正是可教性的来源——B 错了但 A 对,A 的伪标签就能纠正 B 自己永远发现不了的错误。
附录 A 用数据坐实了这一点(这是全文我最喜欢的实验之一)。在 500 道 MATH 题上对模型配对做错误解耦分析,用四个指标刻画:
| 指标 | 含义 | 好的方向 |
|---|---|---|
| κ(Cohen’s kappa) | 两模型落点的一致性(去除偶然一致后) | 越低越好 |
| c(互补度) | 恰好只有一方做对的题目占比 | 越高越好 |
| w(错误一致率) | 两模型都错且错成同一个答案的占比 | 越低越好 |
| u(Oracle 上限) | 至少一方做对的题目占比 | 越高越好 |
结果是一条干净的阶梯:
| 配对类型 | κ | c | 结论 |
|---|---|---|---|
| 跨家族(如 Qwen2.5-7B × Llama-3.1-8B) | ≤0.42 | ≥29.4% | 错误充分解耦 |
| 同家族(如 Qwen2.5-7B × Qwen2.5-3B) | ≥0.51 | ≤24.6% | 与换种子无异 |
| 仅换随机种子(自己 × 自己) | ≥0.51 | ≤24.6% | 与同家族不可区分 |
注意两组之间没有任何重叠——跨家族的每一对都达到 κ≤0.42 / c≥29.4%,同家族和换种子的每一对都卡在 κ≥0.51 / c≤24.6%。也就是说,在同一家族内部换尺寸、换代际、换采样种子,错误结构纹丝不动;只有跨过家族边界(不同的架构、分词器、预训练语料),才能买到真正的错误多样性。平均而言跨家族让 κ 从 0.53 降到 0.38、互补度从 23.2% 升到 30.8%。
三、方法:Co-RL 怎么把「同伴」变成奖励函数
3.1 整体流程
设定 N 个 不共享参数、独立初始化 的 agent(可以来自不同家族、不同尺寸)。对每道无标签题目 x:
- 各自采样:每个 agent n 独立 rollout K 个回答,抽取最终答案 a_n^k;
- 构造伪标签:每个 agent 的监督目标只来自指定的同伴——环状结构,agent n 的伪标签是 agent n−1 的 K 个答案的多数投票,agent 1 由 agent N 监督;
- 发奖励:r_n^k = 1 当且仅当 a_n^k 等于同伴的伪标签,否则 0;
- 独立更新:各 agent 用自己的奖励组内归一化后做 GRPO 更新,互相之间不传梯度。
N=2 时就是互相监督;N=3 时投票沿有向环传递。关键设计有三点:每个 agent 不参与构造自己的监督目标;agent 间唯一的耦合就是奖励信号;既是学习者又是监督者,单次训练全员受益。
打个类比:TTRL 像学生自己核对答案再给自己打分,Co-rewarding 像让「昨天的自己」批改「今天的自己」,而 Co-RL 是同桌互换卷子批改——你们看的题一样,但你们的大脑不是同一个,你的错题他不一定错。
3.2 多样性的三个来源
方法名字里的 Diverse Cohort 不是装饰词,论文把多样性推到了框架允许的极限:
- 解耦的策略优化:两个策略各持参数与优化器状态,独立更新防止了预测的相关化——这本身就是多样性的第一来源;
- 跨家族与跨尺寸:Qwen 与 Llama 在分词器、词表、架构、预训练语料上全面不同;Gemma 用 256K 词表和交错局部-全局注意力;VLM 家族的视觉编码器更是天然异构(Qwen2.5-VL 的原生动态分辨率 ViT、InternVL 的 InternViT、Gemma-3 的 SigLIP);
- 输入形式解耦:用 DeepSeek-V3 把 MATH 题目改写成等价新题(答案不变,通常换一个具体情境,如把抽象函数题改写成化学反应温度曲线),一个 agent 练原题、另一个练改写题,切断题目措辞带来的相关错误。附录 C 的示例显示 300 对改写全部保真。
论文测了三个递进版本:Same family(同基模初始化的两个独立 agent)→ Different family(跨家族配对)→ Different family+(再加数据解耦)。
四、理论:为什么「互相批改」比「自己批改」好
理论部分是这篇论文的脊梁。模型简化为:单道题、二元答案(正确 vs 聚合的错误),p 为答对概率,K 次采样,η 为学习率。
4.1 自奖励是「自我确认」动态
Proposition 2:自奖励下更新方向满足 sign(G(p)) = sign(p − 1/2)。
翻译成人话:更新永远放大当前占优的那个答案,不管它对不对。推论是残酷的二分:p(0) < 1/2 ⇒ p(t) → 0;p(0) > 1/2 ⇒ p(t) → 1。模型在一道题上如果初始正确率不到一半,训练只会让它越来越错,直到彻底收敛到错误答案。1/2 就是生死线,没有回头路。
4.2 跨智能体监督扩大「正确盆地」
Theorem 1:两个对称 agent 的动力学系统 ˙p_A = q(p_A)·φ(p_B), ˙p_B = q(p_B)·φ(p_A) 中,(1,1) 与 (0,0) 都是渐近稳定的共识状态,(1/2, 1/2) 是鞍点,分界线(separatrix)是 p_A + p_B = 1:
- p_A(0) + p_B(0) > 1 ⇒ 双双收敛到 (1,1)(都对);
- p_A(0) + p_B(0) < 1 ⇒ 双双收敛到 (0,0)(都错)。
证明相当漂亮:利用对称性 q(1−p)=q(p)、φ(1−p)=−φ(p) 构造守恒量 F(p_A) − F(p_B),说明在意见相左的区域两 agent 相互靠拢,谁先越过 1/2 由初始和是否大于 1 决定;分界线本身是不变流形,鞍点的稳定流形恰是这条线。对照自奖励的正确收敛域 B_self = {p_A > 1/2 且 p_B > 1/2},CO-RL 的收敛域 B_CO-RL = {p_A + p_B > 1} 是严格更大的集合。
4.3 一个极端例子看懂分离线
论文的 Takeaway 例子值得慢慢读:假设一半题目上 (p_A, p_B) = (0.9, 0.2),另一半是 (0.2, 0.9)。两个 agent 平均正确率都只有 0.55,但长处完全互补。
- 自奖励:每个 agent 只能在 p > 1/2 的那一半题上自救,最终正确率 0.5;
- Co-RL:每道题上 p_A + p_B = 1.1 > 1,分离线判据预测双双收敛到全对,正确率 1.0。
直觉:A 强 B 弱时,A 的伪标签把 B 往上拉;交换强弱后角色互换。同伴的强项可以填自己的弱项,只要两人加起来「过线」就行。这也直接解释了为什么多样性不可或缺——如果两个模型错误高度相关(p_A ≈ p_B),p_A + p_B > 1 就退化回 p > 1/2 的单机条件,跨智能体的好处消失。附录 A 的 κ/c 数据正是在实证层面为这个条件供货。
五、实验:全面、且控制变量做得扎实
5.1 设置
- 训练数据:LLM 用 MATH level 3–5;VLM 用 MMR1-Math 与 multimodal-open-r1 两套(验证增益不依赖特定训练集);
- 模型:文本侧 Qwen2.5-3B × Llama-3.2-3B、Qwen2.5-7B × Llama-3.1-8B、Qwen3-1.7B(三智能体);多模态侧 Qwen2.5-VL(3B/7B)、InternVL3.5(2B/8B)、Gemma-3(4B/12B);
- 基准:文本 7 个(GSM8K / MATH-500 / AMC / HumanEval / GPQA / MBPP / LiveCodeBench),多模态 4 个(MathVision / MathVerse / MathVista / We-Math);
- 算力:单节点 8×H100,每个 agent 分 4 卡——门槛亲民。
5.2 主结果一:超过最强自奖励基线
4 个 LLM 在 7 基准上平均提升 3.0–8.6%,比最强的自奖励基线(TTRL / Intuitor / RENT / Co-rewarding-II)再高 0.8–2.0%。值得注意的细节:Same family 设置(拿同一个基模初始化两个 agent)就已经带来可观增益(Qwen2.5-3B +8.0%、Llama-3.2-3B +4.0%),Different family 再上一层,加数据解耦的 Different family+ 最强——多样性的阶梯在结果上完美复现。Qwen2.5-7B 从 49.0 → 53.6。
5.3 主结果二:赢多智能体 RL,还不靠裁判
在 CoMAS 的受控设置下(同款数据、官方实现、同套评测),Co-RL 平均 62.97 vs CoMAS 58.94(+4.0%),7 个基准中 5 个领先——而 CoMAS 需要一个 LLM 裁判给多轮交互打分,Co-RL 既不用裁判,还只用一半数量的 agent。
5.4 主结果三:摸到甚至超过有监督
这是最让人坐直身体的结果:
| 设置 | Co-RL | GT-Reward(真值监督) |
|---|---|---|
| Llama-3.1-8B(文本 7 基准均值) | 47.7 | 47.1 |
| Gemma-3-12B VLM(4 基准均值) | 47.56 | 45.17 |
| 三智能体(Qwen2.5-3B / Llama-3.2-3B / Qwen3-1.7B) | 48.5 / 44.7 / 47.3 | 47.4 / 43.0 / 47.2 |
不用一个真值标签,在 7B/8B 文本和 12B 多模态上反超了用真值训练的 GRPO。多模态侧 5 个 VLM(2B–12B)平均提升 2.3–7.2%。三智能体扩展(不同尺寸模型混训)也全员受益,平均增益 7.8% / 6.0% / 8.2%,说明环状监督天然支持更多异构成员。
5.5 消融:增益不是「多训了一个模型」买来的
这是审稿人一定会拍桌子的质疑:你训了两个模型,TTRL 只训一个,多出来的算力会不会才是增益来源?附录 D.4 的对照实验直接回应:用同样的两个基模各自独立跑 TTRL,推理时各出 4 个回答、共 8 条做多数投票集成,与 Co-RL 的集成完全对齐训练与推理预算。结果文本上 Co-RL 集成 66.9 vs TTRL 集成 64.9,多模态两个设定下 50.88 vs 48.80、52.30 vs 49.19——交叉监督训出来的模型在同样预算下组合得更有效,增益来自监督信号本身,不是集成。
训练动态(附录 D.3)同样佐证理论:Co-RL 全程保持非退化的奖励方差与稳定的回答长度,验证精度稳步上升;而自奖励基线要么方差塌缩、要么长度爆炸、要么直接发散。VLM 侧还有个精巧观察:两个 agent 的一致率全程保持在远低于 1 的水平(没有同质化),但交换的伪标签精度持续上升——保持差异的同时提供越来越可靠的监督,正是理论预言的「互补而非趋同」。
六、讨论:值得细品的三点
其一,多样性是「用出来」的,不是「堆出来」的。 很多多智能体工作默认模型越多越好,Co-RL 的附录 A 反向证明:同家族堆再多成员,错误结构不变,κ 卡在 0.51 以上;跨家族哪怕只加一个伙伴,互补度立涨 7–10 个百分点。这给「如何组建学习小队」提供了可操作的准则——看 κ 和 c,不看成员数量。
其二,理论给出了可检验的临界条件。 p_A + p_B > 1 不是装饰性定理,它直接预言了:能力太弱的搭档可能拖后腿(和小于 1 时双双归零)、互补性强弱配反而能全对。这也暗示实践中选搭档的门槛——两人平均能力过线(平均 p > 0.5)是安全区,强弱互补型则需要谨慎评估。
其三,评测诚实的分量。 附录 D.5 主动披露了 CoMAS 评测协议在代码基准上的漏洞(引用多个候选代码块会被按 pass@5 计分,等于白送 2.4–7.3%),并改用按执行行为聚类后多数投票的更严格协议;工程附录事无巨细地列出 Gemma-3 的 ZeRO-3 初始化崩溃、vLLM 注意力后端不兼容等修复。这种坦白在当下的 RL 论文里并不多见。
局限与开放问题(作者也在结论中承认):agent 数量、多样性程度与交互拓扑如何影响学习动力学尚无系统刻画;分离线是二元简化下的结论,真实多答案分布下的行为有待推广;伪标签环状传递的拓扑(环 vs 全连接 vs 动态匹配)值得探索;此外跨家族配对对算力的要求翻倍,虽然换来的是全员提升。
七、与其他工作的关系图谱
| 维度 | TTRL / Intuitor / RENT | Co-rewarding | CoMAS / MAPoRL | Co-RL |
|---|---|---|---|---|
| 监督来源 | 自身输出(多数票/置信度/熵) | 改写题目 + EMA 自副本(同源两视图) | LLM 裁判 / 学习型奖励模型 | 独立更新的同伴模型 |
| 错误相关性 | 高(同一个模型) | 中(同源视图,仍强相关) | 裁判自身有偏 | 低(跨家族 κ≤0.42) |
| 是否需要裁判 | 否 | 否 | 是 | 否 |
| 多模型训练 | 否 | 否(单模型双视图) | 是 | 是(参数/梯度全解耦) |
| 理论保证 | 无(易自我强化) | 稳定性启发式 | 无 | 分离线定理扩大收敛盆 |
脉络上,Co-RL 是 co-training(1998)→ 深度互学习(2018)→ 多样性协同训练(2023)这条「互教学」谱系在无标签 LLM RL 时代的续章;与 Co-rewarding 的本质区别在于后者两个视图仍出自同一模型(错误强相关),而 Co-RL 用真正的第三方模型满足了两视图学习所需的独立性;与 CoMAS 的区别在于把「交互+裁判」简化成了「单向伪标签」,去掉了裁判这个新瓶颈。VLM 侧则填补了多模态无标签 RL 的空白——此前 MM-UPT 仍是单模型自信号。
八、个人思考:这篇论文改变了什么
它把「监督」从名词还原成了关系。 我们习惯把监督理解为静态的数据属性(有没有标签),Co-RL 提醒我们:监督的本质是一个与被优化对象独立的信号源。标签是最直接的独立源,但当标签不可得时,另一个独立训练的模型同样是独立源——只要它的错误与你不相关。这个视角下,「无监督」与「有监督」之间不是鸿沟,而是一条连续谱带,谱带上的刻度就是错误相关程度(κ)。
它给了「集体智能」一个最小可行配方。 没有辩论、没有多轮对话、没有裁判、没有共享梯度——只是环状传递多数票。这个极简配方既能跑通理论(分离线),又能跑赢重型系统(CoMAS)。有时候让集体变聪明的关键不是让成员交流更多,而是确保成员不一样。
它也抛出一个略带哲学意味的问题。 理论上如果两个模型完全同质(p_A = p_B),Co-RL 退化为 TTRL;多样性消失之日,就是互相监督失效之时。那么随着预训练语料与范式趋同、各家模型日益相似,跨家族互补度会不会系统性衰减?反过来,这是否意味着保持模型生态的多样性(不同架构、不同数据、不同训练哲学)不只关乎市场竞争,还关乎整个生态的「可教学性」?论文没提这一层,但我认为这是它最值得延伸的方向。
对实践者的启示:如果你的场景缺标签但有多个不同家族的模型可用,Co-RL 是目前证据最充分的方案——8 张 H100 就能复现主要结果,代码已开源。选搭档时先测错误互补度(附录 A 的四格表分析半小时就能跑完),κ 压不下去就别指望互监督有奇迹。
九、总结:一页看懂 Co-RL
问题:无真值标签、无外部裁判时,如何让 LLM/VLM 的推理能力通过 RL 自发提升?
洞察:自奖励的伪标签出自被优化模型自身,错误自我强化直至崩溃;独立训练的模型错误不相关,可以互当监督源。
方法:N 个不共享参数的异构 agent(不同家族/尺寸/改写提示词)对同一无标签题各采样 K 个回答;每个 agent 的奖励 = 是否命中指定同伴(环状,agent 1 由 agent N 监督)的多数投票伪标签;各 agent 独立 GRPO 更新。
理论:自奖励是自我确认动态(p < 1/2 必然归零);跨智能体监督把正确收敛的吸引盆从「两者各自 > 1/2」扩大为「p_A + p_B > 1」,互补长处可救彼此短处。
结果:文本 7 基准 4 个 LLM 平均 +3.0–8.6%,多模态 4 基准 5 个 VLM(2B–12B)+2.3–7.2%;超最强自奖励基线 0.8–2.0%;CoMAS 设置下 62.97 vs 58.94(+4.0%)且只用一半 agent、无需 LLM 裁判;7B/8B 上反超真值监督(Llama-8B 47.7 vs 47.1,Gemma-3-12B 47.56% vs 45.17%);预算对照实验证明增益非来自集成。
根源:跨家族错误解耦(κ≤0.42 / 互补度 ≥29.4%,与同家族 κ≥0.51 无重叠),同伴能纠正自身无法发现的错误,训练全程奖励方差与回答长度稳定。
一句话收尾:Co-RL 证明了在缺乏标签的世界里,「和你不一样」本身就是一种可以被梯度利用的稀缺资源。