J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 精读
自进化大模型在可验证领域已有成熟方案,但在没有标准答案的开放域,学习信号只能来自打分模型,而固定的Judge只能把Solver推到自己内化偏好的上限,饱和后奖励失去区分度。J-Zero让Challenger、Solver、Judge三者零数据共同进化:出题者与解题者通过GRPO对抗博弈,Judge依靠角色不对称与子任务放大两类结构性偏好对做Bradley-Terry更新,标签由构造方式先验决定而非Judge打分,避免自我强化偏差。Qwen3-4B上可验证域提升9.47分、不可验证域提升11.23分,超越R-Zero 4.74分,并持续改进十个迭代而baseline两迭代后退化。本文按九部分结构精读其动机、机制、实验证据与可迁移灵感。