WM-R1: Training GUI Agents to Reason and Leverage World Models with Reinforcement Learning 精读

用强化学习训练手机 GUI 智能体,为什么必须忍受昂贵的真实环境交互?华东师范大学提出的 WM-R1 给出了第一个完全相反的答案:把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移,Agent 通过 GRPO 在纯模拟环境中学习;更关键的是 <call_wm> 机制把世界模型嵌进思维链,让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA(超 UI-R1 达 9 个百分点),OOD 平均提升 +16.0,训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。

August 31, 2026 · 5 min

J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 精读

自进化大模型在可验证领域已有成熟方案,但在没有标准答案的开放域,学习信号只能来自打分模型,而固定的Judge只能把Solver推到自己内化偏好的上限,饱和后奖励失去区分度。J-Zero让Challenger、Solver、Judge三者零数据共同进化:出题者与解题者通过GRPO对抗博弈,Judge依靠角色不对称与子任务放大两类结构性偏好对做Bradley-Terry更新,标签由构造方式先验决定而非Judge打分,避免自我强化偏差。Qwen3-4B上可验证域提升9.47分、不可验证域提升11.23分,超越R-Zero 4.74分,并持续改进十个迭代而baseline两迭代后退化。本文按九部分结构精读其动机、机制、实验证据与可迁移灵感。

August 29, 2026 · 7 min

SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读

语音 Agent 必须完全通过语音完成工具调用与多轮对话,主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境:两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话,工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%,为文本通道的 16 倍;per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%,破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准,pass@1 从 24% 升至 53%,开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2,且轮数与 token 同步下降。

August 29, 2026 · 7 min

Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读

RLVR 训练有个广为人知的暗面:策略熵不断下降、模型越来越自信,大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法(熵正则、梯度校准、奖励设计)都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路:让一个 2B 小模型先生成部分推理前缀,再让目标大模型接着写完——而且小模型的前缀大多质量堪忧(多数『无实质指导』甚至『误导』),收益恰恰来自这种『不熟悉』而非『正确』。方法极简:按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练,pass@128 即从 67.76 恢复到 70.71(接近 base 的 72.15)。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』,这是本文最干净的洞察。

August 28, 2026 · 2 min

Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读

用 RLVR(可验证奖励的强化学习)训练出的领域专家各有绝活:数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文,把三种把多域能力融合进单模型的范式放进同一实验框架对比:Merge(合并任务向量,零训练成本)、Mix RL(混合数据重训一遍)、MOPD(多师在线蒸馏,兼用两者)。结论出人意料地均衡:三范式平均分差不超过 1.4 分,但单个基准差距可达 8.6 分,且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移,指令跟随与 Agent 则与其它域近正交。更有意思的是,三种融合都只是『把已有的解重新加权』而非扩大解题覆盖:pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。

August 28, 2026 · 3 min

TTPO: Test-Time Policy Optimization 精读

没有标签也能在测试题上直接训练模型?浙大与阿里的 TTPO 给出了一个干净的不对称方案:多数投票选出伪标签后,同意的 rollout 走蒸馏分支(OPSD 前向 KL + 降权已收敛 token),不同意的走 GRPO 惩罚分支(只罚高置信错误 token)。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的,但不同意它的 rollout 约 79% 本身也是错的,所以「惩罚不一致」不需要伪标签正确,而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD,Qwen3-1.7B 从 38.0% 提到 45.2%,4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。

August 28, 2026 · 1 min

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读

进化策略(ES)一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低,但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象:理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K;实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型,而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍,但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。

August 28, 2026 · 3 min

AWM: Answerable Working Memory for Long-Document VQA Agents 精读

深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现:即便给了金标证据页,42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO,同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证,以及中间产物监督这一通用方法论。

August 27, 2026 · 4 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读

深度精读腾讯微信团队(26 Aug 2026)论文 IAPO:多轮服务 Agent 训练中,最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图(支持使用边/失败使用边),用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势,不改奖励、采样与损失实现,在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%(+12.57pp),电信域增益最大达 +18.19pp,且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。

August 27, 2026 · 5 min