论文一:PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents(Princeton + NVIDIA + University of Maryland,2026 年 9 月 30 日;项目页,NVIDIA 实习产出) 论文二:ComputerSD: Online Self-Distillation from Real-Time Feedback for Computer-Use Agents(Zhejiang University + Ant Group,2026 年 10 月 1 日;开源代码) 论文三:EviRover: Reinforcing Agentic Perception Beyond a Glance(CUHK MMLab + Fudan University,2026 年 9 月 30 日;全开源:代码+模型+数据) 共同底座:Qwen3 / Qwen3-VL 系列(三篇全部用 Qwen3 家族做学生或基座) 领域标签:Agent / 在线训练 / 强化学习 / 多模态感知
一、论文背景:在线训练补监督,但补在哪儿
要读懂这三篇论文,先要理解**智能体在线训练(online training)**这个大背景。
在线训练就是「边干活边上学」。 想象一个新入职的助理:离线微调像是上岗前集中培训(学的是别人录制的示范),而在线训练是让他直接干活,干完每单后根据结果复盘改进。用技术语言说:智能体在可执行环境里滚动收集轨迹(rollout),环境给出结果奖励(任务成功/失败),再用 GRPO 这类组相对策略优化算法更新参数。到 2026 年,这条路线已成为智能体后训练的主流——从网页购物到操作系统操作,模型在真实交互中自我提升。
但在线训练有一个众所周知的软肋:监督信号太稀疏。 一个 30 步的轨迹只有结尾一个 0/1 奖励,到底哪一步走对了、哪一步走错了,奖励本身说不清。这就是**信用分配(credit assignment)**难题。学术界给出了两条补监督的路线:
- 过程奖励:训练一个打分器给每步打分(如 GUI-Shepherd)。缺点是每步只有一个标量,粒度粗。
- 在线策略自蒸馏(OPSD, on-policy self-distillation):给冻结的学生模型一份「特权信息」(如参考答案、技能提示),让它在学生自己采样的响应上重新打分,用打分差作为 token 级的稠密信号。这是 2026 年最活跃的方向,衍生出 TurnOPD、StepOPSD、SDAR、AgentOPSD 等一批变体。
然而把 OPSD 用到多轮智能体上,还有三个没人认真回答的问题——恰好对应本期三篇论文:
- 错误之后怎么办? 多轮交互中一个错误动作会改变后续所有状态,学生陷入「自己造的错误状态」。OPSD 只在学生已有的响应上重加权,学生几乎不采样的「恢复动作」根本得不到学习信号。→ PivotOPD(Princeton+NVIDIA)回答这个。
- 特权信息从哪来、可信吗? 预先写好的参考轨迹很快与学生实际状态错位(GUI 任务往往有多条可行路径);即便指导相关,它引发的 token 概率移动也未必与该步的正确性一致。→ ComputerSD(浙大+蚂蚁)回答这个。
- 感知本身能不能主动? 传统 grounding/分割/计数都是「看一眼就答」,目标太小、或需要图外知识时一瞥式预测必然失败,但感知任务从没被当成一个可以多步取证的智能体过程来训练。→ EviRover(CUHK MMLab+复旦)回答这个。
一句话概括三者的关系:PivotOPD 补「失误后」的监督,ComputerSD 补「每一步」的实时监督,EviRover 把「要不要更多证据」变成可学习策略——三者共同把在线训练的监督从轨迹级推到过程级、从静态推到动态、从被动推到主动。
二、论文定位和关联工作
把三篇放进研究谱系里看:
| 谱系 | 代表工作 | 核心思想 | 与本期三篇的关系 |
|---|---|---|---|
| 组相对 RL | GRPO、GiGPO | 组内 rollout 的结果奖励归一化为优势 | 三篇共同的骨架;GiGPO 依赖状态复现,PivotOPD 指出「组内全失败时优势为零」的盲区 |
| 在线自蒸馏 | OPSD、GKD、MiniLLM | 特权条件下重打分学生自己的样本 | PivotOPD/ComputerSD 的直接基座;两者分别指出其在「恢复动作」与「GUI 实时性」上的失效 |
| 多轮蒸馏变体 | TurnOPD、TCOD、SOD、StepOPSD、AgentOPSD、RLSD、SDAR | 轮级重加权、课程加深、hindsight 门控 | PivotOPD 的 13 个基线大多来自这条线,全部只在学生采样过的响应上蒸馏 |
| 关键步信用 | PivotRL、OPID、GiGPO | 定位决定成败的回合并集中更新 | 都只给「学生采样过的动作」分配信用;PivotOPD 首次蒸馏「学生几乎不采样的恢复动作」 |
| CUA 在线 RL | ComputerRL、UI-TARS-2、DART | 可执行环境中的规模化在线 RL | ComputerSD 的同路人;它们仍依赖稀疏结果奖励,ComputerSD 补上 token 级信号 |
| 事后条件化教师 | HERO、GHD | 用动作后的观测条件化教师,解决状态错位 | ComputerSD 的直接前驱;ComputerSD 进一步用价值门调控信号强度 |
| thinking with images | V*、DeepEyes、Mini-o3 | 放大/裁剪的主动视觉检查 | EviRover 把「图内检查」与「图外搜索」统一进一个可 RL 的动作空间 |
| 感知专模 | Seg-R1、Seg-Zero、Perception-R1 | RL 训练分割/grounding 专模 | 在 EviLens 上接近失效(grounding 专模 IoU 近 0),证明缺的不是感知精度而是证据获取 |
定位结论:三篇论文分别占据在线训练的三个空白生态位——恢复行为学习(此前所有方法只学学生采样过的动作)、实时反馈蒸馏(此前特权信息都是预先固定的)、感知 agentic 化(此前感知始终是一瞥式单步预测)。它们同期出现(arXiv 2609.40285 / 2609.40253 / 2609.40230,前后两天内提交),共同宣告在线训练正从「结果奖励 + 静态蒸馏」走向「过程感知 + 动态取证」。
三、问题定义:三篇论文抽象出的三个本质问题
PivotOPD:学生自造状态上的学习信号从哪来
抽象:多轮 POMDP 中,学生犯错后进入「自造状态」(student-created states)——这类状态教师示范里不会出现,学生自己也很少采到正确动作。形式化:设学生动作分布为 p,含特权提示的自教师分布为 q,恢复动作为 a*。论文证明了关键的不对称性:
- 在学生分布 p 上采样并用任何信号 w 加权(组式 RL、反向 KL 都属此类),恢复动作上的期望更新为 p(a*)·(w(a*)−E_p[w])——随 p(a)→0 而消失*;
- 在自教师分布 q 上采样(前向 KL),只要提示把 a* 的概率抬升 e^δ 倍,恢复动作上的更新 ≥ δ(q(a*)−p(a*)) > 0——信号大小取决于教师而非学生。
所以本质问题是:当正确行为在学生自身分布里概率近乎为零时,如何注入与其量级无关的学习信号。
ComputerSD:如何把「执行后果」变成可信的 token 级监督
抽象:CUA 在线训练中,每步动作执行后环境返回新截图——这是一个天然的、免费的、与当前状态精确对齐的反馈源。问题是如何把这个原始反馈转化为两样东西:(1) 与学生实际状态对齐的特权上下文(解决固定指导的错位);(2) 对由此产生的 token 信号的可靠度评估(解决「正确步的 token 被压制」问题——论文实测固定指导下正确步 80% 的 token 被压低概率、错误步近 20% 的 token 被增强)。本质问题是:监督信号的构造者与监督信号的质检员应当是同一个来源——都来自刚执行完的那一步的真实后果。
EviRover:当「输出本身」就是证据寻求的目标
抽象:QA 智能体搜到的证据可以直接变成文字答案;而感知任务的输出是图上的框、掩码或计数——证据必须「落」回图像空间才算数。这让感知成为比 QA 更严格的取证测试:答案可验证(IoU/精确匹配),且只有同时做到「取到缺失证据 + 把证据正确锚定到视觉内容」才得分。本质问题是:缺失证据的类型因查询而异(小目标要放大、陌生身份要搜索),「查什么、怎么查」本身必须成为策略的一部分而非固定流程。
| 维度 | PivotOPD | ComputerSD | EviRover |
|---|---|---|---|
| 监督空缺 | 错误状态后的恢复行为 | 每步动作的即时反馈 | 证据不足时的主动取证 |
| 信号来源 | 教师命名动作 + 特权自教师 | 执行后截图 + 微调分析器 | 可验证的感知输出(IoU/EM) |
| 关键机制 | 预防(反向 KL)/恢复(前向 KL)不对称 | 价值门 γ=σ(β·s·δ) 调制 | SFT + agentic RL 学「何时查何处」 |
四、问题解法:三套机制拆解
4.1 PivotOPD:预防/恢复双蒸馏,方向不对称
整个方法建立在三个诊断数字上(用 ALFWorld 的符号 oracle 对 Qwen3-8B/30B/235B 的失败轨迹做反事实重放):
- 59% 的失败轨迹含「关键失误」(pivotal mistake)——使剩余最优轨迹变长的动作;且首个关键步来得早(中位数第 8–12 轮),此后模型平均浪费 18–21 轮也无法恢复;
- 纠正关键步,重放成功率 8%→59%;保留失误、只在随后两轮强制 oracle 动作,仍达 58%——失误大多是可恢复的,恢复几乎和预防一样有效;
- 标准 OPD 训练 120 步后,关键步后的失败率只从 51% 降到 49%——OPD 把犯错动作的概率从中位数 0.999 压到 10⁻⁵,但 oracle 动作的概率在每个关键步都低于 1%(8 个 rollout 的组别连一次都采样不到),学生缺乏自造状态上的直接学习信号。
方法三步走:
- 关键步检测:教师模型事后通读轨迹与结果,选出至多 m 个候选轮并给每轮命名「黄金动作」;学生实际动作与黄金动作不一致的候选轮即关键步。教师检测与 oracle 标注在 ±1 轮内吻合率 77.8%,至少是随机选轮的两倍。
- 预防蒸馏(反向 KL):把黄金动作作为提示喂给冻结学生(特权自教师),它对学生录制的响应重新打分,逐 token 的蒸馏优势 A = log π̄(token|提示) − log π̄(token) 加到 RL 优势上——把学生推向黄金动作、推离已犯的错。这本质是 OPSD 的「定位到关键步」版本。
- 恢复蒸馏(前向 KL):关键步之后,教师在环境重放副本上逐轮命名恢复动作;被提示的自教师写出恢复响应(学生自己几乎采不出来的),学生在无提示上下文上以前向 KL 拟合。前向 KL 的 mass-covering 性质恰好抬升学生分布中概率 <1% 的恢复动作——这正是反向 KL「只能重加权已有样本」做不到的。三项损失合进单个 PPO 更新。
一个直观案例:任务「把一个冷鸡蛋放进微波炉」,学生在冰箱没找到鸡蛋后错拿了番茄。基座模型把番茄塞进微波炉、来回瞎逛 30 轮失败;PivotOPD 训练后的模型则把番茄放回桌子、找到鸡蛋、冷却、放进微波炉——从同一个错误状态里爬了出来。
4.2 ComputerSD:实时反馈 + 价值门 + 全异步
方法分三件套:
- 微调的 GUI 分析器:以 Qwen3-VL-8B-Thinking 为底座,用 Kimi K3 标注的 34,188 个步级样本(任务、动作前后截图)做 LoRA SFT,学会对每个执行后转换输出「指导文本 + 步级价值分」。SFT 后与专家判断一致率 85.3%(未微调仅 29.9%)、有效输出率 99.7%。关键动机数据:未微调的基座模型常误判 GUI 转换,指导质量不可靠。
- 价值门控 OPSD:分析器的指导作为特权上下文,对每步响应重打分得 token 级概率差 δ;价值门 γ = σ(β·s·δ)(s 为步级价值分)按「概率移动方向与步级判断的一致性」调制信号强度——与判断一致的增强、冲突的压制。消融证明这不是画蛇添足:固定指导(35.0%)或去价值门(36.6%)都低于纯 GRPO(37.9%),即 naive OPSD 在 CUA 上是负贡献,只有「实时+门控」的组合才是正贡献(39.8%)。
- 全异步流水线:环境交互、GUI 分析、特权重打分、策略优化四段重叠执行,rollout worker 持续收集轨迹的同时每步被异步分析与打分。同步版 ComputerSD 每小时仅能处理约 42 条轨迹,异步版达 210 条——吞吐 ×5,且保住 GRPO 的 57%(分析器调用与重打分的额外开销)。
4.3 EviRover:证据寻求式感知的全栈训练
- 两条数据管线(分别对应两种证据缺失):
- 图内有但一瞥不可辨:高分辨率小目标图(目标常不足图像面积 0.1%)+ I-spy 隐藏目标 + spot-the-difference 场景,配边界框标注与过滤;
- 图外知识:85 类事件的真实合影(Seed-2.0-Pro 联网核验每个人的身份)+ GPT-Image-2 从单参考图合成合影(真实人物多参考条件下身份保持急剧退化,仅约 3 个参考内可靠,故真人只用单参考约束、动漫角色可多参考)。查询构造用迭代实体替换做多跳改写——每轮把查询中的一个实体换成不点名的间接描述,直到 Seed-1.8 无工具解不动为止,最多 20 跳——以此强制「不搜就不行」。
- EviLens 基准:688 例人工核验,覆盖定位(140)/识别(182)/找茬(15)/分割(195)/计数(156)五类,是唯一同时要求视觉获取、视觉比对与外部知识三项能力的感知基准。
- 两阶段训练:SFT(5K 轨迹建立工具格式,按行为模式降采样「直接答对」的轨迹防幻觉)→ agentic RL(12K 查询,EMA-GRPO 维护任务级奖励统计)。奖励即感知输出本身:grounding 用 IoU、分割用 SAM3 掩码 IoU、计数用精确匹配、找茬用软 F1(阈值 0.1 给部分分、IoU² 权重抑制乱撒框)。工具集 10 个:4 个外部取证(文本/图片/反图搜索、浏览)、3 个细看(裁剪、候选框回贴验证、局部确认)、3 个任务预测(SAM3 掩码、左右对照、Python)。另有一个容易被忽视的工程细节:策略损失用 sequence-mean-token-mean 而非 token-mean 聚合——附录证明 token-mean 会把更新权重按轨迹长度线性放大,长轨迹(往往是失败的一通乱搜)会不成比例地主导梯度。
五、评估指标与实验证据
PivotOPD:13 基线 3 基准 8 项平均全一
| 设定 | 关键数字 | 对比 |
|---|---|---|
| 1.7B(教师 30B-A3B) | ALFWorld 平均 +5.5%、Search-QA +5.9% | 超最强基线;WebShop 成功率 +14.1%(分数仅 +1.2%——把部分进度转化为完整完成) |
| 8B(教师 122B-A10B) | 8 项基准平均全部第一 | 最小领先 +1.8% |
| 自蒸馏(学生当自己的教师) | 3 基准全胜,平均 +3.9% | 证明收益主要来自「在哪干预、怎么干预」而非教师容量 |
| 跨家族迁移 | Nemotron-3.5 在 SWE-Bench Verified 解决率 +3.2% | 标准 OPD 仅 +0.2%;约缩小与教师差距的三分之一 |
| 恢复能力 | 72 个 oracle 关键失误重放中恢复率 72.7% | 基座 8.3%、标准 OPD 20.3%、仅预防 45.8%;比预防版再 +26.9%,恢复效率 9.7 轮(最优 6.2) |
消融设计尤其有说服力:把同样的提示注入随机轮次,平均成功率 62.6%(全场最低)——监督必须落在关键步上;提示里去掉黄金动作换成泛泛反思,Pick2 任务掉 9.3%——必须点名正确动作;把恢复蒸馏换成反向 KL,平均掉到 64.5%——方向不对称是必要的。恢复预算 K 的选择也讲得通:ALFWorld 需 K=2(错后还要链式细粒度动作),WebShop/Search-QA 只需 K=1,与「错误深度决定恢复轮数」的命题 3 一致。
ComputerSD:两骨干全面胜出,OOD 不退化
| 设定 | OSWorld-Verified | OOD 类别 | WindowsAgentArena |
|---|---|---|---|
| Qwen3-VL-8B-Thinking + GRPO | 37.9% | 21.6%(较基座 −1.4) | 23.3% |
| 同 + ComputerSD | 39.8%(+1.9) | 27.5%(+4.5) | 24.5%(+5.3) |
| EvoCUA-8B + GRPO | 43.8% | 30.2%(−1.4) | 24.2% |
| 同 + ComputerSD | 47.9%(+4.1) | 35.4%(+3.8) | 27.8%(+3.4) |
两个值得注意的实验设计:其一,GRPO 在 OOD 类别上是负贡献(两个骨干均 −1.4),而 ComputerSD 反而 +4.5/+3.8——说明 token 级监督不是拟合训练任务而是内化了可迁移的状态理解(案例研究:GRPO 策略没勾选自动保存复选框就点 OK 宣称成功;ComputerSD 策略先勾选再改值,OOD 任务上还会退出编辑页重开菜单验证改名生效)。其二,专化模型增益更大(+4.1 > +1.9),说明实时反馈蒸馏在计算机使用专训之后仍有效。EvoCUA-8B + ComputerSD 的 47.9% 超过全部列出的开源模型(OpenCUA-72B 为 45.0%)与多数专有模型(Claude-4-Sonnet 43.9%),仅次于 UI-TARS-2(47.5% 同级)与 Claude-4.5-Sonnet(62.9%)。样本效率同样突出:达到 GRPO 最终性能只需其 56%(通用骨干)/22%(专化骨干)的轨迹预算。
EviRover:4B 模型站上专有模型梯队
| 基准 | 关键数字 | 说明 |
|---|---|---|
| EviLens 平均 | 较 Qwen3-VL-4B 基座 +30.2 点 | 与 Seed-2.1-turbo、Gemini-3.5-Flash 梯队可比 |
| EviLens 定位 IoU | 0.444(全部模型第一) | 超 Gemini-3.5-Flash 的 0.373;分割 0.686 gIoU 仅次于 Seed-2.1-turbo(0.779) |
| EviLens 计数 | 50.0 | 距 GPT-5.6-Sol(51.3)仅 1.3 点;找茬 F1mi 0.171 超 GPT-5.6-Sol(0.112,它总只预测一个框) |
| WebEyes | grounding 40.0 IoU / R@0.5 48.5 全场第一(含专有模型) | 分割 49.5 gIoU 超 Pixel-Searcher-8B +10.4;VQA(训练没见过)与专模打平 |
| 常规感知 | RefCOCOg / ReasonSeg 全面超基座 | 证据寻求训练不伤常规感知反而加分 |
| BrowseComp-VL | 9.5 → 24.8(+15.3 点,翻 2.6 倍) | 学到的取证行为迁移到 agentic 视觉 QA;MMMU/MathVerse 也有 3–4 点提升 |
EviLens 的「考倒所有人」设计是证明力的来源:分割专模最高 0.343 gIoU、grounding 专模 IoU 接近 0、通用开源模型普遍低于 0.12 IoU——难度不在感知精度而在证据获取,这正是新范式价值的直接证据。
六、效果优势的根源解释
PivotOPD:为什么恢复蒸馏能在 RL 失效的地方起作用
因果链:组内全失败 → 组相对优势恒为零(论文命题 2)→ RL 无信号;反向 KL 只能重加权学生已有样本 → 恢复动作概率 <1% → 信号随 p(a)→0 消失 → 前向 KL 在自教师分布上取期望 → 更新量 ≥ δ(q(a)−p(a*)),与学生的概率无关 → 自造状态上被注入了与量级无关的正信号。** 实验证据环环相扣:增益最大的正是基座最弱、组内最常全失败的 Clean/Cool/Heat 任务(1.7B 上对 GRPO 领先 30–40 点);训练中关键步之后,仅预防版本的师生 KL 散度始终是 PivotOPD 的至少两倍且不收敛,而 PivotOPD 在训练一两轮内就把散度拉回——学到的恢复还外溢到训练轮次之外。这与交互式模仿学习(DAgger「在学生到达的状态上查询专家」)的经典理论相呼应,但 PivotOPD 的巧思是专家只命名动作、token 级目标由学生自己的被提示分布生成,避免了模仿专家轨迹的分布错配。
ComputerSD:为什么「实时 + 门控」缺一不可
两个失效模式的实测数据给出了根因:固定指导下正确步 80% 的 token 被压制(指导假设的路径与学生实际路径分叉后,正确步被误判为偏航);无门控时错误步近 20% 的 token 被增强(指导引发的概率移动与步级正确性无关)。价值门的数学形式 γ=σ(β·s·δ) 让信号强度成为「移动方向 × 步级判断符号」的函数——一致则门开、冲突则门关。反门实验(故意放大冲突信号)显示师生差距在训练中越拉越大且策略熵下降(学生越来越自信地漂离教师支持分布),从反面验证了门控方向性。异步流水线的 ×5 吞吐则是工程必要条件:同步版每小时 42 条轨迹根本撑不起 180 步在线训练。GRPO 的 OOD 退化 vs ComputerSD 的 OOD 提升这一对照还揭示:步级监督学到的不是动作序列而是状态理解——案例里「先勾选复选框再改数值」是对 GUI 状态语义的理解,换个应用也成立。
EviRover:为什么「感知输出即证据目标」是关键设计
与 QA 智能体的根本区别在于反馈的锚定性:文字答案可以直接从搜索结果抄,但框/掩码/计数必须锚定回原图坐标才得分——奖励天然惩罚「搜到了却没看懂图」。这解释了为什么 4B 模型能在定位上超过 Gemini-3.5-Flash:专有模型有更强的参数知识与直觉,但没有被训练「何时该放大、何时该反图搜索」,在目标占图不足 0.1% 或需要跨 20 跳间接指代的查询上,一瞥式预测与被训练过的主动取证差距悬殊。找茬任务的软 F1 奖励设计(低阈值 0.1 部分给分 + IoU² 权重)也是可复用的机制:稠密信号让「大致找对」有梯度可学,平方权重又让乱撒框无利可图——论文证明了新增一个框当且仅当其匹配质量超过当前集合 F1 的一半才涨奖励。BrowseComp-VL +15 点的外溢则说明「何时查、查什么」是比任何具体任务更通用的能力。
七、必要知识反推与通用性灵感
作者必须知道什么
- PivotOPD 团队:蒸馏文献里前向/反向 KL 的 mode-covering/mode-seeking 之辨(GKD、MiniLLM),交互式模仿学习的 DAgger 系理论,GRPO 组相对优势的零信号盲区,以及「特权自教师」这一 2026 年蒸馏新范式的来龙去脉——最后用概率论把三者缝进一个 PPO 更新(附录 C 的三个命题 + 两个引理是扎实的理论功夫)。
- ComputerSD 团队:CUA 在线 RL 的工程栈(slime 框架、OpenClaw-RL 异步架构)、OPSD 变体谱系(SDAR 门控、HERO 事后条件化),以及一个朴素但关键的领域事实——GUI 的每一步动作都免费自带一张「后果截图」,这是文本环境没有的天然反馈通道。
- EviRover 团队:感知任务谱系(grounding/分割/计数的一瞥式传统)、thinking-with-images 与多模态搜索两条 agent 线、生成模型的身份保持极限(真人多参考退化)、GRPO 损失聚合的统计细节(token-mean 的长度偏置证明写满了三页附录),再加数据管线的工程想象力——合成合影 + 反向图搜核验身份 + 迭代实体替换造多跳查询。
可以提取的通用性灵感
- 诊断先于方法(PivotOPD):「8%→59% vs 58%」这组反事实重放数字先证明了「失误可恢复、恢复值得学」,方法才顺理成章。做系统改进前,先花力气量化「问题到底值多少分」——诊断实验本身就是论文一半的贡献。
- 采样分布决定学习上限,换分布就是换天花板(PivotOPD):在学生分布上一切信号都随概率衰减;到教师分布上采样,信号与学生的概率无关。任何「正确行为近乎不被采样的场景」(安全兜底、长尾恢复、罕见工具调用)都适用这个思路。
- 最好的监督来源是行为的即时后果(ComputerSD):与其预先准备指导(必然过时/错位),不如把「刚执行完的那一步的反馈」结构化成特权信息。GUI 是截图,别的领域可能是测试输出、日志 diff、用户表情——找那个「免费且与当前状态精确对齐」的反馈通道。
- 信号构造者应兼任信号质检员(ComputerSD):价值门用同一个反馈源的「判断」来调制它自己产生的「信号」。生成监督的同时生成监督的可信度,是比事后过滤更优雅的可靠性设计。
- 异步化是在线训练的生死线(ComputerSD):×5 吞吐不是锦上添花——同步版根本跑不动。任何「每步都要过一遍分析器」的方法都必须把分析与 rollout 重叠起来。
- 让输出本身可验证,学习就会自己发生(EviRover):把任务输出设计成可机器判定的形式(框的 IoU、计数的 EM),RL 奖励就免费且不可作弊。「搜到证据还得锚回图像」的约束保证了能力是真的——设计任务时优先想想「答案能不能变成可验证对象」。
- 专化训练反而放大在线监督的收益(ComputerSD 的 +4.1 > +1.9):不要假设「模型已经很强就没得学」——专化模型的错误更集中在过程细节上,恰好是步级监督的射程。
- 警惕 token-mean 的长轨迹偏置(EviRover 附录):agent 轨迹长度是策略的函数,失败轨迹往往更长,token-mean 会自动放大对失败轨迹的梯度。做 agentic RL 的人值得检查一下自己的 loss reduction。
三篇论文合起来给出的最大启发或许是:在线训练的下一个前沿不在「更强的奖励」,而在更细的监督粒度(token)、更准的监督位置(关键步/实时步)、更主动的取证决策(何时查)。当这三件事同时发生,一个 4B 感知模型能追平专有巨头,一个 8B GUI 智能体能超越所有开源对手,一个犯错的智能体能自己爬出泥潭。