论文 A 链接:MintAct: A Unified Visual Agent for Digital Environments(arXiv:2609.22083v1,投稿 2026-09-18) 论文 B 链接:Recursive Language Models Generalize Out of Domain(arXiv:2609.20831v1,投稿 2026-07-23) 发表时间:A:2026 年 9 月;B:2026 年 7 月 机构:A:Apple(纯企业研究团队);B:Toyota Technological Institute at Chicago (TTIC) 领域标签:A:cs.CV / 多模态 GUI 智能体;B:cs.CL / 推理与分布外泛化理论


引子:两篇论文,同一个母题

今天的两篇论文看似一个偏工程、一个偏理论,却共享一个被反复追问的问题:能不能用一个统一模型取代一堆各管一摊的专用模型? 答案如果是「能」,收益巨大——部署只需一份权重、一份基础设施;答案如果是「不能」,原因通常也不是模型不够大,而是「统一」这件事本身会引入干扰、捷径与表征冲突。

  • MintAct(A) 解决的是空间域统一:让一个视觉智能体同时会「看懂界面元素」「在手机/电脑/网页/VTU 四地导航」「调用视觉工具」,且尺寸小到能上设备。
  • Recursive Language Models(B) 解决的是推理结构统一:让一个推理模型用同一个「递归执行规则」去解任意子问题,且能在比训练长得多的轨迹上保持正确。

两文一实一虚,但都落脚于同一句洞见:统一的真正瓶颈不是容量,而是「每个子任务该看到什么信息、不该看到什么信息」的显式控制。 下文按统一的背景动机、谱系定位、问题抽象、解法、证据、根源、知识反推、可迁移灵感八节展开,并在每节用类比与表格降低阅读门槛。


一、论文背景:统一模型的两种动机

1.1 为什么想「统一」——部署效率视角(对应 MintAct)

今天的数字助理要想真正好用,必须同时具备三种能力:UI grounding(把一句话指令定位到屏幕上的某个按钮/输入框)、多步导航(在手机、桌面、网页上连续操作完成任务)、视觉工具调用(超出屏幕所能直接操控时,去调用外部 API/工具)。但现状是这三项能力被拆成了各自孤立的专用模型:

  • grounding 有 ScreenSpot 一系;mobile 有 Mobile-Agent;desktop 有 UI-TARS、OpenCUA、EvoCUA;web 有 Weblica、Scale-CUA;tool use 又有专门的工作。

为每个领域各养一个模型,训练、评测、部署、扩容的成本都翻倍。尤其当模型要塞进手机等端侧设备(2B~8B 这种紧凑尺寸)时,「每个域一个专家」根本不现实。核心矛盾:朴素地把各域动作集合并在一起、把各域数据混在一起训,域与域之间会互相干扰,单域质量反而掉下去。所以 MintAct 要回答的是——统一而不掉点。

1.2 为什么想「统一」——泛化保证视角(对应递归 LM)

另一路统一的动机来自推理的可靠性。标准 Chain-of-Thought(CoT)把每个子问题和每一步中间结果都写进同一条不断变长的序列里,模型每次预测都能「看到全盘」。这很通用,但「看得全」在分布内(IID)是免费的午餐,在分布外(OOD)却可能变成毒药:因为盘面上的无关 token(别人子问题的中间值、固定的格式、答案出现的位置规律)在训练域里恰好可预测,简单偏好(simplicity bias)会让模型学会一条更短、但依赖这些无关线索的「捷径规则」,而非真正解子问题的规则。一旦轨迹比训练时长,这些线索错位,模型就崩了。

递归语言模型(RM)提出另一种统一:用同一个预测器、隔离的上下文去解每个子问题,只把答案传回父问题,形成上下文栈。它把「统一执行规则」和「隔离无关信息」捏在了一起。这正是 B 要形式化并验证的对象。

类比(初学者友好)

  • MintAct ≈ 一个人分饰四角还不串戏:同一个演员(一个 VLM)既要演「指路员」(grounding)、又要演「手机操作手」「电脑操作手」「网页操作手」(四域导航)、还要演「工具调度员」(tool use)。难点不是他演技不够,而是四套剧本的台词和走位一旦混在一张纸上,他就会念错对手的词。
  • 递归 LM ≈ 考试时只发给你「本题」,不让你看别人的草稿纸:CoT 是所有人把草稿都摊在大桌上,你解题时可以偷瞄邻座的算式;训练时邻座算式恰好能帮你,但换一套座位(OOD)你就傻了。RM 是每人只拿到自己的题,草稿写完只交答案——你被迫真的学会解题,而不是抄线索。

二、论文定位与关联工作谱系

2.1 MintAct 在 CUA 统一模型谱系中的位置

谱系/工作核心思想与 MintAct 的关键区别
UI-TARS(ByteDance Seed)高分辨 grounding + 长程跨平台交互的桌面/通用 CUA 专家单域/少域专家,MintAct 要的是单模型统四域且同尺寸不掉点
OpenCUA(Wang et al. 2026)开源 CUA 基座 + AgentNet 大规模轨迹同为专家路线;MintAct-8B 在 OSWorld-Verified 48.9 远超 OpenCUA-7B 26.6
EvoCUA(Xue et al. 2026)任务生成 + 沙箱探索 + 自验证的自进化训练环强调数据自演化;MintAct 强调训练配方与异步 RL 基础设施
Weblica / Scale-CUA网页导航专精(网站回放 / 跨源数据缩放)单域专精;MintAct 在 Weblica 74.7 体现统一后仍强
MintAct(本文)单 VLM 统一 grounding+四域导航+tool use显式均衡混合 + 异步 RL 锁死配比,统一不掉点

定位结论:MintAct 不属于「再训一个更强的单域专家」,而是把「多域统一」本身当作一个数据、环境、训练的工程问题来系统性解决。

2.2 递归 LM 在「递归/CoT 理论」谱系中的位置

谱系/工作核心思想与本文 B 的关系
标准 CoT(Wei et al. 2022;Nye et al. 2021)全轨迹共享一个上下文B 的对照基线;证明「看得全」在 IID 免费、OOD 致命
Recursive Models for Long-Horizon Reasoning(Yang, Srebro, Li;arXiv:2603.02112,ICML 2026)用 call/return 两 token + 隔离上下文栈做递归,证明严格优于单上下文同一批作者前作;B 把其执行模型提升到 MDL 泛化理论
Chained Recursive LMs(arXiv:2608.05124)推理期用「新鲜上下文根 + 黑板」做递归工程侧印证隔离上下文可提升长程推理
Deep recurrent / universal Transformer 一系循环/递归结构带来长度外推提供「隔离上下文→长度泛化」的机制先例(见第六节)

定位结论:B 是递归 LM 谱系从「计算复杂度优势」走向「分布外泛化保证」的关键一步——它用 MDL 把「为什么递归比 CoT 在 OOD 更稳」讲成了定理。


三、问题定义

3.1 MintAct:多域干扰下的统一不掉点

  • 具体问题:一个 VLM 如何同时承担 grounding、mobile/desktop/web/VTU 导航、tool use,且在每个单项上匹配同尺寸专家?
  • 抽象问题:给定多域观测—动作空间异质的任务族,求一个单一策略 π,使对每域 d 有 E[reward_d(π)] ≥ E[reward_d(π_d^*)](π_d^* 为该域专家),且训练时各域在批次中的真实占比被锁定在目标配比附近,不被「谁的环境快谁就霸占梯度」所扭曲。
  • 精妙之处:把「统一」重新定义为「配比可控的统一」,而非「数据无脑混合」。干扰来自配比漂移与动作语义冲突,因此解法必须在数据与优化两端同时施加约束。

3.2 递归 LM:观测范围与 OOD 不变性

  • 具体问题:CoT 全上下文可读,为何在比训练长的轨迹上崩?
  • 抽象问题:设子问题答案只依赖其自身描述(Π-不变性:改变周围序列不应改变该子问题预测)。给定训练分布 D,求 predictor f 使 (a) 在 D 上一致;(b) 对 D 外更长轨迹仍满足 Π-不变。CoT 的类能覆盖递归规则,但也能覆盖更短的非不变规则;MDL/简单偏好会挑后者。
  • 形式化对应表:
直觉形式化
「看得全」CoT 的 next-token 注意力可覆盖整条扁平轨迹
「隔离上下文」RM 每个 frame 只有子问题自身描述 + 返回值
「捷径」一条 description length 更短、但依赖无关 token 的规则
「真正会解题」Π-不变规则(答案只由子问题自身决定)

四、问题解法

4.1 MintAct:四阶段训练 + 三个统一设计 + 异步四机制

三个统一设计(先定格式,再定训练)

  1. 纯像素 + 999×999 归一化坐标:所有域统一用截图像素输入、坐标归一化到 [0,999],消除分辨率/坐标体系差异。
  2. prompt 条件化动作集:不把四域动作硬拼进一个巨大动作空间,而是用 prompt 声明「当前域允许的动作」,模型据此输出——隔离了动作语义冲突。
  3. 显式均衡混合:数据按比例显式混合,而非随机拼接。

四阶段训练配方

  1. 高分辨单步 SFT:2,116,800 条像素级 grounding/单步样本,先点亮基础感知。
  2. 低分辨多步 SFT:mobile/desktop/web/VTU 各 42.7k / 23.5k / 51.7k / 59.8k 条轨迹,严格 25:25:25:25 均衡,学多步导航。
  3. 每域 RL 专家 + 拒绝采样蒸馏:先在各域分别 RL 出专家,再把专家轨迹拒绝采样回蒸馏进单一模型,避免联合 RL 早期被强势域带偏。
  4. 联合异步 RL:在统一模型上做跨域 agentic RL,用异步框架稳住训练分布。

异步 RL 四机制(统一不掉点的工程核心)

机制作用取值
per-domain quota q_d=32每域每个 micro-batch 最多 32 条,锁死配比32
quota-normalized backpressure慢域堆积时反向加压,快域不能霸占梯度归一化背压
dual-clip(ε_lo=0.2, ε_hi=0.28, c=3)抑制离群优势,稳定长多模态轨迹的 PPO 更新双裁剪
truncated Importance Sampling(C=2)截断 IS 权重,缓解 off-policy 漂移C=2

直觉:quota 是「每域每轮必须点名」,backpressure 是「谁拖后腿就多给它发牌」,dual-clip 与 truncated IS 是「别让一条怪样本把整锅汤带偏」。

4.2 递归 LM:RM 执行模型 + MDL 形式化 + 两定理

RM 执行模型:用 4 个控制 token 维护一个上下文栈。遇到子问题就 push 一个新 frame,在该 frame 内用同一预测器求解,草稿不进父上下文,只把答案 return 回去。这从结构上保证了「子问题看不见无关信息」。

MDL 形式化:给每个 predictor f 一个描述长度 |f|_ℓ(满足 Kraft 条件,可理解为「用前缀码描述 f 所需的比特数」),MDL 学习器在「与观测一致」的预测器里挑描述最短者。简单偏好由此而来——但 MDL 不区分「真规则」和「刚好拟合训练、更短的捷径规则」。关键推论是:CoT 的表达类既能装下递归的 Π-不变规则,也能装下「覆盖整条序列、比不变规则更短」的非不变规则;在有限训练样本下,描述长度更短的那个胜出。这意味着覆盖正确规则 ≠ 学到正确规则——这与经典 IID 学习理论(只要类能覆盖好规则就够)形成鲜明反差,也是 B 标题「Generalize Out of Domain」的题眼:真正的推理需要的是不变性,而不只是覆盖面。

两个定理(论文实验已支持)

  • Theorem 4:CoT 可用仅 +O(1) 深度的 Transformer 模拟 RM 的递归规则,因此 IID 下的描述长度界只差一个常数因子——分布内,递归几乎不占统计便宜。
  • Theorem 8:CoT 能找到一条「覆盖整条序列、比不变规则更短」的规则,且这使其必然非 Π-不变——它会学会「答案在轨迹里怎么暴露」,而非「怎么解子问题」。这正是 OOD 崩溃的根源。

五、评估指标与实验证据

5.1 MintAct:同尺寸 SOTA 对比 + 逐机制消融

主指标是各基准 success rate(越高越好),辅助看「统一模型 vs 同尺寸专家」是否持平。

基准MintAct-8B同尺寸最强基线差距含义
OSWorld-Verified48.9UI-TARS-1.5-7B 27.5 / OpenCUA-7B 26.6同尺寸登顶,约 +21pt
Weblica74.7—网页导航统一后仍强
AndroidWorld67.0Qwen3-VL-8B 47.6+19.4pt,移动域显著超越基座
MM-ToolSandBox3.1 → 24.5—视觉工具调用大幅提升
Online-Mind2Web39.1—网页代理在线评测

证明力设计:联合 RL 后 Nav.Avg 55.9,超过全部单域专家(54.1 / 54.3)——这直接支撑「统一不仅不掉点,反而因联合信号略超专家」。消融上,论文逐机制验证:去掉均衡混合域互相干扰掉点;去掉异步四机制中任一环,长轨迹 RL 不稳、配比漂移。

5.2 递归 LM:三组对照实验,直证「非不变性」

B 的实验设计极其克制——同一个 6 层 Transformer,只换「是否隔离上下文」这一变量,在 mod-10(模 10 加法)测试床上比较 RM 视图与 CoT 视图。

实验设置RMCoT结论
mod-10 IID分布内≈100%≈100%分布内「看得全」免费(印证 Thm 4)
mod-10 长度泛化轨迹长 2.5–3×L95.7%6.2%+89.4pt,OOD 下 CoT 崩、RM 稳
捷径构造人工植入可抄的无关线索高捷径率 69.7–99.3%最高 +98.7pt,直接验证 CoT 学到非不变捷径(印证 Thm 8)

证明力分析:长度泛化实验说明「CoT 崩不是容量问题,是看到的无关线索错位」;而「捷径构造」实验是杀手锏——作者主动在训练里埋入可被抄的线索,证明 CoT 的准确率提升来自抄线索而非解题,从而把 Theorem 8 的「非 Π-不变」从定理变成了可观测事实。


六、效果优势的根源解释

6.1 因果链

MintAct(论文实验已支持)

  • 根因 1:动作语义冲突 → prompt 条件化动作集让「当前域允许什么」显式化,不同域的同名动作不会串台。
  • 根因 2:配比漂移(快域霸占梯度)→ q_d=32 + quota-normalized backpressure 把各域真实占比锁死,慢域(如 VTU)不被饿死。
  • 根因 3:长多模态轨迹噪声大、离群优势多 → dual-clip + truncated IS 抑制 off-policy 漂移,训练稳定。

递归 LM(论文实验已支持 + 阅读者机制推测)

  • 根因:CoT 的注意力覆盖整条轨迹 → 无关 token 在训练域形成可预测模式 → 简单偏好挑更短的非不变规则(捷径)。RM 的上下文隔离让这些线索物理上不可见,MDL 只能挑 Π-不变规则。(推测) 这种「信息可见性即归纳偏置」可能是比容量更重要的泛化杠杆。

6.2 相关工作检索与交叉验证

研究(可核验链接)相似尝试相关结论与本文差异/边界对根源解释的影响
UI-TARS(ByteDance)/ OpenCUA(xlang-ai)单/少域 CUA 专家,OSWorld 26.6–27.5(7B)专家路线证明单域可做到高分为 MintAct 提供基线MintAct 同尺寸 48.9 反超,说明统一配方而非容量是增量支持:统一不掉点依赖配方与配比控制
CoT shortcut learning(arXiv:2406.06580 “Break the Chain”)实证 LLM 是「捷径推理者」,可绕过详细步骤抄线索确认 CoT 依赖启发式/捷径提效该文把捷径当效率优势;B 把同一现象当 OOD 失败源支持+限定:捷径真实存在,但价值判定取决于分布
Recursive decomposition(arXiv:2603.02112,ICML 2026,同作者)call/return + 隔离上下文栈,证严格优于单上下文递归隔离上下文在计算复杂度上更优,3B 模型递归解 SATB 是其泛化理论化延伸强支持:执行模型可行且强大
深度循环/Universal Transformer 一系循环结构带来长度外推解耦局部上下文与全局计算可外推到更长输入与 RM「栈式隔离」机制同源支持:解释 RM 长度泛化 95.7%

6.3 综合判断与未决问题

  • 多研究共同支持:① 统一模型的关键在「配比/信息可见性的显式控制」而非容量(MintAct + 递归 LM 互相印证);② CoT 确实存在可被利用的捷径(2406.06580 + B 捷径实验)。
  • 仍属推测:RM 的「少看反而学得对」在所有任务类上是否都优于 CoT?B 自己承认 IID 下 CoT 不劣且最终追上——RM 的优势边界是 OOD/长程,而非普适。
  • 可能失效条件:若 OOD 下「子问题答案本就依赖全局上下文」(非 Π-不变任务),RM 的隔离反而丢信息。优势的成立前提是任务确实具有子问题可分解性。

七、必要知识反推

假设一个毫无背景的人来做这两项工作,他最少必须知道什么?

领域知识层

  • A:GUI 智能体的观测(截图/可访问性树)、动作原语(click/type/scroll/工具调用)、各域环境差异。
  • B:语言模型 next-token 预测、CoT、上下文窗口与注意力的信息流。

方法论知识层

  • A:SFT→RL 的训练范式、PPO 的 clip/IS、拒绝采样蒸馏、异步 RL 的稳定性问题(off-policy 漂移)。
  • B:MDL/描述长度与简单偏好、PAC/IID 泛化界、Π-不变性与因果不变性、Transformer 深度—容量关系。

工程知识层

  • A:可托管数百并发异构环境实例的基础设施、长多模态轨迹的采样与回放。
  • B:用受控 testbed(mod-10)把「上下文可见性」做成唯一变量,这是把理论变成可观测事实的关键实验设计能力。

知识融合的关键节点:A 的突破在于把「部署效率动机」翻译成「配比可控的统一优化问题」;B 的突破在于把「递归比 CoT 稳」的直觉翻译成「MDL 下不变规则 vs 捷径规则」的定理,并用唯一变量实验坐实。两者的创造性都来自「把工程/经验现象,落到信息可见性这一统一旋钮上」。


八、可迁移的通用性灵感

  1. 显式配比 + 背压的「双闭环」控制(来自 MintAct)

    • 核心:凡是要把多源数据/多目标训进一个模型,「想要什么比例」必须写成硬约束(quota)加动态调节器(backpressure),不能指望自发均衡。
    • 证据:去掉均衡混合即掉点;Nav.Avg 55.9 超单域专家。
    • 推广:多任务学习、混合专家路由、多租户模型服务、任何「多数据流汇进一个优化器」的场景。
  2. 信息可见性即归纳偏置——「少看反而学得对」(来自递归 LM)

    • 核心:模型「能看见什么」本身就是一种强归纳偏置;想让它学不变规则,就从结构上藏起无关信息,而非只靠数据或正则。
    • 证据:RM 隔离上下文 → mod-10 长度泛化 95.7% vs CoT 6.2%;捷径实验 +98.7pt。
    • 推广: agent 记忆系统设计(哪些历史该进上下文)、检索增强(该召回什么)、多智能体通信(该暴露什么状态)、课程学习(训练时该遮蔽什么以提升 OOD)、乃至「bitter lesson 的反面」——在追求覆盖正确规则之外,约束观测范围可能是通往真推理的更短路径。
  3. 「统一」的成败不在容量,在接口(两文共通)

    • MintAct 用 prompt 条件化动作集、递归 LM 用隔离上下文栈,本质都是给统一模型一个干净的「每子任务接口」。推广到任何统一架构:先设计好「每个子任务看到/能做什么」的边界,容量问题往往迎刃而解。

附:bitter lesson 的反面。 Sutton 的「苦涩的教训」劝我们别手工把结构焊进模型,让宽泛模型类 + 简单偏好去赢。B 却给出一个锋利的反例:在追求分布外真推理时,恰恰是「手工限制模型能看见什么」(隔离上下文)才逼出了正确的不变规则;放任模型看全,简单偏好会去抄更短的捷径。所以更精确的表述或许是——在 IID 准确率上,广度免费;在 OOD 推理上,约束观测范围才是通往正确的捷径。这条分界线,值得每一位做统一模型或推理系统的人贴在墙上。


一句话收束:MintAct 用「显式配比 + 异步背压」让一个模型在空间上统四域而不串戏;递归 LM 用「隔离上下文栈」让一个规则在推理上统任意子问题而不抄线索。二者殊途同归——真正的统一,是对「每个子任务该看什么」的精确立法。