• 论文链接:arXiv:2608.16590
  • 项目页:https://air-embodied-brain.github.io/zetta
  • 发表时间:2026 年 8 月 17 日(arXiv v1)
  • 机构:清华大学智能产业研究院(AIR),含 Z-Trans AI 访问学者;技术负责人 Xin Ding / Liang Mi,项目负责人 Ting Cao
  • 领域标签:具身智能、Agent Harness、自进化系统、机器人操作、推理基础设施

一、论文背景:具身智能的"第二条路"卡在了哪里

要读懂 Zetta,得先看清当前物理智能(Physical Intelligence)的两条主流路径。

第一条路:端到端策略模型的大规模训练。以视觉-语言-动作模型(VLA)和世界-动作模型(WAM)为代表,比如 π0.5、GR00T N1.5、OpenVLA,它们在 DROID、Open X-Embodiment 这类大规模机器人演示数据集上训练,希望"看得懂、想得对、动得出"一体化。这条路的问题是:具身数据天然稀缺,模型在有限数据分布上学到的能力,一旦遇到真实部署中变化万千的物理动态就非常脆弱——抓取打滑、轻微碰撞这类小扰动,往往会在长程任务中级联放大成彻底失败。从"演示"到"可靠执行"之间的鸿沟至今没有填平。

第二条路:用 LLM 作为具身智能体来编排。让大模型充当"指挥官",在冻结的策略模型之外,编排代码、工具、记忆、规划和恢复模块,目标是让系统从自主探索的经验中学习。Zetta 走的就是这条路,但论文开宗明义地指出了这条路的致命伤——现有的具身 agent harness 几乎全是开环的:执行一旦开始,agent 并不持续根据演变的机器人-环境状态来调整决策,而是执行固定技能或预先规划的轨迹,等整个 episode 结束了才做一次反思。

开环为什么不行?论文给出了一个非常硬的物理约束:物理交互要求决策以毫秒级的延迟预算跟上快速变化的机器人-环境状态,而今天的大模型 agent 根本做不到这个决策频率。LLM 推理一次要几秒,机器人手臂碰倒杯子只要几百毫秒——你不可能在手臂失控的瞬间等 GPT 想明白该怎么办。

于是"事后反思"(post-hoc reflection)成了无奈的折中,但论文剖析了它三个内生缺陷:

  1. 无法在线验证:agent 不能在执行中测试替代动作来验证反思是否正确——episode 都结束了,你没法"重播那个瞬间试试另一种打法";
  2. 信用分配难:一条几百步的轨迹最后失败了,到底哪一步是罪魁祸首?对整条轨迹做归因非常困难;
  3. 缺乏失败瞬间的状态:回溯分析时,agent 往往已经拿不到失败那一刻的精确状态,事后总结的经验难以复用。

一句话概括开环 harness 的根本矛盾:物理交互的毫秒级频率 vs LLM 推理的秒级延迟;episode 后反思治不了执行中的错误。

给不熟悉这个领域的读者打个比方。想象一个学开车的新手(VLA 策略)旁边坐着教练(agent harness):

  • 开环 harness 像一个只会"考后复盘"的教练:你开完全程了他才说"刚才第三个弯你方向盘打早了"。可事故已经发生了,而且他说的对不对你也没法当场验证。
  • Zetta 的 Runtime Critic 像一个随行安全员,能实时喊停:他不懂怎么开车(不接管方向盘、不改你的驾驶习惯),但他时刻盯着速度表和后视镜,发现你要追尾了立刻帮你踩一脚刹车、把车带回正道,然后把方向盘还给你继续开。
  • Zetta 的三循环 则像一支配备完整的团队:操作层(随行安全员,毫秒级监控)负责这一趟不出事;改进层(每次收车后分析行车记录,找出事故根因并改进)负责下一趟更稳;验收层(新驾驶技巧必须在陌生路线上验证有效才能写进教学手册)负责改进不会"越改越歪"。

Zetta 的核心思想由此浮出水面:既然大模型追不上物理频率,那就用轻量的、代码级的 critic 去追——代码可以跑得比策略推理还快;而慢速的大模型 agent 退到离线侧,专门负责从失败数据中进化这些 critic 和恢复技能。基座 VLA 全程冻结,进化的只是 harness 本身。

二、论文定位和关联工作:在知识版图上找到 Zetta

把 Zetta 放进相关工作版图,能更清楚地看到它的独特性。

VLA / WAM 基础模型路线:RT-1、RT-2、OpenVLA、π0、π0.5、GR00T N1.5、CogACT、UniVLA、FAST 等 VLA,以及 DreamZero、Cosmos-Policy、FAST-WAM 等世界-动作模型。这条线依赖大规模演示数据(DROID、Open X-Embodiment),瓶颈在于数据昂贵、分布漂移、长程任务中小错级联。Zetta 不改这条线上的任何权重,而是给它们"外挂"一个可进化的治理层。

LLM-in-the-loop 具身 agent 路线:从 PaLM-E、Code as Policies 到 RoboCat,再到近期的 HarnessVLA、RPent、Claude Plays Robotics、CaP-X、Guava 等。这些系统证明了 LLM 编排能让冻结的策略更可靠,但论文批评它们大多是"episodic"的——也许能在单次尝试内恢复,但很少把执行轨迹转化为受治理的长期改进。RPent 是典型:agent 在每个决策点都调用 LLM API,语义能力强但延迟极高(单 episode 392-513 秒)。

harness 自进化路线:数字域的自进化 agent(Reflexion、Self-Refine、Voyager、OPRO)证明了语言/游戏 agent 可以通过言语反馈、可执行技能库、程序搜索来进化;具身域的 SkillOpt、EmbodiSkill 探索了从失败中提炼可复用技能、在代码空间做类 SGD 优化。Zetta 直接借鉴了 SkillOpt 和 EmbodiSkill 的代码空间优化思想,但补上了它们缺失的关键一环——动作频率的在线治理(runtime critic)。

真实机器人策略自改进路线:ENPIRE、Visual Verification/VERITAS、Learning While Deploying、SOP 把部署组织成"执行-验证-数据选择-策略更新"的闭环,但它们通常改进的是策略权重或数据;技能中心的 ASPIRE、ReSYNC、VASO、EmbodiSkill 强调发现可复用程序与技能。论文指出这些系统通常只改进技术栈的一层,很少同时解决高频 runtime critic、可恢复的失败轨迹、可复用恢复技能和高吞吐 rollout 执行——这正是 Zetta 的组合式目标。

rollout 基建路线:A3C、IMPALA、SEED RL、RLlib/Ray、Acme、RLinf 等成熟 RL 系统确立了 actor-learner 分离、集中推理等思想,但它们面向标准 RL 工作负载。具身自进化需要的是异构模型(VLA + 感知模型 + 工具)、异构资源(CPU 仿真 + GPU 推理)、动态执行(agent 每步动态决定调用什么)的混合负载。Z-Infra 论文自称是第一个专为自进化具身 agent 设计的 rollout 基础设施。它与 vLLM/SGLang 等 LLM serving 系统共享"持续批处理"思想,但服务对象从同构 LLM 请求扩展到异构的 VLA/感知/工具调用。

三类 harness 的对比如下:

维度开环 harnessLLM-in-the-loop(如 RPent)Zetta 闭环 harness
在线决策频率无(执行固定技能)每个决策点调 LLM API代码级 critic 以高于策略的频率运行
执行中纠错不能理论上能,但延迟跟不上物理频率能:证据触发干预,Orchestrator 裁决
反思时机episode 结束后每步都在"反思"(调 LLM)离线批次级:EOD 聚类 + 因果诊断
延迟低极高(392-513 s/episode)较 RPent 降 91%(11.1× 加速)
经验沉淀难以复用依赖 LLM 记忆验证门控的 SKILL 包(可版本化)
基座策略冻结冻结冻结(π 与 A_orch 都不动)

Zetta 的定位可以总结为一句话:在"端到端 scaling"与"LLM 编排"两条路之间,它选择了第二条路,但用"代码级高频 critic + 离线进化"的组合,第一次把这条真正做成了闭环。

三、问题定义:进化 harness,而不是进化模型

3.1 形式化定义

论文把长程机器人操作任务形式化为一个权限受限的治理与进化过程(authority-constrained governance and evolution process),优化目标是:

$$\max_H J(H) = \mathbb{E}_{g, s_0 \sim D}[\text{Success}(\tau) \mid \pi, A_{orch}, H]$$

约束条件:动作策略 π(VLA/WAM)与 Orchestrator Agent A_orch 全程冻结,唯一可优化的对象是 harness:

$$H = \{C, R, T\}$$
  • C(Runtime Critic,运行时批评者):一组高频监控函数,持续扫描轨迹 τ_{0:t},输出结构化提案 P_t = ⟨e_t, σ̂_t⟩——e_t 是可审计的失败证据(碰撞、进度停滞等),σ̂_t 是建议的执行模式。注意 critic 只有"提议权"没有"执行权"。
  • R(Recovery Playbook,恢复手册):一个结构化策略库,把特定的因果失败机制映射到可执行的恢复动作。
  • T(Heterogeneous Toolset,异构工具集):可执行工具与算子的集合(规划器、抓取检测器、恢复模块等),可以在进化中被生成、实例化、选择、精炼。

3.2 双智能体治理

Zetta 的架构是一个"在线-离线"分工:

  • 在线 Orchestrator Agent(裁决者):固定的多模态推理算子,像高级指挥官一样审计实时证据、批准模式切换。执行中最终运行模式 σ_t(σ_t=0 表示 VLA/WAM 执行,σ_t>0 表示专用工具接管)由裁决函数 σ_t = A_orch(P_t, R, T, K) 决定,K 是任务知识上下文(里程碑、成功判据、环境约束)。这个协议强制"证据驱动":critic 跑得再快,只有证据 e_t 被 A_orch 验证接受后,干预才被允许。
  • 离线 Evolutionary Agents(进化者 A_evo):进化的驱动力,迭代地从失败 rollout 数据中改进 harness:H^(k+1) ← A_evo(D_fail^(k), H^(k))。它由三个 agent 组成流水线:诊断 Agent(A_diag)、修复 Agent(A_repr)、泛化 Agent(A_gen)。

3.3 抽象本质

剥离所有机制细节,Zetta 解决的问题可以压缩成一句话:

在动作频率的硬约束下,如何让不可微的代码空间技能库,持续地从物理失败经验中进化。

这里面有三个关键词。“动作频率约束”——治理必须比策略更快或至少同频,这排除了 LLM 在线介入;“不可微”——技能是代码而非神经网络权重,没有梯度可走,所以必须借道 SkillOpt/EmbodiSkill 式的"类 SGD 代码空间优化";“持续”——不是一次性调试,而是随 rollout 经验增加不断上升的 scaling 曲线。

四、问题解法:三时间尺度循环 + 一套推理基建

Zetta 的解法由两大部分组成:Zetta 框架本体(三个时间尺度分离的循环)和 Z-Infra(支撑进化循环的 rollout 基础设施)。

4.1 Loop 1:Critic-Governed Action Loop(动作频率治理循环)

类比:随行安全员实时喊停。他不开车、不评头论足你的驾驶风格,只在"要出事"的瞬间踩刹车。

输入/输出:输入是冻结策略 π 执行产生的轨迹 τ_{0:t}(状态、动作、里程碑完成状态 μ_t、碰撞强度与接触力等物理辅助信号 φ_t);输出是结构化提案 P_t = ⟨e_t, σ̂_t⟩,交由 Orchestrator 裁决。

机制:代码级 critic 以高于动作策略推理频率的速度持续运行(论文设计原则原文:“Operating above the action policy’s inference rate”),在执行状态偏离名义分布的最早迹象处触发干预。这一设计直接回应 Challenge 1——冻结的 VLA/WAM 本质上是开环前馈策略:它们语义理解强,但缺乏闭环的感觉-运动纠错,物体打滑、轻微碰撞这类扰动无法实时修正,小扰动级联成全盘失败。高频 critic 恰好补上这个闭环,把开环前馈系统变成闭环治理系统。

Loop 1 还承担"数据采集"职能(论文中 Phase I 与 Loop 1 关联):在开发种子集 D_dev 上大规模采样纯 VLA 执行,建立无治理干预的基线。为保证实证严谨,它强制两项确定性协议:

  • 确定性路由:所有 rollout 由中央资源调度器按节点负载与内存阈值分派,同批 rollout 运行在完全相同的软件容器、仿真器版本与硬件配置上,消除环境异质性带来的观测噪声;
  • 有效性与隔离:显式区分"基础设施失败"与"策略失败"(Valid 函数),只有带完整传感器与视频证据轨迹的 rollout 才进入有效集;基础设施无效的尝试(网络波动、仿真器崩溃)用原逻辑种子强制重跑,保证统计分布不漂移。

采集后的语料被加工成两个库:成功参考索引 I_succ(按里程碑聚合成功轨迹的状态,刻画任务成功的"名义分布")和失败种子清单 M_fail + 首个缺失里程碑 m*(有序里程碑序列 M 中第一个未被观测到的元素,用于粗粒度定位失败发生的任务阶段,并收窄后续诊断的搜索空间)。

4.2 Loop 2:Rollout-Batch Candidate Optimization Loop(批次级候选优化循环)

类比:车队赛后分析会。每一批 rollout 结束后,把事故录像逐帧回看,先归类"这类事故都是同一种毛病",再请专家会诊找到病根,最后给车做最小限度的改装。

这个循环对应论文的 Phase I(失败画像)与 Phase II(诊断与修复),由 A_diag 和 A_repr 两个 agent 领衔。

机制一:EOD 失败聚类与 medoid 种子选择。A_diag 不按最终结局做表面分类,而是基于最早可观测分歧(Earliest Observable Divergence)聚类:t_EOD 定义为轨迹状态分布首次偏离 I_succ 描述的"健康"分布超过阈值 ε 的时间步。用 t_EOD 及其上下文(首个缺失里程碑 m*、机器人-物体相对位姿、活跃工具 ID)把 M_fail 划分为互斥的失败簇 K = {K_1,…,K_n}。每簇选一个最接近簇中心的 medoid 种子作为深度诊断的主对象,降低计算开销并提取机制不变量。诊断时还遵守单视角落地观测协议:先指定最能看清末端执行器、目标物体与关键接触界面的主视角,全部视觉推理锚定于此;主视角证据不足时强制回退到仿真器内部状态与物理信号做跨模态验证,杜绝多视角幻觉。

机制二:六层自顶向下因果诊断。对 medoid 种子,A_diag 在六层诊断空间 L = {L_eval, L_crit, L_state, L_plan, L_recv, L_param} 中按优先级自顶向下检查,定位根因所在的最高优先层 L*:

  1. Evaluation 层(L_eval):成功判据或里程碑进度逻辑本身有错?
  2. Critic 层(L_crit):runtime critic 存在漏报/误报?
  3. State 层(L_state):物体位姿或接触信息偏离物理真值?
  4. Planning/Control 层(L_plan):状态正确,但 VLA 策略或工具没能处理物理约束?
  5. Recovery 层(L_recv):失败发生在恢复过程中——恢复手册逻辑有缺陷?
  6. Parameter 层(L_param):具体的控制增益或动作阈值不对?

诊断遵循最小干预原则:“if high-level logic resolves the failure, never modify low-level parameters”——高层逻辑能修好,就绝不动低层参数。这一原则直指 Challenge 2(过参数化修复的泛化陷阱):针对单个失败实例调低层控制参数强行成功,虽然眼前修好了,却会破坏 VLA 语义泛化所依赖的动作分布,在未见过的 held-out 种子上造成严重退化。诊断完成后还要验证机制在整个簇内的一致性,输出包含定位层、因果证据链与组件功能需求的"修复候选规格"。

机制三:修复与 VLA 重入契约。A_repr 实现最小 harness 补丁 H_patch = {C*, R*, T*}:为特定失败前兆条件开发/精炼高频监控函数(Critic Enhancement),起草恢复手册并适配或合成工具(Recovery Drafting + Tool Adaptation)。所有恢复逻辑都被强制嵌入 VLA 重入契约(VLA Re-entry Contract),定义谓词:

$$\Psi(s_t) = \mathbb{1}(\text{FailureCleared}) \wedge \mathbb{1}(\text{Stability}(s_t) > \gamma)$$

即只有当原始失败证据 e_t 被显式清除、且物理状态达到平衡(接触力矩振荡与抓取力低于阈值 γ)时,控制权才允许交还给基座 VLA。这个契约是防止"恢复过程中瞬态动力学引发二次失败"的安全护栏。修复后还要过两步闭环验证:先做诊断回放确认增强后的 critic 能正确识别 t_EOD,再从初始状态完整跑一次闭环 rollout,达到目标里程碑且所有干预都被 A_orch 依契约裁决,补丁才算通过。

4.3 Loop 3:Validation-Gated Skill Update Loop(验证门控技能更新循环)

类比:验收层。改装方案不能只看"这一趟好了",必须通过全科目回归测试 + 陌生路线路考,才能写进车队标准手册并下发所有车辆。

机制:泛化 Agent A_gen 把验证过的种子专属补丁抽象为机制级不变量,合并成版本化的 H_merged = {C_merged, R_merged, T_merged}:Critic Unification(对触发条件做逻辑 OR、动态调整噪声阈值)、Recovery Integration(把动作序列泛化到同一失败模式的形态学变体,标准化重入契约 Ψ)、Toolset Expansion(既含调优后的算子也含新合成工具,比如高精度阻抗控制脚本)。合并后的 harness 外化成一个自包含的技能包,目录结构是:SKILL.md(声明治理逻辑:里程碑 M、Orchestrator 裁决规则、泛化后的重入谓词 Ψ)+ tools/(进化后的 critic 与工具的可执行实现)+ plans/(泛化恢复手册,把证据映射到结构化干预策略)+ params/(数值边界与阈值配置)。

晋升要过双重评测这道门:

  • 历史回归:对来源失败簇 K_i 的全部失败 rollout 要求 100% 成功——∀seed_j ∈ K_i, Success(seed_j | H_merged) = 1;
  • Held-out 评估:在严格隔离的 D_held-out 上量化相对冻结 VLA 基线的成功率增量 ΔSR。

还有一个动态迁移协议:如果 held-out 评估暴露出需要修改 H_merged 的新失败机制,该 held-out 种子会被重分类为开发种子(D_dev ← D_dev ∪ {seed_failed}),并必须换一批从未见过的新种子重新验证,迭代才能关闭。这条"数据隔离"纪律保证了 held-out 集永远不会被进化过程"污染"。

4.4 三循环的 Phase 视角

论文用 Phase I/II/III 描述同一进化周期的三个阶段,与三循环的对应关系是:Phase I = 失败画像与基线建立(Loop 1 采集,产出 I_succ / M_fail / m*);Phase II = 诊断与修复(Loop 2 的两段:Stage 1 失败聚类 + 因果诊断,Stage 2 critic 引导的修复与验证);Phase III = 整合、打包与泛化(Loop 3 的技能晋升与打包)。三个 Phase 由三个 Evolutionary Agents 分别主导:A_diag → A_repr → A_gen。

4.5 Z-Infra:让"环境吞吐"不再是进化限速器

为什么需要专门的基建?论文有个一针见血的判断:闭环学习让 rollout 吞吐成为智能 scaling 的限速器——环境是学习数据的源头,rollout 越快进化越快。而具身 agent 的 rollout 负载有两个特性,让现有系统吃不满硬件:

  • 资源异质性:一次 rollout 同时要 CPU(MuJoCo/robosuite 每会话仿真状态、微秒级基元计算)、GPU(VLA 自回归/扩散动作生成、渲染、轻量感知模型)——没有任何单一资源池或调度策略能通吃。
  • 执行动态性:agent 每步动态决定调用什么(这一步只要一次策略推理,下一步可能链式调用感知+规划+多个基元),会话不规则地创建/暂停/销毁,GPU 推理请求呈现批次大小与到达间隔方差巨大的突发模式——静态资源分配必然低效。

三层架构:

层角色关键机制
Control Plane唯一入口,统一 API全局会话注册表(会话↔Env Worker 绑定)、按请求类型/资源需求路由、心跳健康监测(Worker 超时→会话标 LOST→agent 在健康节点重建)
Env Worker 层分布式 actor,管理异构仿真环境会话生命周期(CREATE→RUNNING→TERMINATED)、四原语声明式接入(init/reset/step/obs_schema)、资源共享组(同一环境结构的一次编译多槽复用:ModelTemplate 只读共享 + 每槽独立 mjData)、C++ 控制器关键路径释放 GIL 实现多槽并行
Rollout Worker 层GPU 常驻 actor,模型 serving按模型/模态/张量形状划分兼容组的动态批调度器(FCFS + work-stealing)、路由令牌异步请求-响应、模型切分(VLM 与 Action Expert 拆成独立进程,CUDA IPC 传中间激活——对 π0.5 平均推理延迟降 53%、200ms SLO 下 goodput 提升到 2.4×)、细粒度量化(对 prefix MLP 模块 W8A8、其余 BF16,1.18-1.32× 加速且 LIBERO 成功率不降)

编程模型围绕三个抽象展开:session(长生命周期环境实例)/ episode(reset 到终止)/ step(单步动作),所有 API 原语跨会话透明批处理。agent 侧代码极简:create_sessions → reset → 循环 policy_step → close,批处理、异步推理、资源管理全部透明。整个系统基于 Ray 构建,用五条有界 Ray Channel 划分控制流与数据流,placement 策略把每个 worker 绑定到专属 GPU/CPU(如 "0-7" 供给 8 个 rank,各载一份模型做数据并行推理)。

关键设计思想是资源解耦:agent 只声明"执行什么"(哪个模型、哪个环境、哪个操作),不关心"在哪执行、怎么执行"。这让同一个 agent 无需改代码就能跨机器、跨加速器、跨模型、跨环境扩展,也让 agent 开发者专注任务逻辑、基建工程师专注调度批处理,两层独立优化。

五、评估指标与实验证据

5.1 实验设定

两个基准,两种泛化考察方式:

  • RoboCasa(随机分布泛化):每个任务随机采样 50 个开发种子用于进化,每轮收集失败轨迹聚类、对最大失败簇的 medoid 种子做诊断修复开发;进化完成后在严格隔离的另外 50 个种子上报告最终成功率。基座策略为 GR00T N1.5(冻结),覆盖 18 个 Atomic-Seen 任务(Appendix A 给出 T1-T18 与官方任务名的映射)。
  • LIBERO-Pro(开发-测试泛化):每任务随机采样 50 个开发种子(父代种子,排除 seeds 1-20),迭代修复直到开发种子成功率 ≥ 50%;最终评估只在严格隔离的 seeds 1-20 上进行。基座策略为 π0.5(冻结)。LIBERO-Pro 有两种扰动设定:T(任务/指令重定向)与 S(交换/位置交换),评测 Goal 与 LIBERO-10(长程)两套件。

硬件:8×RTX 4090 集群。所有实验中基座 VLA 权重零微调。

为什么 held-out 严格隔离协议能证明泛化而非过拟合?关键在三点:测试种子从未被 Evolutionary Agent 在整个进化/开发过程中见过;历史回归要求 100% 修复来源簇,这只能保证"记住旧错",held-out 增量 ΔSR 才检验"举一反三";动态迁移协议确保一旦 held-out 种子暴露新失败被用于修改 harness,它就立即移出 held-out 集合并换新种子重验——held-out 集对进化过程永远是"一次性陌生考卷"。叠加 RoboCasa 的随机分布采样(对抗长尾分布),这套协议从制度上排除了"对测试集调参"的可能。

5.2 主结果:成功率

LIBERO-Pro(40 个任务-设定对):

设定π0.5 基线Zetta提升
Goal (T)31.0%92.5%+61.5 pp
Goal (S)38.0%89.0%+51.0 pp
LIBERO-10 (T)50.0%63.0%+13.0 pp
LIBERO-10 (S)9.0%40.0%+31.0 pp
整体宏平均32.00%71.13%+39.13 pp

40 个任务-设定对中 32 个被提升、8 个持平,没有任何一个低于基线。

RoboCasa(18 任务):宏平均从 73.56% 提升到 93.56%(+20.00 pp),四轮全局修复的轨迹是 73.56% → 78.71% → 84.85% → 90.54% → 93.56%,每个检查点保留此前已验证的 critic/recovery/工具能力。提升在所有任务上一致,在接触密集与长程任务上尤其大(如 T4 从 58→96、T5 从 48→86、T15 从 50→90)。

论文特别强调:这是在当前 rollout 预算下的结果,成功率随进化轮次持续上升且尚未饱和,更多 rollout 经验预期带来更多增益——这正是"harness 自进化是物理智能 scaling 路径"论断的实验支撑。

5.3 Aha 时刻:从症状修复到根因修复的跳变

论文最迷人的观察是机器人"Aha 时刻":在单个失败簇的进化内部追踪 v0/v1/v2 检查点(v0 = 纯 VLA 基线,v1/v2 = Evolutionary Agent 离线诊断修复的中间版本,不涉及额外 VLA 训练),早期修订只修局部症状或过拟合个别失败,成功率停滞;一旦 agent 找到决定性的物理瓶颈(恢复 VLA 回到其能力域所需的关键状态变量),成功率不连续跳升。

  • Goal-T2(酒瓶入碗):v1 加了 pre-grasp staging 改善接近几何,但 10%→15% 停滞——没解决运输中的物体丢失。v2 识别出抓取保持是决定性瓶颈,实现"运输前验证稳定性的 retained-object critic"后跳到 95%。
  • Goal-T8(酒瓶上盘):v1 仅 5%→10%;v2 监控完整"接触-抓取-保持"链、确保运输前稳定保持,跳到 60%。
  • Goal-S6(奶油奶酪放碗):v1 的释放门只修了晚期症状,停滞在 5%;v2 转向接触前阶段——瓶颈是接近过程缺乏语义推进,实现校准的语义 pick-and-place 恢复后,同时解决接近/抓取/运输失败,跳到 90%。
  • RoboCasa:TurnOnElectricKettle 88%→94%(Aha = 认识到简单的 EEF 重对齐就能恢复 VLA 期望的几何)、SlideDishwasherRack 76%→94%(关键 = 接触丢失后重建居中接触)、CloseToasterOvenDoor 82%→96%。

论文的提炼值得加粗:物理智能的可扩展单元,是识别那些必须被恢复、才能让冻结 VLA 可靠执行的状态变量(抓取稳定性、接近几何等)——而不是任务专属的轨迹修补。

5.4 零样本迁移

LIBERO-Pro Goal-T8(放酒瓶)为源任务:三轮进化发现的三项能力(pre-grasp staging、grasp-retention Critic、failure-gated retry)零样本应用到 Goal-T2、Goal-T6、Goal-S3,其中 Goal-S3 从 9/20 → 20/20。迁移之所以成功,是因为这些机制作用于任务无关的物理变量(EEF 对齐、接触稳定),而非记忆源任务的轨迹。Goal-S5 为源的补充实验中,基于 EEF-物体邻近度的 contact-qualified takeover 与 stalled-command carry gate 迁移到 Goal-S3/S4/S9,同样修复了共享的抓取/接触/运输失败。

RoboCasa PnP-Stove 为源:三轮进化产出 pregrasp 对齐、抓取丢失后的 regrasp、稳定放置三项技能,不做任何目标任务优化,直接用于 PnP-Sink(58%→82%)、PnP-Cabinet(62%→80%)、PnP-Toaster(72%→90%),三个迁移任务宏平均 64%→84%(+20 pp)。TurnOffStove 为源的目标定位、避碰接近、稳定接触技能,零样本迁移到 TurnOnSinkFaucet、OpenCabinet、TurnOnMicrowave,宏平均 64%→80%(+16 pp)。

附录 C 解释了迁移的机理:PnP-Stove 技能的 critic 与 recovery 全部由物体相对几何与通用物理谓词定义(官方抓取谓词、双侧指接触、物体-夹爪漂移、运输进度、放置、释放后分离),不是炉灶专属的图像模板或源轨迹回放——相关任务只需重新绑定活的对象与目标容器即可复用同一套逻辑。

5.5 Z-Infra 性能:吞吐与延迟

在 LIBERO Goal 上以并发 1/8/16/32/64 评测(8×A100,相同 checkpoint 与动作预算):

指标Z-Infra无 Z-InfraRPent
并发 16 吞吐22.09 ep/min2.88 ep/min(7.7× 差距)1.72 ep/min(12.8× 差距)
并发 8→32→64 延迟39s→57s(+46%)→95s34s→112s(并发 16 即 3.3× 爆炸)392s→513s
吞吐上限35.1 ep/min @ 并发 64(8 GPU 饱和)并发 >16 OOM并发 >16 OOM

吞吐从 1.7 提升到 35.1 ep/min 是 20.6× 改善;相对 RPent 的 per-episode 延迟降低 11.9×,对应论文标题级数字:推理延迟较 RPent 降 91%(11.1× 加速)。延迟优势的机制根源在 4.6 节展开。

5.6 案例研究:单回合多重干预与失败前沿推进

RoboCasa PnP 单回合案例展示了 harness 在一个 episode 内的组合式干预:VLA 完成抓取并开始运输 → 物体从夹爪滑落,runtime critic 检测到抓取丢失并中断名义轨迹 → 恢复模块执行受控 re-approach 建立新抓取,控制权交还 VLA → 第二次干预:初始 re-grasp 姿态不可行,critic 报告无效接近几何,recovery 调用 GraspGen 合成可行末端姿态 → 第三次干预:接近目标时 critic 检测到近目标放置风险,交给基于 CAP 的稳定放置恢复完成收尾,验证重入条件后终止。一条轨迹、三种不同物理失败模式、三次针对性干预、每次修复后都验证状态再交还 VLA。

LIBERO-Pro Goal-S5(推盘子到炉灶前)案例展示了跨进化轮次的"失败前沿推进":Round 0 父代 VLA 无及时恢复交接、耗尽 episode 预算;Round 1 引入 retention-gated handoff,解决了"无干预"但暴露"抓取无法验证";Round 2 加 closing-contact critic 与 contact-gated grasp recovery,成功获取盘子后又暴露运输中的保持丢失;Round 3 加 bounded re-grasp retry,检测到运输丢盘后有界重抓、验证恢复保持、继续运输,直到官方 LIBERO 关系判定为真。每一轮晋升都把"最早的未解决失败"推后一个阶段——从恢复调用、到抓取验证、到运输保持。而且 Round 2 与 Round 3 用相同环境种子与策略 RNG,直接隔离了 carry-retry 机制的贡献。

两个案例合起来呈现互补的组合性:RoboCasa 是单 episode 内多个专项恢复的在线组合,LIBERO-Pro 是外循环轮次间晋升技能的组合,共同点是"定位最早未解决失败 → 有界修复 → 验证修复状态 → 放行推进"。

六、效果优势的根源解释:为什么这套设计必然有效

Zetta 的数字很漂亮,但更重要的是理解机制层面的因果链——为什么这些设计选择导致了这些结果。

第一环:冻结 VLA 是开环前馈,小扰动级联失败。VLA/WAM 在推理时是前馈的:语义理解强,但没有闭环感觉-运动感知去实时纠正物体打滑、轻微碰撞。LIBERO-Pro 上 π0.5 整体只有 32% 正说明这一点——不是模型"不懂任务",而是执行中的小偏差无人照看、级联成全盘失败。

第二环:代码级高频 critic + 证据触发干预 = 把开环变闭环。critic 以高于策略推理的频率运行,在偏离名义分布的最早迹象触发干预,且只有可审计证据被 Orchestrator 验证才放行。这一环解释了 Loop 1 的价值:RoboCasa 单回合案例中三次失败都被即时捕获并修复,这在开环 harness 里根本不可能。关键在于频率匹配:治理的速度必须跟得上物理,而代码恰好可以做到 LLM 做不到的毫秒级。

第三环:失败聚类 + 六层根因定位 = 最小干预保泛化。EOD 聚类找的是"最早分歧点"而不是"最终结局",这把诊断注意力锚定在真正的因果起点;自顶向下六层诊断强制"高层能修不动低层",避免了过参数化修复破坏 VLA 语义泛化所依赖的动作分布。Challenge 2 描述的"修好一个、毁掉一片"的过拟合陷阱被结构性规避——这解释了为什么 Zetta 在 held-out 种子上也涨分(RoboCasa 隔离测试集 +20pp、LIBERO-Pro 隔离 seeds 1-20 上 +39.13pp),而不是只涨开发集。

第四环:验证门控只让跨种子泛化的技能入库 = 防过拟合的制度保障。历史回归 100% 保证不忘记旧错,held-out 增量保证举一反三,动态迁移协议保证隔离纪律。三层防线使得技能库单调进化、很少倒退——这解释了 32/40 提升且 0 退化的 LIBERO-Pro 结果,以及四轮全局修复严格递增的 RoboCasa 曲线(73.56→78.71→84.85→90.54→93.56)。

第五环:四个环咬合,成功率随进化轮次持续上升且 held-out 同步上升——这正是"harness 是可 scaling 对象"的完整证据链。

对比 RPent:11.1× 加速的机制根源。RPent 是 agent-in-the-loop 设计,每个决策点都要调 LLM API,单 episode 延迟 392-513 秒——这个量级的延迟在物理世界面前毫无意义,它根本达不了物理频率。Zetta 的架构分工是:在线 rollout 只跑纯 VLA 策略 + 轻量 runtime critic,agent(LLM)只在离线 Reflection & Evolve 阶段被调用。快慢分离,各得其所——高频的归代码,深思的归 LLM。这就是延迟降低 91% 的机制根源,也回答了"为什么不用 LLM 直接做闭环"的疑问:不是 LLM 不够聪明,是物理不等它。

Z-Infra 的 20.6× 吞吐提升为什么重要:因为"环境是学习数据的源头",吞吐直接决定单位时间能发现、诊断、重放、转化多少失败。7.7×/12.8× 于并发 16 的吞吐优势来自常驻 worker + 动态批处理 + 异步调度消除了 per-episode 初始化开销、在突发请求模式下维持高 GPU 利用率。没有 Z-Infra,三循环转不动那么快;三循环转得越快,越需要 Z-Infra——系统与算法在这里互为因果。

七、必要知识反推:读懂这篇论文需要哪些前置知识

按"领域 → 方法论 → 工程"三层反推这篇论文的知识依赖,读者可以按需补课。

领域层:

  • 机器人操作基础:pick-and-place、抓取(grasp)、运输(transport/carry)、放置(placement)这类原子操作的语义;关节型操作臂、夹爪(gripper)、末端执行器(EEF)的术语体系。论文的 critic 监控项(双侧指接触、物体-夹爪漂移、抓取保持)全都建立在这套词汇上。
  • VLA 架构:视觉-语言-动作模型的基本结构——VLM 编码器把观测与指令编码为潜在表示,Action Expert(扩散或自回归)解码出动作序列。理解了这个两段式结构,才能理解 Z-Infra 为什么能按 VLM/AE 切分部署。
  • 里程碑任务结构:长程任务被拆成有序语义里程碑序列 M = ⟨m_1,…,m_goal⟩,“首个缺失里程碑 m*“的失败定位方法依赖这一结构。LIBERO 的"官方任务谓词”(official task predicate)判定成功也属此列。

方法论层:

  • co-training / 冻结基座思想:Zetta “冻结 π 与 A_orch、只进化 H” 的设定,与 LLM 时代"冻结基座、进化外围"的一般思路同源。
  • SkillOpt / EmbodiSkill 的代码空间优化:技能和代码没有梯度,如何做"类 SGD"的有界稳定更新——把离散代码修改组织成小步、可验证、可回滚的迭代。Zetta 的 Loop 2/3 直接建立在这套方法论上。
  • EOD 失败定位:以"最早可观测分歧"而非最终结局定位失败,需要理解状态空间距离度量与"名义分布”(成功轨迹聚合)的对照思想。
  • 验证门控泛化协议:历史回归 + held-out 评估 + 动态迁移协议构成的防过拟合纪律,本质是机器学习评估方法论在自进化系统上的延伸。

工程层:

  • MuJoCo / robosuite 仿真栈:CPU 中心的物理仿真,每会话维护 mjModel/mjData 状态;Z-Infra 的资源共享组(ModelTemplate + fork)直接操作这些结构。
  • GPU serving 动态批处理:兼容组划分、FCFS、work-stealing、路由令牌——vLLM/SGLang 一脉的持续批处理思想在异构模型上的推广。
  • 会话抽象与分布式 actor:session/episode/step 三层抽象、Ray actor 与有界 channel 的控制流/数据流分离。

知识融合节点:这篇论文真正的核心洞察,是把所有这些知识熔接成一个新的认知——harness 不是固定脚手架,而是可进化的对象。此前的研究把 agent harness 当作工程配置(写好就不动),把"学习"等同于"改权重";Zetta 证明了存在第三个学习表面:代码空间的 critic/recovery/工具可以在部署时以验证门控的方式持续进化,且这个表面的 scaling 曲线尚未见顶。掌握了这个视角转换,具身智能之外的很多系统(下节展开)都能套用同样的分析框架。

八、通用性灵感:把 Zetta 的机制迁移到你的领域

最后提炼五条可以带走的通用思想,每条都附论文证据与推广场景。

灵感一:代码级高频 critic 治理慢速智能体

核心思想:当"决策智能体"(LLM、复杂模型)跟不上环境的物理频率时,不要强行让智能体加速,而是给它配一组代码级的、可进化的高速监控函数——智能体负责慢速的深度思考,代码 critic 负责高速的实时守护,两者通过"证据 + 裁决"协议衔接。

论文证据:Runtime Critic 以高于策略推理频率运行、证据经 Orchestrator 验证才触发干预(Loop 1);相对 RPent 每步调 LLM 的设计获得 11.1× 推理加速。

推广场景:(1) LLM agent 安全监控——用轻量规则引擎实时拦截 agent 的危险 API 调用,LLM 只处理规则触发后的仲裁;(2) 金融交易风控——微秒级流式规则检测异常交易,复杂模型离线进化这些规则;(3) 自动驾驶冗余系统——高速确定性安全监视器监督学习型规划器;(4) 工业生产线——实时 PLC 逻辑监控 AI 调度系统,异常时回退到安全模式;(5) 内容平台审核——低延迟过滤器先拦,大模型复核边界案例。

灵感二:最小干预层诊断原则

核心思想:复杂系统的故障诊断应按抽象层级自顶向下(评估→检测→状态→规划→恢复→参数),高层逻辑能修复就绝不动低层参数——因为低层参数的局部最优常常以全局泛化为代价。

论文证据:六层因果诊断的检查顺序与"never modify low-level parameters"原则;Challenge 2 对过参数化修复破坏 VLA 动作分布、导致 held-out 退化的分析。

推广场景:(1) 软件调试——先查需求理解与接口契约(高层),再查配置、最后才动底层代码与编译器开关,避免"哪里痛补哪里"的补丁腐烂;(2) 组织管理——流程/分工/激励等制度层能解决的问题,不要靠个人英雄式加班(参数层)硬扛;(3) 模型调优——先检查数据与评测协议(评估层),再查特征与结构,最后才精调超参;(4) 医疗诊疗——先排除生活方式与用药方案问题,再考虑手术干预;(5) 系统运维——按"监控指标→告警规则→数据采集→服务逻辑→内核参数"的顺序排障。

灵感三:验证门控的技能晋升机制

核心思想:任何自进化系统都需要一道"晋升门"——新技能/新策略必须同时通过**历史回归(修复全部已知失败、100% 不倒退)与held-out 增益(在从未见过的案例上真实有效)**才能进入生产库;被诊断过程"看过"的案例必须从测试集中移除并换新。

论文证据:Loop 3 的双重评测(∀seed ∈ K_i 成功率 = 1 且 ΔSR > 0 才晋升)与动态迁移协议(held-out 种子一旦参与修复即转为开发种子、换新种子重验)。

推广场景:(1) 代码库演进——CI 全绿(历史回归)+ 混沌工程新场景通过(held-out)才允许合并,防止"修一个 bug 引入三个";(2) prompt/agent 自优化——新 prompt 版本必须在旧任务集零退化且新任务集有提升才替换;(3) 检索增强知识库——新文档进入知识库前验证不破坏既有查询答案;(4) 个人学习——新方法论需在旧技能不退化且陌生领域见效后才纳入习惯;(5) 机器人 fleet 学习——某台机器人发现的技能经全 fleet 历史任务回归 + 新场景验证后下发。

灵感四:失败前沿推进视角

核心思想:把系统改进理解为"每一轮晋升把最早未解决的失败推后一个阶段"——修好当前瓶颈不会立刻成功,只会暴露下一个更靠后的瓶颈;持续改进就是持续推进这条前沿,直到任务终点。同时要预期"Aha 式"非线性:症状级修复带来停滞,根因级修复带来跳变。

论文证据:Goal-S5 案例中失败前沿从"恢复调用缺失"推进到"抓取验证"再到"运输保持";Aha 时刻分析中 v1 症状修复(10%→15% 停滞)与 v2 根因修复(跳到 95%)的对照。

推广场景:(1) 课程学习——自动定位学习者当前"最早卡点",攻克后自然暴露下一卡点;(2) 个人技能成长——先识别当前阶段的决定性瓶颈(如编程新手的"调试能力"而非"语法记忆"),突破它才有台阶式跃迁;(3) 系统性能优化——每轮消除当前最大瓶颈(profiling 前沿),瓶颈后移、性能阶梯上升;(4) 产品迭代——按用户流失漏斗逐段推进"最早失败点";(5) 科研攻坚——诊断从"实验设计→理论假设→测量手段→参数设置"逐层定位最早出错的环节。

灵感五:“环境吞吐是智能 scaling 限速器"的判断

核心思想:当学习依赖与环境交互产生的数据时,推理/rollout 基建的吞吐就是智能增长的真正限速器——算法再好,环境转不动也白搭;为环境交互基建投资的回报会直接转化为智能增长速度。

论文证据:论文原文判断"the environment is the source of learning data, so faster rollouts produce faster evolution”;Z-Infra 把吞吐从 1.7 提到 35.1 ep/min(20.6×),“directly accelerating the harness evolution loop”;且成功率曲线随 rollout 预算持续上升未见饱和。

推广场景:(1) RL 训练基建投资逻辑——仿真环境并行度、采样吞吐的工程投入应与模型规模投入同级看待;(2) LLM agent 沙箱基建——agent 自进化需要大量低成本代码执行环境,沙箱吞吐决定进化速度;(3) 推荐系统在线实验——实验流量吞吐决定策略探索学习速度;(4) 自动化科学发现——“实验机器人每天能跑多少实验"直接决定假设空间的搜索速度;(5) 自动驾驶数据闭环——路测车队规模与数据回传吞吐决定模型迭代节奏。

结语

Zetta 的贡献可以浓缩为三句话:它用"代码级高频 critic + 离线进化"的组合,第一次把具身 agent harness 从开环做成闭环;它用三时间尺度循环与验证门控,证明了冻结基座之上的 harness 本身就是一个可 scaling 的学习表面;它用 Z-Infra 说明,当智能的瓶颈转移到环境交互吞吐时,基建就是算法的一部分。在 VLA scaling 数据日益昂贵的当下,“不改权重、只进化外围治理结构"提供的这条 scaling 路径,其意义可能远不止机器人操作这一个领域。