论文 1 链接:Self-Evolving Coding Agents: From Digital Programs to Physical-World Intelligence 论文 1 机构:hexafuture.ai(独立 AI 研究机构;Hongcheng Gao 为项目负责人,Sihang Wu、Xiao He 为通讯作者) 论文 1 发表时间:2026年9月28日(arXiv:2609.35432v1)

论文 2 链接:RE-0: Verified Recursive Improvement of Embodied Code-as-Policy Agents through Local On-Policy Distillation 论文 2 机构:吉林大学(第一单位,通讯作者 Hongzhou Wang)+ 大连理工大学(纯高校合作,无企业参与) 论文 2 发表时间:2026年9月26日(arXiv:2609.32416v1)

领域标签:cs.RO(机器人)、具身智能、LLM Agent

这两篇论文一个出自独立研究机构,一个出自高校,相隔两天发布,却像同一枚硬币的两面:前者回答「物理世界的智能体应该以什么形态存在」,后者回答「这样的智能体应该如何从经验中变强」。放在一起精读,能看到「物理编码智能体」这个新兴方向的系统侧与训练侧全貌。


一、论文背景

要理解这两篇论文,需要先建立三层认知阶梯:什么是具身智能、什么是 Code-as-Policy、以及为什么「自进化」会成为这个领域的新焦点。

1.1 具身智能与 VLA:从「看图说话」到「看图动手」

具身智能(Embodied AI) 指的是让 AI 拥有物理身体(通常是机器人),通过感知(摄像头、深度传感器、关节编码器)与真实物理世界交互来完成任务。它和聊天机器人的本质区别在于:输出不再是文字,而是会真实改变世界的物理动作——抓错一个物体,任务就失败了,没有「重新生成」的机会。

当前具身智能的主流技术路线是 VLA(Vision-Language-Action,视觉-语言-动作模型):把一张(或多张)机器人视角的图像和一条自然语言指令(如「把可乐放进微波炉」)输入一个大模型,模型直接输出一段机器人动作序列(通常是一个「动作块」,即几十毫秒到几秒的连续控制信号)。代表工作包括 π0、GR00T、OpenVLA 等。可以把它理解为「看图说话」的机器动手版:图像进、动作出,中间全部由神经网络的隐式表征完成。

WAM(World-Action Model,世界-动作模型)是 VLA 的近亲,额外加了一个视频预测目标——让模型先想象「动作执行后世界会变成什么样」,再决定动作。

VLA 为什么好用又为什么脆弱? 好处是端到端、响应快、泛化基础感知能力。脆弱性则是论文 1 在第 2.1 节用一组实验直接戳穿的:他们把一个 QwenGR00T 策略(Qwen3-VL-4B 骨干)在 LIBERO 基准上训练时把指令完全遮住,结果成功率只从 96.2% 掉到 92.3%(500 次试验平均,三个子套件最大差距 6.0 个百分点)。这说明策略学到的主要是「场景到轨迹」的映射,而不是对指令的理解——当场景本身就决定了任务时,指令几乎不参与决策。更早的鲁棒性研究还发现,已发布的 VLA 在视角或初始状态轻微扰动下损失过半成功率,物体布局被扰动后成功率趋近于零。

1.2 Code-as-Policy:让大模型写代码来控制机器人

既然端到端动作预测有结构性缺陷,另一条路线是 Code-as-Policy(CaP,代码即策略):让会写代码的大语言模型直接生成一段 Python 程序来控制机器人。这段程序可以调用感知接口(如目标检测器返回的框和位姿)、控制原语(如 move_to、grasp),并用循环、条件分支、函数组合来表达任务逻辑。2023 年 Google 的原始 Code as Policies 论文(arXiv:2209.07753)证明:代码作为动作表征,比自然语言计划更具组合性和精确性——比如「把积木排成一条线并按颜色排序」这种带空间推理和精确数值的任务,纯语言计划很难表达,代码却可以。

但 CaP 有自己的软肋。 论文 1 引用了 CaP-X/CaP-Gym 系列(arXiv:2603.22435)的发现并总结出四条递进的缺陷:第一,程序输入是感知原语的输出(框、掩码、位姿),程序中没有任何节点检查这些输出——感知是被信任而非被验证的;第二,错误因此沿程序链复合,长程任务成功率近似各步成功率的连乘(开环成功率约等于每步概率 p1×p2×…×pn),中间一步的漂移要到结尾才暴露;第三,改进只能作用于「原语怎么组合」,原语本身的精度是天花板;第四,收益不持久——测试时的策略每次执行都要重新付费,学到的经验没有沉淀为可复用资产。

1.3 自进化:从「演示数据」到「经验闭环」

自进化(Self-Evolution)/ 递归自我改进(RSI) 指的是系统能用自己的执行经验持续改进自身,而不是依赖人类不断标注新数据。软件世界的编码代理(如 SWE-bench 上的 agent)已经给出了先例:任务本身是代码、状态是仓库、动作是编辑或工具调用、完成与否由独立的测试套件判定——通过测试的轨迹可以训练下一代模型,失败的轨迹定位到具体提交。观察、行动、反馈共享同一个可执行媒介,这是编码代理能通过迭代变强的根本原因。

物理世界默认不提供这一切:状态不是可读的文件,动作不返回成功与否的返回值,没有测试判定任务是否完成。两篇论文正是分别从这个缺口的两端进攻——论文 1 问「物理世界需要什么样的媒介和接口,经验才能像代码一样沉淀和回流」,论文 2 问「当经验以代码轨迹形式存在时,如何安全地把它蒸馏回模型权重」。这就是「二重奏」的由来:一个搭舞台,一个教演员。


二、论文定位和关联工作

2.1 Code-as-Policy 谱系:从 SayCan 到可进化程序

工作核心思想与两篇论文的关键区别
SayCan(2022)LLM 规划 + 环境可供性打分,输出技能序列只规划技能序列,不生成代码
Inner Monologue / ReAct(2022)把环境观察反馈给规划器,闭环重规划循环在程序之外:验证是模型对观察的阅读,恢复是重新提示
Code as Policies(2023)LLM 直接生成可执行 Python 策略代码感知被信任不验证;经验不持久化
Voyager(2023)存储成功程序为可复用技能库学到的存在模型外的记忆里,权重不变
CaP-X / CaP-Gym(2026)把 CaP 变成可基准化框架,发现 designer scaffolding 依赖证实移除人类设计的抽象层后成功率骤降
RoboScript / Memento 等(2025-2026)从视觉与执行轨迹修复代码策略,或进化高回报程序聚焦推理时规划与候选搜索,不解决「修正如何变成训练信用」

论文 1 的定位:把上述「只有策略侧是代码」的路线补全为「世界状态 + 策略 + 验证 + 反馈」全链路可执行表征,并让验证过的轨迹回流为训练数据(区别于 Zetta、SHAPER 等把学习成果存在冻结模型之外记忆中的 harness 工作)。论文 2 的定位:解决这个谱系遗留的训练问题——当执行中发现的修正要蒸馏回模型时,如何不把教师的错误也一起蒸进去。

2.2 VLA/Harness 路线:冻结模型、进化外围

另一条相关脉络是「具身 harness」:Thea 把机器人能力包装为可调用工具、Guava 用 LM 循环蒸馏出 4B 模型、Harness VLA 把冻结 VLA 包装为可重试接触原语、Zetta(arXiv:2608.16590,清华 AIR)运行三时间尺度闭环并在线进化 critic 与恢复技能、SHAPER 进化技能库与上下文代码 harness。这些系统都报告了对裸策略的大幅提升(Zetta 在 LIBERO-Pro 达 90.8%),但共同边界是:学到的东西存在模型之外(记忆、技能库、运行范围规则),负责推理的模型本身保持冻结,能力上限被检索和上下文所能承载的内容封顶。

论文 1 明确把自己与这条线区分开:HexaAnything 的 Harness 同时是数据采集仪器——通过独立验证器的轨迹成为 Physical Coding 数据,训练出的 HexaModel 成为下一版规划器。这回答了「harness 增益是否等于模型进步」的归因难题。

2.3 自进化 / 蒸馏谱系:RE-0 的理论坐标

论文 2 站在三个经典传统的交汇处:

谱系代表工作与 RE-0 的区别
交互式模仿DAgger(2011)、HG-DAggerDAgger 在学生访问的状态上查询专家,但默认专家在这些状态上可靠;RE-0 不做此假设,用反事实执行验证信用
在策略蒸馏GKD、DistiLLM在自回归模型上做学生分布蒸馏,但前缀接近学生占用度时教师目标本身不可靠,RE-0 用可靠性感知准入解决
自我修正Self-Refine、Reflexion、CRITIC重新生成整个答案或候选级选择;RE-0 定位最早有害边界、最小范围修补、同快照反事实验证

互补定位结论:论文 1 提供「物理世界经验如何被表示、验证、回流」的系统级管道,论文 2 提供「回流的经验如何被统计上安全地内化」的算法级机制。论文 1 的 HexaModel 训练(轨迹直接 SFT)尚无论文 2 式的信用验证;论文 2 的验证依赖仿真快照恢复,尚未接入论文 1 式的物理世界验证器。两者拼起来才是完整故事。


三、问题定义

两篇论文各自把具体场景抽象为一个本质问题,且两个问题恰好嵌套。

3.1 论文 1:物理世界缺的不是更强的动作模型,而是可检查的接口

具体场景:机器人长程任务(如把烤肉串和面包都放进烤箱再关门)频繁在中间环节失败且无法恢复。

核心洞察:诊断把问题从「模型能否预测更好的动作」转移到「系统是否维护一个可在执行全程被检查和修订的表征」。任务分解、完成判定、恢复决策这三件事在 VLA 中被隐式编码在动作块和停止信号里,接口中没有任何东西可以检查或修复它们。

形式化:将自进化定义为对系统中任意组件子集的更新——任务规范 z、环境 e、世界程序 W、策略程序 P、Harness H、模型状态 θ、验证器 ϕ、数据 D、记忆 M——使用先前执行经验产生的证据,且改进必须在独立评估协议下成立、保持来源可溯、可回滚。抽象的精妙之处在于把「进化什么」与「如何进化」解耦:任何候选更新都必须在冻结父版本、相同种子与预算下证明改进才被接纳,防止「更好的 harness」被误认为「更好的模型」。

3.2 论文 2:教师监督应被重构为「学生诱导历史上的局部反事实信用」

具体场景:一个 Code-as-Policy 学生代理在长程任务上失败,身边有一个更强但并非全局可靠的教师模型。

核心洞察:代码策略的错误是强历史依赖的——一段有害代码不仅让当前动作失败,还改变了环境状态、程序命名空间和后续全部可观察历史。所以改进的基本问题不是「该生成什么代码」,而是「沿着学生实际诱导的执行历史,纠正性信用应该分配在哪里」。教师的全局成功率不能决定它在某个局部失败边界上是否值得信任:一个独立完不成任务的教师,可能在学生到达的某个失败点上决策更好。

形式化:在学生第 k 代策略真正访问的历史 h 上,定义教师的局部信用为 Δk(h)——教师有界修正(修正后控制权立即归还学生)相对学生自身行为的期望优势。只接受 Δk(h) > 0 的历史作为监督来源。递归 πk → μk → πk+1 的每轮增益被定理 1 下界约束:J(πk+1) − J(πk) ≥ 验证干预增益 − 验证误差 − 投影误差项。

类比对齐(两篇论文的问题同构):

维度论文 1(Physical Coding)论文 2(RE-0)
信任的载体独立验证器的类型化裁决环境反事实执行的 LCB 门控
信任的对象世界谓词 / 轨迹是否被证据支持教师干预是否有正因果贡献
进化的单元版本化工件包(W, P, H, D, M, E)学生策略代际 πk → πk+1
不信任的对象模型自己的完成声明教师的全局声誉

3.3 互补性

论文 1 的验证器回答「执行结果是否真实」,论文 2 的 LCB 门回答「这次干预是否真的更好」。前者需要后者才能把轨迹安全蒸进权重(论文 1 的 HexaModel 目前直接 SFT,未做干预级信用核验);后者需要前者才能走出仿真(RE-0 的快照回滚依赖仿真器,物理世界需要类型化验证器替代)。


四、问题解法

4.1 论文 1:Physical Coding —— 双可执行表征 + 类型化验证器 + Harness

总体类比:给物理世界装上软件工程的全套基础设施——状态是数据库(Code as World)、流程是程序(Code as Policy)、验收是测试套件(Verifier)、迭代是版本控制(Artifact Bundle)。

组件一:Code as World(世界程序 W)——记录「什么是真的」。以可执行代码形式维护任务相关的物体、关系、观测、约束与进度谓词,例如 inside(kebab, oven) = False 或 reading(load=0.20kg) = 15.38。每个条目携带来源:哪个调用产生它、何时观察、在什么实验条件下测量。关键设计:世界程序由图像、深度、本体感受和工具输出增量更新(逐条目写入而非整体重生成),新观察与旧条目矛盾时是可见的;当条目不足以判定谓词时返回「证据不足」而非猜测。这与 VLM 文本回答有本质区别——VLM 在计数、相对深度、空间关系上的准确率接近随机(BLINK、Eyes Wide Shut 的发现),其文本答案无法作为状态证据。

组件二:Code as Policy(策略程序 P)——决定「接下来做什么」。以类型化节点(观察、动作、VLA 调用、判定、验证、恢复、分支、循环)组织规划、工具调用、执行、验证与恢复。类型化意味着提议的工作流可以在运行前被静态检查。VLA/WAM 在此只是一个可调用的动作工具,任务分解、完成判定、恢复的所有权在程序手中。

组件三:类型化验证器——裁决「成功是否为真」。返回五种裁决之一:PASS / FAIL / INSUFFICIENT_EVIDENCE / BLOCKED / SAFETY_STOP。模型声称完成不算成功,动作模型返回「finished」状态也不算证据;到达步数上限被记录为停止条件而非自动判定任务失败。验证器必须独立于提议动作的模型,否则它会确认自己的错误——这是自进化不退化为「自我确认故事」的机制保障。

组件四:七步自进化循环与四进化目标。每轮循环:固定协议 → 执行记录类型化轨迹 → 独立验证 → 诊断定位限制因素 → 提出有界编辑 → 回归测试与金丝雀评估 → 选择并提交(或回滚到父版本)。进化目标分为四类:Harness(工具、工作流、验证器、恢复)、数据与环境(轨迹、记忆、任务、课程)、模型与算法(权重、训练、架构)、具身与算力基底(传感器、硬件)。论文用证据阶梯 E0-E4 标注每个结果达到的层级(E0 能运行、E3 能训练出新检查点、E4 真机迁移),明确本次报告覆盖 Harness、工具进化与首次数据到模型更新。

组件五:HexaAnything 运行时契约。GoalContract 冻结任务文本与验收参考;ObservationEnvelope 区分 VLA 输出、工具输出、Harness 观察、官方评估证据四种来源;TrialOutcome 记录完成度、停止原因、评估者身份。失败是 fail-closed 的:未完成或模糊状态不会被静默提升为成功。

4.2 论文 2:RE-0 —— locate-verify-weight 递归 + LCB 准入

总体类比:把「请老师傅带徒弟」改造成「师傅只在徒弟摔跤的地方搭把手,且每次搭把手都要先证明这把手真的有用」。

第一步 Locate(定位):学生诊断代理分析失败轨迹,输出最早的候选有害边界及结构化证据(运行时异常、预期效果未实现等),执行系统在该边界保存完整仿真快照。教师诊断代理判断失败是否局部可修,并发出从小到大、单调递增范围成本 κ 的修补契约——约束修补边界、允许的程序符号/API、最大段长度。RE-0 按 κ 递增验证契约并选择最小的已验证修补范围(最小必要修补 = 最小已验证范围,而非最短候选字符串)。教师只发出一个有界代码宏动作,绝不接管剩余轨迹。

第二步 Verify(验证):环境恢复到边界快照,在共享随机性下执行两个分支——教师修正后控制权归还学生 vs 学生重采样自身行为——计算配对反事实优势估计 Δ̂。对 K 个独立教师候选做平均,用两层 Hoeffding 置信半径(内层控制 rollout 采样误差、外层控制教师候选采样误差)构造置信下界 LCB。仅当 LCB > 0 时干预被准入。验证是双侧的:一个使基线从 8/16 掉到 1/16 的有害补丁(Δ̂ = −0.44)同样会被拒。每个准入事件从 M=8 对起步,证据不足时逐级升到 12/16/24/32/48 对。

第三步 Weight & Distill(加权蒸馏):准入的干预按验证收益加权,通过 RE-OPD 目标投影回无教师学生——损失函数由「学生保留项(1−g 权重)+ 教师投影项(g·w 权重)」组成,训练历史既覆盖学生会访问的失败状态,也覆盖教师修正后学生诱导的新状态。冷启动(RE-OPD-cold)把教师放进策略席:教师自身的失败历史同样被诊断、修补、验证,验证完成的轨迹构成冷语料库;后续代际(RE-OPD-refine)把学生放回席位。终局是结构性的:当几乎所有历史的 Δ ≤ ε 时门关闭、递归安全弃权——系统自己知道什么时候不需要教师了。

两篇论文的机制对照表:

机制论文 1 HexaAnything论文 2 RE-0
失败定位类型化轨迹 + 诊断(七步循环第 4 步)学生诊断代理定位最早有害边界
验证方式独立验证器对新证据评估世界谓词同快照配对反事实 rollout + 双层 Hoeffding LCB
验证输出五种类型化裁决准入/拒绝 + 连续优势权重
改进落点版本化工件包(工具/工作流/谓词/数据/权重)学生权重(LoRA 微调)
防自证机制验证器独立于提议模型,裁决与基准标签分歧留作反例教师信用由环境判定而非教师或学生声誉判定
理论保证证据阶梯 E0-E4 归因框架定理 1 每轮改进下界

五、评估指标与实验证据

5.1 论文 1:三条主张、三组实验

论文 1 的实验设计围绕三个可分离的主张:动作模型固定时 Harness 提升长程成功率;Harness 返回的数据训练的模型超过基座;工具可对着固定评估器修订而进化。核心指标是任务成功率(仿真基准自带的成功判定,模型自报永不计入)。

实验一:Harness 效应(RoboCasa365,动作模型固定)。RoboCasa365 是厨房场景长程操作基准,分 Atomic-Seen / Composite-Seen / Composite-Unseen 三个划分,每任务 50 个种子(18/16/16 个任务),Overall 汇总全部试验。XR-1 是该基准上最强的 VLA:

配置Atomic-SeenComposite-SeenComposite-UnseenOverall
XR-1(原生,无 Harness)78.0%54.8%34.3%56.6%
HexaAnything(GPT-5.6-Sol 规划)80.9%61.5%38.3%61.1%
Codex(同一模型驱动的通用编码代理)81.7%59.8%34.1%59.5%

三点关键读数:增益集中在长程且未见的组合任务上(Composite-Unseen +4.0pt、Composite-Seen +6.7pt,而 Atomic-Seen 仅 +2.9pt)——这正对应论文「VLA 的缺陷在长程分解与恢复」的诊断;HexaAnything 领先同模型驱动的 Codex 1.6pt,且 Codex 在 Composite-Unseen 上没有超过原生 XR-1——说明收益不是「接了个通用 agent」就能拿到的,类型化工作流与验证器是必要的;换用开源 Qwen3.8-27B 作规划器,Composite-Unseen 也达 37.3%(高于原生 3.0pt),增益不依赖闭源模型。

三个 Composite-Unseen 任务的 100 种本深潜(XR-1 完全相同,只是被当作工具调用):LoadKebabSandwich 17.0%→48.0%(+31pt)、PortionHotDogs 22.0%→37.0%(+15pt)、WaffleReheat 53.0%→70.0%(+17pt)。关键对照:把 PortionHotDogs 的原生 VLA 动作预算翻倍,成功率 21/100 对比标准设置的 22/100,毫无变化——排除了「更多步数」的解释,增益只能来自监控-中断-重规划机制。失败案例的机制也很清楚:原生 XR-1 在烤肉串还在盘子上时就关了烤箱门,使任务不可挽回;HexaAnything 把「两种食材都在烤箱内」作为验证器背书的前置条件,谓词为假时重写下一个子目标。

实验二:模型进化(HexaModel v0.1)。用 Harness 返回的数据微调其基座 Qwen3.8-27B:1,010 条代理轨迹(703 条基座成功 + 204 条 GPT-5.6-Sol 恢复 + 103 条早期检查点恢复)+ 9.3K RoboCasa365 带思维链 VQA + 通用数据,共 178.6M token(Harness 数据占 38.8%),训练 1 个 epoch。

规划器Atomic-SeenComposite-SeenComposite-UnseenOverall
Qwen3.8-27B(基座)80.8%61.0%37.3%60.5%
GPT-5.6-Sol80.9%61.5%38.3%61.1%
HexaModel v0.181.0%62.3%39.5%61.7%

读数:HexaModel 在所有划分上超过基座,最大增益在 Composite-Unseen(+2.2pt),并且这个 27B 开源模型在同一 Harness 下超过了 GPT-5.6-Sol(39.5% 对 38.3%)——验证轨迹内化了物理执行经验,而非只记住任务。

实验三:工具进化(RoboDojo)。任务定义与评估器冻结,只有工具代码被编程代理修订。两轮修订后 Fold cloth 0%→80%、Pour vase 40%→100%、Press by number 0%→100%(权重全程不变,增益纯来自 Harness)。值得注意的是非单调性:Pour vase 的第一次修订反而掉到 0%,第二次由失败信息驱动升到 100%——进化不是爬山,需要回滚机制兜底。

实验四:PhyBench 科学实验与真机。PhyBench 是论文自建的 Isaac Sim 模拟实验室(物理 240Hz,7,200 秒墙钟 / 18,000 帧预算),三任务:胡克定律测弹簧劲度(成功阈值:相对误差 ≤15%)、单摆测重力加速度(≤3%)、耦合振子测简正频率(≤10%)。指标为有效运行的平均相对误差 MRE:

驱动模型胡克定律 k 误差↓单摆 g 误差↓耦合振子 ω 误差↓
HexaAnything + GPT-6-Astra2.3%(10/10 有效)1.2%(10/10)0.8%(10/10)
HexaAnything + Opus 5.51.3%(10/10)1.0%(10/10)1.7%(10/10)
HexaAnything + GPT-5.6-Sol4.8%(9/10)1.9%(8/10)1.2%(10/10)
HexaAnything + Qwen3.8-Max12.4%(5/10)2.4%(3/10)3.7%(3/10)

这组实验的设计意图是把评估从「物体到达目标位置」升级为「定量结论正确」——一串成功的抓取动作不产生力-伸长回归,动作模型的输出(动作序列 + 停止信号)里没有放置这些中间量的位置,端到端 VLA 根本无法接手这类任务。一个案例运行可完整追溯:五次加载的读数(每个绑定来源观测 ID)加权拟合出 k = 24.82 ± 0.40 N/m,对照隐藏参考值 25.16 N/m,误差 1.36%。

真机为 AgileX PiPER-X 双臂平台(4 台 RealSense D435,工具经 URAI 接口让人与代理共享同一控制代码)。七个桌面任务各 3 次,五个全部成功(3/3);有已发表对照的两个任务中,tic-tac-toe 用时 5.0 分钟对 GPT-Policy 的 13.6 分钟(2.7×),拧瓶盖 5.1 对 17.9 分钟(3.5×)——但论文诚实标注了这些参照来自其他硬件与运行限制,且每任务仅 3 次试验。

5.2 论文 2:小数据、强验证、可复现

论文 2 的评估在 6 个 robosuite 长程 Code-as-Policy 任务上(覆盖单/双臂、刚体/铰接体、粗/精操作),每任务 50 个与训练采集完全不相交的 held-out 种子,基线成功率覆盖 4%-100% 的完整难度谱:

任务基座教师单次调用RE-OPD-cold(验证行数)RE-OPD-refine
restack4/50(8%)2/5031/50(62%,3 行)40/50(80%)
spill34/50(68%)33/5050/50(100%,67 行)弃权(已饱和)
nut2/50(4%)26/5044/50(88%,27 行)—
lift2/50(4%)6/5038/50(76%,7 行)回退(见正文)
door48/50(96%)—50/50(100%,40 行)—
cubestack50/50(100%)50/50饱和豁免(0 行)—

四个设计精妙的对照,每一个都直接检验一条机制主张:

对照一(教师能力落地的条件):同一个强教师在 restack 上单次调用(无诊断-修补-验证循环)只有 4/50——没有定位-验证循环,教师能力根本无法在难任务上着陆。而 RE-OPD-cold 用 3 条验证数据把 restack 从 8% 拉到 62%。

对照二(信用分配规则是承重墙):固定候选日志与训练配方,只换准入规则(lift 任务、3 个训练种子、均匀权重):无过滤(25 行)均值 3.7/50、仅符号 Δ̂>0(7 行)4.3、outcome 过滤(27 行)6.0、LCB 配对准入(3 行)9.7。更极端的对比在 restack:3 条验证事件补丁达到 46/50,而 8 条成功过滤的教师演示 SFT 只有 3/50——数据贵在信用密度而非数量。准入分离也很干净:准入事件 Δ̂ ∈ [0.19, 0.44],弃绝事件 |Δ̂| ≤ 0.04;阈值从 0.24 扫到 0.01,准入集合不变——统计严格性没有牺牲灵敏度。

对照三(GRPO 为什么不行):同环境同协议的 GRPO 对照发生熵塌缩(0.30→0.002),非饱和任务 0–1/50。机制对比明确:稀疏终端奖励无法定位长程序内部的有害决策,而 locate-verify-weight 把信用精确放到最早有害边界。

对照四(诚实披露失败模式):lift 的 refine 轮只准入了一个信用极薄的事件(w=0.069),投影后从 76% 回退到 58% 且 spill 分支塌缩(28→0)——「有余量但无信用质量」的投影是有害的,外层接受准则测量到回退后终止递归、保留旧代并披露该检查点。这种把失败当作准则有效性证据的报告方式,是论文可信度的重要来源。

样本效率与真机:摘要数字 4–68% 提升到 62–100% 仅用 3–67 条验证数据;教师效应阶梯实验还显示准入账本本身可当测量仪器——学生自博弈 33+ 事件 0 准入、窄域局部专家 32 事件 0 准入(约 10% 挽救上限)、强 API 教师 13 事件 4 准入(挽救率 19–47%)。全账本 110 个审计事件、19 个准入,仅选中候选就消耗 4,192 次 suffix rollout——验证数据信息密集但并非免 rollout,成本线性于审计事件数。真机零样本迁移(AgileX PiPER 双臂 + SAM3 感知,部署代码与仿真完全一致、无硬件特定编辑、无教师调用):spill 与 cubestack 各 20/20,restack 13/20、nut 12/20、lift 2/20。训练种子复现方面,restack/lift/nut/door 的 cold 增益在三个种子下全部远离基座;spill 是唯一种子敏感任务(50/33/33)。

5.3 两篇论文实验的互证关系

论文 1 证明了「验证过的轨迹可以训练出更好的模型」(HexaModel 实验,E3 级证据),但训练是直接 SFT、无干预级信用核验;论文 2 证明了「只有验证过的干预才该进训练语料」(选择规则消融),但其验证依赖仿真快照回滚。论文 2 的消融恰好补上了论文 1 数据管道最薄弱的一环的证据:未经验证的成功过滤演示 SFT 几乎无效(3/50),而验证干预补丁有效(46/50)。


六、效果优势的根源解释

6.1 根源机制与证据链

论文 1 的因果链:为什么同一动作模型换个 Harness 就从 56.6% 到 61.1%?

  1. VLA 把三个关键决策隐式编码在动作块与停止信号中(论文实验已支持:指令掩码训练仅掉 3.9pt,说明学到的多是场景→轨迹映射;这是「任务理解并未发生」的直接测量)。
  2. HexaAnything 把这三个决策外化为可检查的世界谓词与工作流节点(论文实验已支持:LoadKebabSandwich 中「两种食材都在烤箱内」成为验证器背书的关门前置条件,失败在链中被定位并恢复,成功率 17%→48%)。
  3. 开环连乘 vs 带检查局部修复的数学结构差异(机制推理,论文以开环成功率近似 ∏pi 论证):n 步任务开环成功概率是各步连乘,中间任何一步失败被带到结尾;每步之后检查世界谓词可定位失败步骤,可恢复时就地修复。这解释了为什么增益集中在 Composite-Unseen(+31pt 的 LoadKebabSandwich 正是最容易中途不可逆失败的任务)而在 Atomic-Seen 上几乎为零——短任务没有「链」可断。
  4. 加倍动作预算无效(21/100 对 22/100)排除了「更多步数」的替代解释(论文实验已支持)——提升只能来自监控-中断-重规划机制。
  5. 阅读者推测(论文未直接测量):类型化验证器的 INSUFFICIENT_EVIDENCE 裁决把 VLM 的感知弱点转化为「再观察一次」的行动而非错误结论,这部分贡献未在消融中单独剥离。

论文 2 的因果链:为什么 3 条验证数据能顶 25 条未过滤数据?

  1. 标准蒸馏把教师完整行为当监督(问题设定:教师全局不占优时在教师也失败的轮次错配信用)→ 监督信号中混入负信用样本。
  2. RE-0 把信用对象重新定义为「学生诱导历史上的局部反事实优势」(论文实验已支持:准入 Δ̂ ∈ [0.19, 0.44] 与弃绝 |Δ̂| ≤ 0.04 之间有大间隔,且阈值扫不动摇准入集合)→ 监督只落在教师局部确实更好的历史上。
  3. LCB 准入而非加权是承重机制(论文实验已支持:均匀 SFT 于验证语料与加权目标在种子方差内持平;论文自己把「验证语料选择而非加权方案」声明为经验机制)→ 数据的构成质量决定了蒸馏上限。
  4. 样本效率的根源:每条准入数据携带的期望信用密度高(反事实配对消除了共享噪声),3 行即可翻转 restack;而成功过滤的教师演示把「恰好成功」与「决策更优」混为一谈(3/50)。
  5. GRPO 失败的机制对照:终端奖励对所有中间决策一视同仁,无法定位长程序内的有害边界;熵塌缩(0.30→0.002)是探索崩溃的表征而非原因。

6.2 相关工作检索与对照

围绕两条因果链做了外部检索(检索日期 2026-09-30):

研究(可核验链接)相似尝试相关结论与本文的差异与适用边界对根源解释的影响
Code as Policies(arXiv:2209.07753,Liang et al.,ICRA 2023)代码作为机器人策略的原始形式化代码表征带来空间推理与组合泛化优势;同时承认感知 API 质量是上界、生成代码需人工验证无独立验证器、无世界程序、经验不回流支持「代码是合适的动作媒介」这一前提;其已声明局限恰是论文 1 所补的缺口
Zetta(arXiv:2608.16590,清华 AIR + Z-Trans AI)冻结 VLA、三时间尺度闭环、在线进化 critic 与恢复技能、验证门控更新LIBERO-Pro 90.8% / RoboCasa 93.6%,验证门控防止坏经验扩散学习成果存模型外,权重冻结;验证可回退到仿真器内部特权信号(论文 1 明确对比:真机不可用)不同团队、相近结论:闭环监控 + 验证门控是 harness 增益的来源;补充证据支持因果链第 2-3 步
OVCSD(arXiv:2607.27937)LLM agent(非机器人):失败 rollout 组织为前缀树、技能条件教师从学生到达状态启动、仅保留结果验证成功的续写、在首个分歧点做局部对比学习「从环境验证的教师恢复中学习优于教师打分」,ALFWorld 最高 +29.7pt文本 agent 场景、无物理环境快照回滚、无有限样本理论保证不同场景、机制相近:独立支持「结果验证的教师监督 + 局部信用分配」优于全局模仿,与 RE-0 核心主张一致
DAgger(Ross, Gordon & Bagnell,AISTATS 2011)及现代变体在学习者诱导状态上查询专家以消协变量偏移在策略分布上训练的 regret 随视野线性增长而非二次默认专家在被查询状态上可靠;无反事实验证支持「学生占用度是正确的训练分布」;RE-0 的增量恰是移除「专家可靠」假设
DAPO / GRPO 熵塌缩研究(如 arXiv:2507.12507)独立报告 GRPO 训练早期熵快速下降、抑制探索;clip-higher 等缓解熵塌缩是 GRPO 的普遍现象而非 RE-0 特定实现问题RE-0 的对照关闭了 KL 正则(受显存限制),作者自述应读作「资源匹配的 GRPO」而非「最强调优的 GRPO」限定:RE-0 的 GRPO 基线可能低估了调优后的 RL 上限,但不能推翻「终端奖励无法定位程序内有害决策」的机制论证

在本次检索范围内未发现:与 RE-0 完全同构(具身代码代理 + 快照反事实 + LCB 准入 + 递归蒸馏)的先行工作;也未发现对「验证门控更新」机制得出相反结论(即验证门控有害)的研究。Zetta 与 OVCSD 分别从系统侧与算法侧提供独立佐证,但两者均无论文 2 式的有限样本改进保证——理论保证层面的工作在本次检索范围内是独有的。

6.3 综合判断与未决问题

得到多项研究共同支持的机制:(1) 把任务分解/完成判定/恢复从隐式编码外化为可检查结构,是长程任务增益的来源(论文 1 的对照 + Zetta + CaP-X 的反面发现);(2) 验证门控的经验/更新准入防止坏经验扩散(论文 1 的七步循环 + Zetta 的验证门控 + 论文 2 的 LCB 准入 + OVCSD 的结果验证)。(3) 学生诱导分布是正确的监督落点(DAgger 传统 + OVCSD + RE-0)。

仍属论文自证或推测的部分:论文 1 的 HexaModel 增益(+2.2pt)规模较小且仅一个基座模型;PhyBench 为自建基准,存在「为方法定制基准」的风险;真机每任务仅 3 次。论文 2 的教师效应是相对单个 API 前沿模型校准的;验证成本随审计事件线性增长;结论限于 6 个 robosuite 任务族与单一物理平台,跨任务迁移是选择性的(restack 训练提升 nut 2→22 但不迁移 spill 的擦拭动力学),混合任务联合训练出现严重干扰。

优势的适用条件与失效条件:论文 1 的机制在「中间失败可逆、谓词可从图像证据判定」的任务上最有效;当失败不可逆(物体掉出工作空间)或感知本身不可靠(无可靠深度的位置)时收益受限——真机上 toss blocks 与 fold clothes 的失败正是这两种情形。论文 2 的机制要求环境可快照恢复(仿真)且教师存在局部可修的失败边界;教师效应低于验证噪声底时门自动关闭(这既是安全特性也是能力上限);物理部署侧目前只能零样本迁移而无在线验证。


七、必要知识反推

假设一个没有背景知识的人要做出这两篇论文,最少需要掌握什么?

7.1 领域知识层

  • VLA/WAM 的接口结构与失败模式:不理解「动作块 + 停止信号」的接口里装不下任务分解与恢复,就不会想到把问题从模型层移到表征层(论文 1 的指令掩码实验设计直接依赖此理解)。
  • Code-as-Policy 谱系的四条递进缺陷(感知被信任、错误复合、原语精度天花板、收益不持久):这是设计双表征 + 独立验证器的直接动机。
  • VLM 感知能力的系统缺陷(BLINK/Eyes Wide Shut 的近随机准确率、物体幻觉跟随语言先验):不理解这个就不会明白为什么文本回答不能当状态证据、必须用可执行谓词 + 来源记录替代。
  • 模仿学习的协变量偏移理论:不理解 BC 的二次误差增长与 DAgger 的线性保证,就得不到「学生占用度是正确训练分布」这个 RE-0 的出发点。
  • 软件编码代理的工作范式:测试作为独立验证器、版本控制、可回滚编辑——整个 Physical Coding 是这套范式的物理世界移植。

7.2 方法论知识层

  • 自进化/RSI 谱系的组件分类(数据侧/模型侧/基底侧)与两大观察(训练奖励不是独立验证器;持久工件不是模型更新):论文 1 的四目标分类与证据阶梯直接建立在这个地图上。
  • 集中不等式与多重检验:双层 Hoeffding、union bound 同时覆盖、α 分配——论文 2 的 LCB 门与定理 1 的每一步都依赖这些工具。
  • 性能差异引理与占用度度量:J(µ)−J(π) 的历史-状态分解、KL 投影误差与占用度散度的链条——把「执行时增益」与「蒸馏后增益」连接起来的理论桥梁。
  • GRPO/PPO 机制:不理解 clipping 与熵动力学的相互作用,就无法诊断 GRPO 对照的失败并论证其机制根源。

7.3 工程知识层

  • 机器人仿真栈(Isaac Sim/PhysX、robosuite)与快照保存/恢复:RE-0 的反事实验证、论文 1 的 RoboCasa/RoboDojo/PhyBench 实验全部依赖可恢复的受控仿真。
  • 大模型训练工程:LoRA 微调配置(论文 2:r=16, α=32, all-linear,120 步,batch 2)、vLLM 服务与 FSDP 训练、轨迹数据的组织(论文 1:44,340 条记录 / 178.6M token 的混合配比)。
  • 评估协议设计:held-out 种子分离、配对检验、训练种子复现、Wilson 置信区间、McNemar 检验——论文 2 的可信度大量来自协议严谨性(包括诚实披露验证/测试队列复用的局限)。
  • 真机系统接口:URAI 式人机共享工具接口、CAN 总线关节控制、多相机标定——真机部署与「Vibe as Policy」工作流的基础。

7.4 知识融合的关键节点

  • 节点一(论文 1):「软件编码代理为什么能迭代变强」的答案(观察-行动-反馈共享一个可执行媒介)×「VLA 的接口缺陷」→ 顿悟:给物理世界发明这个媒介,而不是发明更强的动作模型。
  • 节点二(论文 1):「验证器必须独立于提议模型」的软件工程常识 ×「验证轨迹将成为训练数据」的自进化设定 → 类型化裁决 + 来源记录的设计,防止自证循环。
  • 节点三(论文 2):DAgger 的「在学生分布上查询专家」×「教师不全局可靠」的现实 → 把信用对象从轨迹级改写为历史级的反事实优势,配上有限样本保证。
  • 节点四(论文 2):药物试验式的对照思想(同快照、共享随机性、配对比较)× 代码轨迹的可编辑性 → 「最小已验证修补范围」的选择规则,把教师限定在一个有界宏动作内。

八、论文中可以提取的通用性灵感

灵感一:把关键决策从隐式编码外化为可检查结构,是长程可靠性的杠杆。 核心思想:任何系统的可靠性上限由「哪里可以检查、哪里可以干预」决定,而非由端到端容量决定。论文证据:同一 XR-1 动作模型,原生 56.6% 对 HexaAnything 61.1%,增益集中在长程组合任务(LoadKebabSandwich +31pt);指令掩码实验证明隐式映射并不包含任务理解。推广场景:(1) 长程软件 agent 的中间产物显式化(步骤级验收谓词而非只看最终测试);(2) 自动驾驶规划栈的可审计中间表征;(3) 科学发现 agent 的假设-证据显式配对;(4) 工业流程自动化的可检查工序状态机。

灵感二:验证者的独立性决定经验能否安全回流——「测试是独立验证器」是软件 agent 可迭代的根因。 核心思想:当评估者可以被被评估者影响时,改进会退化为自我确认。论文证据:论文 1 的验证器返回五种类型化裁决且独立于提议模型;论文 2 的教师信用由环境反事实判定而非教师声誉,准入账本甚至能测量不同教师的价值(0 准入对 4 准入)。推广场景:(1) RLHF 中奖励模型的独立性审计;(2) 自我改进系统的回归测试与金丝雀发布;(3) 自动交易系统的样本外强制验证;(4) 教育 AI 中「批改者不能由生成者担任」。

灵感三:信用要分配在「系统自己诱导的状态」上,且分配前要经过反事实检验。 核心思想:改进信号的落点比改进信号的多少更重要;一个干预是否值得学习,取决于「在同一状态下不这么做会怎样」。论文证据:3 条 LCB 验证数据把 restack 拉到 46/50,而 25 条未过滤数据只有 6/50;OVCSD 在非机器人场景独立得出同构结论。推广场景:(1) 人机协作中专家介入时刻的复盘(只学习被证明有效的纠正);(2) A/B 测试的配对设计与置信下界准入;(3) 医疗决策的质量归因(配对反事实基线);(4) 代码评审中「这个 patch 是否真的修了 bug」的对照验证。

灵感四:少量高信用数据可以胜过大量低信用数据——数据的价值密度可以被机制设计放。 核心思想:样本效率不是采样技巧问题,而是每条样本携带多少可验证因果信息的问题。论文证据:RE-0 用 3–67 行验证数据实现 4–68% 到 62–100% 的提升;HexaModel 用占 38.8% token 的 Harness 轨迹让 27B 模型超过同 Harness 的更大闭源模型。推广场景:(1) 小样本领域的精选数据集构建(如医疗罕见病);(2) 主动学习的获取函数设计(信息量而非数量导向);(3) 专家演示采集的成本优化;(4) 持续学习中的经验回放缓冲区准入策略。

灵感五:系统应当知道什么时候该停止改进——弃权与回滚是一等公民。 核心思想:自进化系统的安全性不在于永远前进,而在于结构性的终止条件与可回滚性。论文证据:论文 2 的递归在 Δ ≤ ε 时门自动关闭(cubestack 饱和豁免、spill 正确弃权),lift 的回退被外层准则捕获并保留旧代;论文 1 的候选编辑必须通过回归测试否则回滚到父版本,Pour vase 的第一次修订失败后由回滚保护。推广场景:(1) 自动调参/神经架构搜索的早停与防退化检查点;(2) 渐进式发布的回滚机制设计;(3) 个人知识管理中有意识的知识淘汰;(4) 组织流程改进的试点-验证-推广门槛。


两篇论文放在 2026 年 9 月的时间点看,正好处于具身智能范式争论的十字路口:端到端 VLA 的规模化路线遇到了结构性接口缺陷,而「代码作为物理世界的通用媒介」路线第一次同时给出了系统形态(双可执行表征 + 类型化验证器)与训练机制(验证准入的局部反事实蒸馏)两半拼图。前者的证据阶梯到 E4(真机迁移)但增益幅度尚小,后者的理论保证完整但验证仍锁在仿真里——真正的下一步,或许是把论文 2 的 LCB 准入接到论文 1 的物理世界验证器上,让「经验验证」在真机上闭环。