论文链接:Show-Harness: Just a VLM Agent Can Play Robots 发表时间:2026年9月10日(HF Daily Papers 当日榜首 126 赞) 机构:上海期智研究院/清华系团队(Yanzhe Chen、Mike Zheng Shou 组等) 领域标签:cs.RO / Embodied Harness / VLM Agent / 机器人操作
一、论文背景
机器人操作领域长期存在两条对立路线。VLA(视觉-语言-动作)路线把 VLM 微调成"像素→连续动作"的回归器:π₀.₅、GR00T 等模型直接输出本体专属的连续末端执行器轨迹。这条路线精度高但代价沉重——语义知识被压缩进不透明映射,每次换任务、换环境、换本体都要重新适配训练,且闭源前沿模型无法参与(不能微调)。分层/程序化路线(Code-as-Policy 等)让 VLM 产出显式中间抽象(子任务调用、控制 API 上的程序),但物理控制被下游控制器中介,语义意图与物理执行之间的链条被削弱。
本文的出发点是一个被忽视的第三方选项:接口本身。基础 VLM 已经"认识世界"(物体、空间关系、长程目标分解),缺的是一条既让 VLM 自然理解、又足够细粒度以支撑直接物理控制的动作通道。这正好呼应了近期 harness 研究的核心发现——同一模型,接口层的设计空间远未穷尽。
二、论文定位和关联工作
本文站在三条脉络交汇处:
- VLA 直接控制:π₀.₅、GR00T——精度好但语义坍缩、迁移差、闭源模型不可用;
- VLA 中心智能体(Harness-VLA、Goal-VLA):VLA 做物理执行器+外层智能体做规划监控,保留 VLA 瓶颈;
- 程序化系统(Code-as-Policy):VLM 写程序调控制 API,物理控制被中介。
| 维度 | VLA 路线 | 分层/程序化 | Show-Harness |
|---|---|---|---|
| 动作表示 | 连续本体专属 | 高层 API 调用 | 离散语义动作单元 |
| VLM 职责 | 回归低层动作 | 只管高层规划 | 直接负责细粒度物理决策 |
| 闭源前沿模型 | 不可用 | 可用但不接触物理 | 零样本可用 |
| 跨本体 | 需重训 | 依赖控制器 | 换解释器即可 |
定位结论:本文不是又一个 VLA 变体,而是提出"Embodied Harness"这一新范畴——把 harness 工程从纯软件 agent 延伸到物理世界,核心论点是"正确的接口即可释放基础 VLM 的可观具身能力,无需额外模型容量或昂贵的本体预训练"。
三、问题定义
具体问题:如何设计一个模型无关的接口,使任意 VLM(不可微调的前沿闭源模型或可轻调的开源小模型)都能直接控制任意机器人本体完成操作任务?
核心张力:接口必须"双向友好"——对 VLM 侧,动作单元要在其预训练分布内(语义化、离散、可推理);对机器人侧,动作要足够细粒度以保证物理精度(单步移动、夹爪开合)。以往工作在两个方向上各让一步(VLA 向物理让步丢失语义,程序化向语义让步丢失物理),本文要求两头都不让。
形式化:语义动作空间 A = {move(dir, step), gripper(open/close), …},本体解释器 I_e: A → τ(局部控制轨迹),VLM 策略 π 在每个决策点输出 a ∈ A。目标是 π ∘ I_e 在任务分布上的成功率最大化,且 A 与 I_e 对所有本体共享设计原则。
四、问题解法
1. 语义动作空间与本体落地(3.2 节):每个语义动作单元 = 单一方向一步移动或一个夹爪动作,天然落在 VLM 的语言推理能力内;本体专属解释器以确定性方式把语义动作编译为该本体的局部动作(步长、坐标系、速度曲线),VLM 不接触任何本体细节。
2. perceive-reason-act 插件体系(3.3 节):harness 的结构化能力来自 10 个可开关插件——感知环(多视角引导:全局/腕部相机的分工使用;本体感知:夹爪高度/接触状态/位移的文本反馈)、推理环(子任务规划:带可视完成检查的有序清单;情景规划:不确定时推迟决策、执行中选择性重规划)、动作环(自适应分块:按目标可见性在"整段执行省调用"与"逐步执行保精度"间切换;动作历史:摘要防震荡;失败恢复:检测失败触发纠错)。
3. 一接口两模式(3.4 节):ZS 模式下前沿 VLM(GPT 级)直接挂 harness 零样本控制;FT 模式下小型开源 VLM 只需在语义动作序列上做 LoRA 级微调(数 GPU 小时),因为输出空间是离散语义 token 而非连续控制量,无需动作头或特殊 token。
4. GUMI 演示采集接口(4 节):语义动作空间天然可 GUI 化——人类点按钮"前进半格/张开夹爪"即可采集演示,前沿智能体也可自主操作同一 GUI,实现"人类、agent、策略学习共用一套动作语言",免除遥操作硬件。
五、评估指标与实验证据
- 主结果(跨任务/环境/本体):语义接口使 ZS 60%→82%、FT 40%→65%;情景规划任务中 ZS 达 85%,对照 π₀.₅ 仅 10%、FT 0%——VLA 在同量演示数据下无法获得情景推理能力。
- 插件消融:隐藏物体搜索插件把对应任务 35%→85%、把手感知抓取 40%→85%,且对常规任务零干扰(默认关闭设计);禁用分块保留 96% 成功率但模型调用增多、全程强制分块则降至 74%,自适应切换兼得 96% 成功+30 步/回合。
- 基线对比:对照 VLA(π₀.₅、GR00T,用同一批演示转换的连续轨迹微调)、VLA 中心智能体(H-VLA、G-VLA)、Code-as-Policy 类;π₀.₅ 在同等演示下仅 18%,需额外细粒度训练才到 62%。
六、效果优势的根源解释
优势根源在语义-物理解耦带来的三重自由度:
- 模型自由:因为动作是离散语义 token,闭源前沿 VLM 无需任何训练即可接入(ZS 模式),开源小模型微调目标从"回归连续控制流"降维成"选语义动作 token",几 GPU 小时够用——而 VLA 必须为每个本体学一个连续回归头。
- 本体自由:换机器人只需换解释器(确定性编译),VLM 侧完全不动;VLA 换本体=重新收集连续轨迹+重训。
- 推理自由:VLM 始终在自己的语言空间做物理决策(哪个方向、半格还是一格),情景规划/失败恢复等推理能力直接复用——而程序化路线的 VLM 看不到执行中间态,VLA 路线的推理被埋进回归权重。
因果链:接口语义化 → VLM 决策留在预训练分布内 → 前沿模型零样本可用+小模型轻调可用 → 跨任务/本体/环境泛化全面超越。
七、必要知识反推
要读懂本文需要补的知识:
- Harness 概念在具身的映射:软件 agent 的 harness=提示词+工具+钩子;本文的 Embodied Harness=语义动作空间+解释器+插件体系,即"模型与本体之间的一切执行基础设施"。
- π₀.₅ / GR00T:Physical Intelligence 与 NVIDIA 的代表 VLA,作为本文最强对照。
- 动作分块(action chunking):一次输出多步动作减少调用但开环风险大,本文做成自适应插件。
- LoRA:低秩适配,FT 模式的微调手段。
八、论文中可以提取的通用性灵感
- 接口即能力释放器:当模型已具备知识而表现不佳时,先审视接口是否在预训练分布内,而非急于改模型——“正确的接口可以零成本解锁既有能力"是比"更大模型"更便宜的杠杆。
- 解耦"谁决策"与"谁执行”:把决策留在通用模型、把确定性落地交给专用编译器,是跨平台泛化的通用架构模式(可迁移到任何"通用大脑+专用末端"系统:CAD 生成、数据管道、测试框架)。
- 插件化而非一体化:10 个各自独立、默认关闭、按需开启的插件让 harness 可按任务组合,避免"全量提示词"的干扰税——任何 harness 设计都应问"这个能力需要常开吗"。
- 人机共用的采集接口:让人类用与 agent 相同的动作语言演示,数据天然同构——凡是需要演示数据的系统,都值得把"操作通道"设计成人类也可用的形式。