Show-Harness: Just a VLM Agent Can Play Robots 精读
Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。