RoboDawn:让通用 VLM 零训练接管机器人控制,以及 GPT-6 Astra 的零样本佐证 精读

以清华大学胡事民团队 RoboDawn 为主线精读:它用一套人类直觉的「语义原语接口」(离散平移/旋转/夹爪命令)把机器人控制暴露给 agentic VLM,配合无需参数更新的 in-context learning 与闭环决策,在 RoboTwin 2.0 上单样本 73.6% 成功率,超 HarnessVLA 的 58.4%。同日 RoboProbe 等发布的 GPT-6 Astra 在 RoboDojo 零样本 22.48% SR 登顶,却能力两极化(Precision 仅 4.00 vs DM0.5 16.75),为「通用大模型已具备机器人控制潜质、但精度是短板」提供独立佐证。

September 23, 2026 · 3 min

Show-Harness: Just a VLM Agent Can Play Robots 精读

Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。

September 11, 2026 · 2 min

具身原生的豪赌:蚂蚁灵波沈宇军,为什么坚持从传感器和视频里重训整个机器人模型?

蚂蚁灵波首席科学家沈宇军的深度访谈。他从GAN研究起步,经字节、蚂蚁研究院,最终主导蚂蚁灵波做机器人"大脑"。文章梳理了灵波最核心的技术主张——“具身原生”:不再沿用数字世界的模型做下游适配,而是从传感器、视频时序、单向MoE架构出发,为物理世界从头训练一套完整的机器人基础模型(V-Ren、DEPS、VLA 2.0、Video、Word六件套)。沈宇军也坦率谈到了数据是当前最大瓶颈、灵波为什么不做本体、以及他对"大脑落后于本体"这一行业判断。

July 22, 2026 · 2 min