UniMPA 精读:给 VLA 模型一个“动作锚定”的统一接口,训练 epoch 砍半还涨点
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
Show-Harness 用一组离散语义动作单元(单步方向移动+夹爪动作)作为 VLM 与任意机器人本体之间的唯一接口:VLM 在语义空间推理意图,本体专属解释器把语义动作确定性落地为局部控制,VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM(ZS 60%→82%)与几 GPU 小时微调小模型(FT 40%→65%),GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。
浙大×云深处科技等推出 EmbodiedSkills:把每个技能决策当作执行提案,守卫运行时执行前验证前置条件、执行后验证结果,固定的可执行技能契约连接 Qwen3-VL 高层选择与 π0.5 低层执行。RoboTwin 2.0 全 50 任务宏平均 86.20%(π0.5 基线 82.74%),LIBERO 四套件 97.40%,并诚实暴露记忆依赖任务 12.5% 的缺口。
HUST×清华×面壁智能等推出 SimpleMemVLA:去掉检索/压缩/循环等专门记忆模块,把完整采样历史以时间戳视频格式直接喂给 VLM 主干,子任务隐藏状态作为唯一记忆通道。四个记忆基准全部 SOTA(RoboMME 88.3% vs 检索 31.5%/压缩 22.6%/循环 20.6%,真值感知上限也仅 84.1%),通用控制无损(LIBERO 97.5%),因果干预证实策略真实读取历史。
硅谷101走进触觉传感器实验室,梳理压阻、压电、电容、光学、磁感应五条技术路线,解释触觉数据为何接近于零、真机采集的"屏蔽悖论",以及端到端时代触觉融入模型的两种范式之争。几乎所有受访嘉宾认为2026年触觉处于爆发前夜,量产一致性与数据生态是接下来一年的关键观察点。
晚点聊邀请《具身的金钱游戏》两位作者复盘具身智能行业:融资额屡创新高,但算力和数据这两个最需要花钱的地方投入寥寥;收入靠地方政府数采中心与制造业关联交易撑起,IPO 成为行业主竞赛。本文拆解数采中心合资模式、制造业"互买"闭环、Club Deal 攒局玩法,以及这场资本竞赛背后的技术不确定性与观察指标。
复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM,首个面向电子游戏原生键鼠闭环控制(游戏玩法+GUI)的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配,同时生成未来视觉观测与可执行动作;用每步动作路由器区分 gameplay/GUI 两种控制分布,用预测长执行短的块周期控制解耦规划与承诺,用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7(次优 36.8)且执行步数全面最少,零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式:采样动作源的低频分量会系统性牵引生成相机运动,复用可致原地旋转。整篇论文训练仅 2.79B token,是 Game-TARS 配方的 1/200。
用强化学习训练手机 GUI 智能体,为什么必须忍受昂贵的真实环境交互?华东师范大学提出的 WM-R1 给出了第一个完全相反的答案:把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移,Agent 通过 GRPO 在纯模拟环境中学习;更关键的是 <call_wm> 机制把世界模型嵌进思维链,让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA(超 UI-R1 达 9 个百分点),OOD 平均提升 +16.0,训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。
深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround:基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒,以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐:视觉识别可高达 80-93% 但方向理解接近四选一随机;短导航最高 75% 而长导航几乎全军覆没(最高 3.8%)——局部能力存在,却无法组合成持续目标导向行为。
西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。