MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读
大连理工牵头、联合牛津等七校提出 MA-VLA:面向多机械臂协作的组合泛化——测试时协作模式(角色/顺序/交互结构)训练中未见过,但原子动作全在分布内。方法三件套:VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零,MA-VLA 达 13.0%;真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。