N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读
N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。