论文链接:N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 发表时间:2026年7月 机构:NeoteAI Team + 复旦大学 TEAI Team(联合) 领域标签:cs.RO / 视-触-语言-动作模型 / 离线强化学习 / 机器人操作


一、论文背景

1.1 什么是接触丰富的机器人操作?

让机器人抓起一个杯子看似简单,但要让机器人完成"把软毛巾折叠整齐"“把布袋撑开打包"“把扩展卡精准插入卡槽"这类任务,难度会骤然上升。这类任务的共同特征是:任务成败由机器人手指与物体之间细致的接触状态决定——插座插入需要亚毫米级的对准;折叠纸箱需要手指感知板材的回弹力;打包布袋需要持续感知布料的滑动。这类任务被称为 接触丰富操作(contact-rich manipulation)。

之所以难,是因为它们超出了纯视觉感知的能力范围。视觉告诉你"杯子在桌上”,但机器人手指是否真的捏住了杯壁、捏得多紧、是否在滑动——这些信息只有触觉才能提供。人类完成这类任务时,闭着眼睛仅靠手感都能完成大半,这就是触觉的威力。

1.2 当前主流VLA模型的根本困境

近两年,视觉-语言-动作模型(Vision-Language-Action, VLA) 已经成为机器人策略的主流范式。典型代表如π0、π0.5、OpenVLA等:它们以视觉图像 + 自然语言指令为输入,直接输出机器人动作序列。这些模型在大规模遥操作数据上训练,能完成大量日常操作任务。

但所有这些模型都有一个共同的短板:它们看不见触觉。

  • 感知盲区:当物体被手指遮挡、或在视野外发生接触时,纯视觉策略无法感知;插座是否对准、螺丝是否滑丝、布料是否滑动——视觉难以分辨。
  • 反馈滞后:视觉策略只能"看到接触已发生"的后果(杯子掉了、卡槽歪了),无法在接触产生的瞬间做出精细调整。
  • 离线改进无门:机器人部署后积累的大量失败/次优轨迹无法被系统性地利用——你只能再采集新演示,而不能从"差一点成功"的轨迹中学到东西。

1.3 为什么把触觉引入VLA这么难?

把触觉"塞"进一个已经训练好的VLA模型听起来简单,实际上面临三重结构性困难:

  1. 触觉信号稀疏且沉默:机器人操作的大部分时间(接近、运输物体)触觉传感器读数几乎为零,只有在接触发生的瞬间才有信号。如果把触觉token直接拼到密集的视觉-语言prefix中,它要么被淹没,要么引入噪声。

  2. 触觉记录的是"已经发生的接触”:当前帧的触觉读数反映的是"动作已经产生接触之后"的状态,直接用它作为条件,策略会落后于自身接触事件一步——这是一种因果错位。

  3. 缺乏大规模触觉数据集:触觉传感器百花齐放(GelSight、DIGIT、UniVTAC等),数据格式不统一;已有的VLA大规模数据集(如Open-X-Embodiment)几乎不包含触觉模态。没有规模数据,就训练不出基础模型。

1.4 N₀-VTLA的破局思路

N₀-VTLA由NeoteAI Team与复旦大学TEAI Team联合提出,论文标题中的"N₀"读作"N-naught"(“N零”),象征该系列工作的第一代基座。它针对上述三重困难给出了系统性回答:

  • 数据层面:自建NeoData——首个大规模视-触机器人数据集,覆盖单臂、双臂平台与UMI手持采集夹爪,所有夹爪手指均搭载自研视-触传感器。
  • 架构层面:提出预测性触觉通路(Predictive Tactile Pathway)——不把当前触觉直接作为条件,而是让模型预测未来50步的接触状态,用预测的潜在触觉token指导动作,从而避免因果错位。
  • 训练层面:设计三阶段训练配方——先用大规模数据建立接触先验,再分阶段把触觉通路接入动作专家,避免破坏预训练策略。
  • 离线改进层面:提出ALTER——一种优势条件离线RL方法,把部署日志中的轨迹相对进展与事件比较转化为二元优势标签,无需任何新的环境交互即可改进策略。

这些设计共同让N₀-VTLA成为首个在大规模触觉数据上预训练的VTLA基础模型。


二、论文定位和关联工作

2.1 纯视觉VLA基础模型谱系

工作核心思想与N₀-VTLA的关键区别
OpenVLA / InternVLA在Open-X-Embodiment上做大规模视觉-语言-动作预训练无触觉模态,接触丰富任务表现受限
π0 / π0.5基于流匹配(flow matching)的VLA家族,π0.5引入了动作专家与语言前缀的解耦作为本文最重要的base policy与baseline,但同样无触觉
RT-2 / Octo大模型迁移到机器人策略的早期探索同样聚焦视觉-语言,未涉及触觉集成

N₀-VTLA直接以π0.5为base policy进行扩展,保留其vision-language backbone和action expert架构,在其上叠加触觉通路。

2.2 触觉感知与触觉增强策略

工作核心思想与N₀-VTLA的关键区别
VITaL把触觉作为辅助模态加入VLA仍是小规模、任务特定的触觉集成,未做大规模预训练
ACT + UniVTAC在UniVTAC触觉仿真器中训练ACT策略仅限仿真域,未在真机大规模触觉数据上预训练
Touch-and-Go / T-DPPO把触觉传感器读数与视觉融合做特定任务缺乏统一的基础模型范式,难以规模化
GelSight / DIGIT 系列视-触传感器硬件与表征研究是传感器工作,N₀-VTLA使用其读数但聚焦策略层

N₀-VTLA是第一个把触觉模态作为一等公民纳入大规模基础模型预训练的工作。

2.3 离线强化学习与离线策略改进

工作核心思想与N₀-VTLA的关键区别
CQL / IQL通过保守正则化约束离线Q函数需学习Q函数,难以迁移到flow-matching策略
Decision Transformer把RL转化为条件序列建模用return-to-go条件,但连续任务中return尺度难标定
DPO-style /Preference-based用偏好对比训练策略N₀-VTLA的ALTER借鉴了"成对比较"思想,但用进度差和事件比较构造标签
π0.5的χ₀分类器用VLM分类成功/失败作为 Advantage 监督是N₀-VTLA在实验中对比的一个baseline(π0.5+χ₀)

ALTER的定位是:一种专门为flow-matching VLA策略设计的、免环境交互的离线改进方法。

2.4 N₀-VTLA的定位突破

维度纯视觉VLA(π0.5等)已有触觉增强工作N₀-VTLA
触觉模态无任务特定小规模集成大规模预训练的一等公民
触觉使用方式—当前帧读数直接条件预测未来接触的潜在token
离线改进仅靠新演示不支持ALTER从部署日志中改进
数据规模Open-X-Embodiment等数十小时级NeoData大规模视-触数据集

三、问题定义

3.1 从具体场景到抽象问题

具体场景:给定一个已经训练好的视觉-语言-动作策略(如π0.5),如何让它获得触觉感知与触觉反馈控制能力,并且能够从部署日志中持续改进?

核心洞察:N₀-VTLA发现,这个问题的关键不在于"如何编码触觉信号",而在于触觉信号在策略决策中应该扮演什么角色。触觉信号稀疏且记录的是"已发生接触",直接条件化会引入因果错位;但如果让触觉以"预测未来接触"的形式进入策略,就能把大规模接触先验蒸馏为精细运动调整。

3.2 形式化问题定义

本论文实际解决了两个形式化问题:

问题一:触觉集成问题

  • 给定:
    • 预训练的视觉-语言-动作策略 $\pi_{\text{VL}}(a \mid o_{\text{VL}})$(输入视觉-语言观察 $o_{\text{VL}}$,输出动作序列 $a$)
    • 大规模视-触数据集 $\mathcal{D}_{\text{NeoData}}=\{(\text{tac}_t, o_{\text{VL},t}, a_t)\}$
    • 小规模下游任务演示 $\mathcal{D}_{\text{task}}$
  • 求:一个增强策略 $\pi_{\text{VTLA}}(a \mid o_{\text{VL}}, \text{tac})$,使得:
    • 在接触丰富任务上优于 $\pi_{\text{VL}}$
    • 在不需要触觉的free-space运动中保持原策略行为(不退化)
    • 训练过程不破坏预训练策略的能力

问题二:离线策略改进问题

  • 给定:部署产生的固定轨迹集 $\mathcal{D}_{\text{deploy}}=\{(o_t, a_t, r_t)\}$(无额外环境交互)
  • 求:改进的策略 $\pi_{\text{improved}}$,使得在长程接触丰富任务上成功率显著提升
  • 约束:不能做额外环境采样;不能依赖手工奖励函数;要兼容flow-matching策略架构

3.3 抽象的精妙之处

这两个抽象的精妙之处在于:触觉集成与离线改进被解耦为两个独立但互补的目标。前者解决"策略能不能感知接触",后者解决"策略能不能从失败中学习"。前者靠预测性潜在token避免因果错位,后者靠二元优势标签规避复杂的Q函数估计。两者最终在flow-matching action expert处汇合——这是整篇论文的结构之美。


四、问题解法

N₀-VTLA的解法由两大模块构成:(A)触觉集成(三阶段训练配方 + 预测性触觉通路),(B)ALTER离线策略改进。下面逐一展开。

4.1 触觉编码:把触觉图像翻译成token

类比:触觉传感器读数就像一张"压力分布图"——视觉-触觉传感器(如GelSight)输出的就是手指接触面变形的图像。N₀-VTLA把触觉当作图像流来处理。

具体做法:

  1. 差分图像输入:不使用绝对的gel图像,而是使用 contact-difference image:当前帧 $\text{tac}_\tau$ 减去episode起始基线帧 $\text{tac}_0$。这一步去除了静态gel外观和mount-specific印记,只保留接触引起的变化。
  2. 冻结DINOv2编码:用预训练的 DINOv2 自监督视觉编码器对差分图像编码,编码器始终冻结(保持自监督表征完整、节省训练内存、便于新传感器接入)。
  3. 10 token输出:每个触觉图像输出10个token(1个class token + 9个来自3×3 adaptive average pool的空间token,原始patch grid为16×16)。token宽度 $d$ 与vision-language backbone共享。
  4. 多视角拼接:若有 $n$ 个触觉传感器,则拼接为 $g = [g_1; \dots; g_n] \in \mathbb{R}^{10n \times d}$。
$$g_k = f_{\text{enc}}(\text{tac}^k_\tau - \text{tac}^k_0) \in \mathbb{R}^{10 \times d}$$

4.2 预测性触觉通路:用未来接触而非当前接触

这是N₀-VTLA最核心的设计决策之一。

类比:开车时,你不能盯着后视镜(“已经发生的事”)来决定怎么打方向盘——你需要看前方(“将要发生的事”)。同理,当前帧的触觉记录的是"动作已经产生的接触",用它来决定动作会落后一步。N₀-VTLA让模型预测未来50步的接触状态,用预测结果指导动作。

架构组件:

组件输入输出作用
Tactile Encoder差分触觉图像当前触觉token $g$把触觉翻译成潜在表示
Predictor$g$ + vision-language prefix潜在触觉token $z \in \mathbb{R}^{10\times d}$预测未来接触状态
Latent-to-Expert Projection$z$投影后的 $z$把 $z$ 送入action expert
Action Expert$z$(前置) + noised action tokens去噪动作tokens用 $z$ 指导动作去噪

几个关键设计决策:

设计选择论证理由
触觉不放入VL prefix触觉信号稀疏且大部分沉默,在information-dense的prefix中价值低
不使用current tactile读数condition动作当前触觉记录的是已产生接触,policy会落后于自身接触事件一步
使用预测的latent而非原始tokens50步chunk由chunk本身将造成的接触决定,当前帧不包含该信息
冻结DINOv2编码器保持自监督表征完整、便于新传感器接入、节省训练内存
差分图像而非绝对gel图像去除静态gel外观和mount-specific印记
当前 $g$ 永不直接进入action expert强制expert只能通过预测的 $z$ 获得触觉信息

4.3 三阶段训练配方

类比:这就像教一个已经会开车的司机使用"导航预判"功能——你不能一上来就把方向盘抢过来,而要分步来:先让导航学会预判前方路况(阶段1),再让司机根据预判调整方向(阶段2),最后让两者协同流畅(阶段3)。

Stage 1:Grounding the Predictor(预测器锚定)

目标:让predictor学会从当前状态 + 视觉-语言上下文预测未来50步的接触变化。

冻结:整个base policy(vision-language backbone + action expert)冻结。

可训练:仅predictor、tactile projection、lightweight reconstruction head。

训练目标:对称InfoNCE对比损失 + L1重建损失。

$$\mathcal{L}_1 = \mathcal{L}_{\text{NCE}} + \lambda_{\text{rec}} \mathcal{L}_{\text{rec}}$$

InfoNCE:让预测的 $z$ 与"真实的未来触觉编码"在batch内匹配。

$$s_{ij} = \langle h(z_i), h(z^*_j) \rangle$$$$\mathcal{L}_{\text{NCE}} = -\frac{1}{2B}\sum_{i=1}^{B}\left[\log\frac{e^{s_{ii}}}{\sum_{j=1}^{B}e^{s_{ij}}} + \log\frac{e^{s_{ii}}}{\sum_{j=1}^{B}e^{s_{ji}}}\right]$$

Target $z^*$:从未来第50帧的差分触觉图像编码得到。

$$z^* = \frac{1}{n}\sum_{k=1}^{n} f_{\text{enc}}(\text{tac}^k_{\tau+H} - \text{tac}^k_{\tau}) \in \mathbb{R}^{10 \times d}, \quad H=50$$

Reconstruction:让 $z$ 通过重建头预测未来chunk的降采样contact-change field $\bar{D}_{\tau \to \tau+H}$。

$$\mathcal{L}_{\text{rec}} = \|r_\psi(z) - \bar{D}_{\tau \to \tau+H}\|_1$$

验收标准:训练完成后,latent $z$ 检索匹配的future-tactile target达到 92.3% top-1准确率(随机基线仅3.2%)——这说明predictor真的学会了预测未来接触。

Stage 2:Aligning Latents with the Action Expert(潜变量与动作专家对齐)

目标:让动作专家学会"依赖"预测的 $z$,而不是绕过它。

冻结:tactile perception stack(保持Stage 1的checkpoint)。

可训练:仅latent-to-expert projection + action expert。

关键操作——Masking:在expert的attention中,mask掉action queries对vision-language prefix的keys和values,仅保留latent tokens $z$ 和 noised action tokens作为唯一可关注的条件。

这一步非常巧妙:它强制动作预测必须通过 $z$ 路径,避免action expert从场景和指令直接预测动作的"捷径"。如果允许action expert直接看prefix,它可能完全忽略 $z$,那么触觉通路就形同虚设。

Stage 3:End-to-End Joint Training(端到端联合训练)

目标:让所有组件协同工作,恢复prefix信息但保留对 $z$ 的依赖。

冻结:仅always-frozen的DINOv2触觉编码器backbone。

可训练:其余全部——predictor、两个projection、action expert、vision-language backbone。

操作:移除Stage 2的vision-language mask,恢复prefix-to-expert路径;仅使用action objective(flow matching loss)训练;Stage 1的contrastive和reconstruction targets不再应用。

为什么三阶段而非端到端:论文指出,可训练surface仅在grounding后扩大,避免破坏预训练policy。如果一开始就端到端训练,缺乏监督的 $z$ 可能漂移到无意义的状态,action expert也会失去对触觉信号的信任。

Free-Latent 简化变体

论文还定义了一个简化变体:Free-Latent variant——完全省略Stage 1监督,$z$ 仅通过action gradient塑造,三阶段recipe坍缩为单一joint stage,训练时不需要future frames。这为未来在数据匮乏场景下的应用留下了空间。

4.4 ALTER:从部署日志中学习

ALTER(Advantage-Conditioned Offline RL)解决的是第二个问题:不采新数据,只用已有部署日志改进策略。

核心思想:与其学一个复杂的Q函数或return-to-go,不如把问题转化为二元分类——对每条轨迹中的每个状态,打上"优势正/负"的标签,然后用条件生成的方式训练策略:部署时始终用"优势正"作为条件。

ALTER用三个步骤生成标签:

步骤1:持续时间校准的阶段进度

问题:不同任务、不同阶段的持续时间差异巨大(接近阶段可能1秒,插入阶段可能5秒),用绝对时间作为进度会失真。

做法:用clean demonstrations中每个阶段的平均持续时间 $\bar{d}_k$ 做权重校准:

$$w_k = \frac{\bar{d}_k}{\sum_{j=1}^{K}\bar{d}_j}, \quad \phi_t = \sum_{j其中 $K$ 是阶段数,$u_t \in [0,1]$ 是当前帧已完成阶段的分数。$\phi_t \in [0,1]$ 是校准后的进度信号,跨任务可比。

步骤2:事件感知成对进度学习

训练一个进度模型 $A_\theta(x_a, x_b) \in [-1, 1]$(基于π0.5的paired-observation架构),让它学会"两个观察之间谁的进度更高"。

损失函数:

$$\mathcal{L}_{\text{prog}} = \mathbb{E}_{\mathcal{D}_{\text{stage}}}\left[A_\theta(x_a, x_b) - (\phi(x_a) - \phi(x_b))\right]^2 + \lambda_{\text{event}}\mathbb{E}_{\mathcal{D}_{\text{event}}}\left[\max(0, m - yA_\theta(x_a, x_b))\right]^2$$
  • 第一项:在带dense progress-difference targets的demonstration pairs上做回归。
  • 第二项:在事件triples $(x_a, x_b, y)$ 上做hinge loss——$y=+1$ 表示 $x_a$ 进度更高,$y=-1$ 反之,$m$ 是最小signed score margin。
  • 事件来自哪里:来自部署日志中的关键事件(如"毛巾掉落"“卡槽对准成功"等),通过简单的规则或传感器触发。

步骤3:二元优势标签生成

给定训练好的 $A_\theta$,对部署日志中每个状态打标签:

$$\hat{\phi}_t = \delta_e + A_\theta(x_t, x^e_0)$$$$\hat{r}_t = A_\theta(x_{\min(t+H, T_e-1)}, x_t)$$$$q_k = \text{Quantile}_{1-\rho}\{\hat{r}_i : s_i = k\}$$$$c_t = \mathbf{1}[\hat{r}_t \geq q_{s_t}]$$

其中:

  • $H = 50$(action-chunk horizon)
  • $\rho = 0.3$(每个stage保留top 30%作为positive)
  • $x^e_0$:episode $e$ 的第一个observation
  • $T_e$:episode帧数
  • $\delta_e$:从nominal task start的episodes为零;staged-recovery episodes使用特殊初始化

标签如何使用:

  • $c_t = 1$ → 在task prompt后append文本 “Advantage: positive”
  • $c_t = 0$ → 在task prompt后append文本 “Advantage: negative”
  • 部署时,prompt始终使用"Advantage: positive”

这把离线RL问题转化为了一个条件序列生成问题:模型学会在"Advantage: positive"条件下生成高质量动作,部署时直接用这个条件即可。无需Q函数,无需reward model,无需环境交互。

4.5 全景方法对比

维度纯视觉VLA已有触觉增强N₀-VTLA
触觉使用无当前帧直接条件预测未来接触的潜在token
训练策略端到端SFT任务特定小规模三阶段渐进式
离线改进不支持不支持ALTER二元优势标签
因果错位—存在通过预测消除

五、评估指标与实验证据

5.1 评估指标体系

N₀-VTLA用了三个层次的评估指标:

指标类型指标名称定义衡量的能力
主指标成功率(Success Rate)任务完成的episode比例综合策略能力
辅助指标Progress Score阶段进度的连续分数(部分完成度)长程任务的细粒度进展
消融指标Latent retrieval Top-1$z$ 检索future-tactile target的准确率Predictor是否真学到未来接触
消融指标Tactile-to-VL sensitivity ratio触觉置换vs视觉置换引起 $z$ 变化的比值$z$ 是否真依赖触觉而非视觉
消融指标Counterfactual Probe移除触觉后动作预测的偏移触觉在哪些时刻真正起作用

5.2 数据集与基准

数据集/基准用途规模/特点
NeoData大规模触觉预训练单臂+双臂+UMI手持,全部搭载视-触传感器,模拟数据来自UniVTAC
UniVTAC Benchmark(8任务)仿真触觉操作评估Lift Bottle、Pull-out Key、Lift Can、Put Bottle、Insert Hole、Insert HDMI、Insert Tube、Grasp Classify
NeoSim Benchmark(12任务)仿真操作评估4单臂 + 8双臂
NeoReal(9任务)真机评估接触丰富的精细任务
3个长程真机任务ALTER评估Towel Folding、Bag Packing、Cardboard Box Folding

5.3 仿真结果:20任务总均值63.8% vs 44.0%

UniVTAC Benchmark(8任务):

MethodLift BottlePull-out KeyLift CanPut BottleInsert HoleInsert HDMIInsert TubeGrasp ClassifyAvg
ACT (Vision Only)422820281915455030.9
ACT + UniVTAC714629312428569948.0
VITaL72478322563410040.5
π0.510035634258744941.4
StarVLA-α325165885224696856.1
InternVLA-A1586690379312958667.1
Xiaomi-Robotics-0218013129669984554.3
GigaWorld-Policy383202112092016.5
N₀-VTLA9999886095259910083.1

NeoSim Benchmark(12任务总均值):

MethodNeoSim均值
π0.545.8
StarVLA-α23.2
InternVLA-A18.6
Xiaomi-Robotics-023.4
GigaWorld-Policy10.8
N₀-VTLA50.8

20任务总均值:N₀-VTLA = 63.8%,最强baseline π0.5 = 44.0%(+19.8 pp)。在UniVTAC 8任务上,N₀-VTLA的83.1%甚至超过了专门在该仿真器上训练的InternVLA-A1(67.1%)。

关键观察:

  • 在双臂任务上差距尤其大:N₀-VTLA双臂均值39.4% vs π0.5的34.3% vs 其它所有baseline < 15%。双臂任务接触更复杂、协调要求更高,触觉感知的价值被放大。
  • 在Grasp Classify(抓取分类,需要识别接触状态)上,N₀-VTLA达到100%,而纯视觉ACT只有50%——这是触觉感知直接决定任务能力的典型例子。

5.4 真机结果:赢得全部9个NeoReal任务

整体指标:

指标N₀-VTLAπ0.5ACT
成功率均值47.2%29.4%—
Progress Score均值56.842.310.2

代表性任务:

任务N₀-VTLAπ0.5ACT说明
Socket Plugging(精度插座插入)85%60%—亚毫米级对准,触觉决定成败
Board Insertion(扩展卡插入)25%0%0%需要感知卡槽对准
Bottle Standing(空瓶直立)30%0%0%需要感知瓶子滑动
Cardboard Box Folding(长程)Progress 37.219—长程接触丰富任务

N₀-VTLA赢得了全部9个NeoReal任务——这是论文最具说服力的结果:在真实机器人、接触丰富任务上,触觉感知带来了全面提升而非仅在特定任务上有效。

5.5 ALTER结果:长程任务达到75-95%

3个长程真机任务的ALTER离线改进结果:

任务π0.5-SFTN₀-VTLA-SFTπ0.5+ALTERN₀-VTLA+ALTERπ0.5+χ₀
Towel Folding(毛巾折叠)——90%95%—
Bag Packing(包装袋打包)——75%80%—
Cardboard Box Folding(纸箱折叠)——60%75%—

关键观察:

  • ALTER对N₀-VTLA和π0.5都有提升,但N₀-VTLA+ALTER始终最高——触觉感知与离线改进是互补的。
  • SFT阶段N₀-VTLA领先π0.5的分数分别是 +10、+15、+15 points,ALTER进一步放大了优势。
  • 吞吐量(N₀-VTLA+ALTER):Towel Folding = 43次/小时,Bag Packing = 15次/小时,Cardboard Box Folding = 30次/小时——具备工程实用性。

5.6 ALTER在次优轨迹上的响应

论文做了一个非常有说服力的定性实验:让进度模型 $A_\theta$ 在两条不完美的Towel Folding轨迹上预测进度。

  • 轨迹1(纠正的毛巾掉落):预测进度在毛巾掉落处下降,恢复开始时达到局部最小值,随后恢复上升。
  • 轨迹2(未恢复的褶皱错误):运输过程中扁平毛巾变褶皱后进度急剧下降,episode终止前持续低位。

这说明 $A_\theta$ 真的理解了任务进度,而不是记住了某种表面模式——它能识别"出错了"并反映在进度曲线上。这是ALTER能够生成有效优势标签的根本原因。


六、效果优势的根源解释

6.1 为什么触觉集成带来全面提升?

对比对象:最强baseline π0.5(纯视觉VLA)。

π0.5的根本局限:它把所有决策都建立在视觉之上。但视觉有两个无法逾越的障碍:

  1. 遮挡盲区:机器人手指在执行精细操作时,手指本身会遮挡物体关键接触区域。插座是否对准、布料是否滑动——视觉根本看不到。
  2. 分辨率极限:视觉的空间分辨率在毫米级,而接触丰富任务(如插座插入)需要亚毫米级的对准精度。视觉信号在接触发生后才能间接反映结果,已经晚了一步。

N₀-VTLA的根本性改变:

  • 信息流改变:引入了预测性触觉通路。这个通路在free space中保持沉默(不干扰视觉策略),在接触决定结果的瞬间被激活——这被counterfactual probe实验证实。
  • 因果改变:通过预测未来50步的接触状态,策略从"反应式"(看到结果才调整)变为"预判式"(提前调整避免错误)。Stage 1训练后 $z$ 检索future-tactile target 达到92.3% top-1,证明predictor真的学会了预判。
  • 表征改变:潜在token $z$ 的Tactile-to-VL sensitivity ratio在Stage 1后是 4.3,说明 $z$ 主要由触觉决定(而非视觉)。端到端训练后降到 1.4——视觉信息重新流入,但触觉信号仍是 $z$ 的主导。

因果链:触觉通路 → free space沉默、接触时刻激活 → 接触丰富的精细任务(插座、扩展卡、瓶子)成功率大幅提升 → 9/9 NeoReal任务全胜。

反事实验证:counterfactual probe显示,移除触觉后,free space中预测路径与原路径重合(divergence ≈ 0),但在firm contact和grasp时刻两路径分离——触觉只在关键瞬间起作用。这解释了为什么N₀-VTLA在需要触觉的任务上提升巨大,在不需要触觉的任务上不退化。

6.2 为什么三阶段训练比端到端更好?

对比对象:直接端到端联合训练或Free-Latent变体。

端到端的根本局限:如果一开始就让所有组件可训练,$z$ 没有任何监督信号,会漂移到无意义的状态。action expert一旦发现 $z$ 不可靠,就会学会绕过它——触觉通路名存实亡。

三阶段的根本性改变:

  • Stage 1的锚定作用:通过InfoNCE + reconstruction,$z$ 被强制绑定到"真实的未来接触"上。92.3%的检索准确率提供了经验性的锚点保证。
  • Stage 2的依赖建立:通过mask prefix,action expert被迫学习依赖 $z$。这一步建立了"触觉通路 → 动作"的因果链。
  • Stage 3的协同优化:依赖关系建立后,再放开所有参数协同优化,触觉通路不会被打散。

因果链:Stage 1锚定 $z$ 的语义 → Stage 2强制expert依赖 $z$ → Stage 3协同优化保留依赖 → 触觉通路真正参与决策。

6.3 为什么ALTER能从次优数据中学习?

对比对象:π0.5的χ₀分类器(二元成功/失败标签)。

χ₀的根本局限:它只看"最终是否成功",但长程任务中大部分轨迹是"部分成功"——你无法仅从最终结果判断某个中间动作是好是坏。这种稀疏的二元标签无法提供细粒度学习信号。

ALTER的根本性改变:

  • 标签粒度改变:ALTER用进度模型 $A_\theta$ 给每个状态打标签,而不是只给整条轨迹打标签。每个stage保留top 30%($\rho=0.3$)作为positive——这提供了密集的优势信号。
  • 标签来源改变:标签来自两类信号——(a)clean demonstrations的dense progress-difference(回归目标),(b)部署日志中的事件比较(hinge loss)。两类信号互补:前者保证语义正确,后者引入真实部署中的失败模式。
  • 优化目标改变:把RL问题转化为条件序列生成——策略学会在"Advantage: positive"条件下生成动作,部署时直接用这个条件。这绕过了Q函数估计的难题,天然兼容flow-matching架构。

因果链:进度模型 $A_\theta$ 学会识别任务进度 → 在每个stage内挑选top 30%状态作为positive → 策略学会在positive条件下生成高质量动作 → 部署时用positive条件触发 → 长程任务从60%提升到75%。


七、必要知识反推

假设找一个完全没有知识和信息的人去做这个工作,他必须掌握哪些知识?

7.1 领域知识层:机器人操作与触觉感知

必须掌握:

  • 机器人操作基础:机械臂运动学、力控、阻抗控制。不理解这些就无法理解为什么"接触丰富"是个难题——看起来简单的插入任务背后是亚毫米级精度 + 力反馈闭环。
  • 触觉传感器原理:视-触觉传感器(GelSight、DIGIT、UniVTAC)如何把接触变形翻译成图像。不理解这个就无法解释为什么触觉可以当作图像流处理。
  • 接触力学:摩擦、滑动、法向力、切向力。不理解这些就无法设计有意义的contact-difference field和重建目标。

为什么必须:没有这些基础,就无法理解"当前触觉记录的是已发生接触"这一关键洞察——这个洞察直接驱动了预测性触觉通路的设计。

7.2 方法论知识层:VLA模型与离线RL

必须掌握:

  • VLA基础模型:π0 / π0.5的架构——vision-language backbone、action expert、flow matching。不理解这些就无法把触觉通路正确地"插"进已有策略。
  • 流匹配(Flow Matching):动作生成的去噪过程。不理解这个就无法解释为什么ALTER的"条件生成"思路天然兼容——flow matching本身就是条件生成。
  • 对比学习与InfoNCE:对称InfoNCE损失的设计与batch内检索机制。不理解这些就无法设计Stage 1的grounding目标。
  • 离线RL困难:distribution shift、Q函数过估计、return-to-go标定。不理解这些就无法解释为什么ALTER要回避Q函数、改用二元标签。
  • 自监督视觉表征:DINOv2的class token与patch token语义。不理解这些就无法解释为什么冻结DINOv2是合理选择。

为什么必须:这些方法论知识决定了N₀-VTLA的每一个设计决策——从为什么用DINOv2编码触觉,到为什么三阶段而非端到端,到为什么ALTER用条件生成而非Q-learning。

7.3 工程知识层:大规模训练与评估

必须掌握:

  • 大规模数据采集与schema统一:如何让单臂、双臂、UMI手持的不同传感器数据共用同一canonical schema。不理解这个就无法构建NeoData。
  • 触觉仿真器:UniVTAC如何模拟触觉传感器读数。不理解这个就无法解释仿真数据如何与真实数据共用schema。
  • 真机评估设计:如何设计能区分方法优劣的benchmark——9个NeoReal任务、3个长程任务的选择逻辑。
  • Counterfactual Probe设计:如何通过"移除触觉"的反事实实验证明触觉通路真的起作用。

7.4 知识融合的关键节点

这篇论文最耀眼的创造节点有三处:

  1. “预测性触觉"的洞察:融合了"触觉记录已发生接触”(领域知识)+ “动作chunk决定未来接触”(方法论知识)+ “用对比学习监督未来预测”(工程知识)。这三个知识在"预测性潜在token"上产生了化学反应。

  2. 三阶段mask策略:融合了"action expert可能走捷径绕过触觉"(方法论洞察)+ “通过mask强制建立依赖”(工程手段)+ “stage-wise展开可训练surface”(训练知识)。这个设计没有深层知识是无法想到的。

  3. ALTER的二元标签化:融合了"长程任务的进度是连续的"(领域知识)+ “成对比较比绝对评分更容易”(学习理论)+ “flow matching天然支持条件生成”(方法论知识)。把RL问题转化为分类问题是跨域迁移的神来之笔。


八、论文中可以提取的通用性灵感

灵感1:用"预测未来"而非"记录当下"作为条件信号

核心思想:当一个模态的当前读数存在因果错位(记录的是已发生事件)时,用它来条件化决策会引入滞后。解法是让模型预测该模态的未来状态,用预测结果作为条件。

论文证据:N₀-VTLA不直接用当前触觉token $g$,而是用predictor输出的 $z$(预测未来50步接触)。Stage 1训练后 $z$ 检索future target达92.3% top-1。Counterfactual probe证实触觉通路在free space沉默、接触时刻激活。

推广场景:

  • 自动驾驶:当前帧雷达点云记录的是"已发生的障碍",预测未来点云作为规划条件。
  • 对话系统:用户当前发言反映的是"已形成的意图",预测用户下一步意图作为回复条件。
  • 金融交易:当前价格反映"已成交订单流",预测未来订单流作为做市决策条件。
  • 推荐系统:用户当前点击反映"已展示内容偏好",预测未来兴趣作为推荐条件。

灵感2:稀疏沉默模态不应进入密集prefix

核心思想:当一个信号在大部分时间是稀疏/沉默的(只在关键时刻激活),把它直接塞入信息密集的prefix会被淹没。正确做法是给它独立的通路 + 独立的投影 + 受控的接入点。

论文证据:触觉信号在操作的大部分时间(接近、运输)几乎为零,只在接触瞬间激活。如果把触觉token放入VL prefix,它要么被淹没要么引入噪声。N₀-VTLA给触觉独立的通路,通过predictor + latent-to-expert projection接入action expert,prefix不能反向attend到latent。

推广场景:

  • 多模态LLM:罕见模态(如医学影像中的病灶标注、代码中的bug标记)不应直接拼入token序列,而应通过独立的adapter接入。
  • 异常检测:罕见异常信号在正常时间沉默,直接拼入特征会被淹没,应通过独立分支处理。
  • 客服系统:用户情绪信号在大部分对话中沉默,只在关键时刻(愤怒、满意)激活,应通过独立通路影响回复生成。
  • 系统监控:错误信号在系统正常运行时沉默,只在故障时刻激活,应通过独立通路触发应急响应。

灵感3:通过mask强制建立依赖关系

核心思想:当你想让模型学会依赖某个新组件时,直接训练往往会让模型走捷径绕过它。解法是临时mask掉其它信息通路,强制模型只能通过新组件完成任务,待依赖建立后再恢复。

论文证据:Stage 2中mask掉action queries对vision-language prefix的keys/values,强制action expert只能通过 $z$ 获得信息。Stage 3恢复prefix但依赖关系已建立。

推广场景:

  • 多模态融合:想让LLM学会依赖图像,训练初期mask掉文本线索,强制其通过图像理解任务。
  • 模型可解释性:想让模型依赖因果特征而非虚假相关,训练时mask掉虚假相关线索。
  • 团队管理:想让团队学会使用新工具,初期禁止使用旧工具的捷径,待新工具使用熟练后再放开。
  • 教育:想让学习者掌握新方法,初期禁止使用已掌握的旧方法的捷径。

灵感4:把RL问题转化为条件生成

核心思想:当离线RL的Q函数估计困难时,可以把"最大化回报"转化为"在优势正的条件下生成动作"——把决策问题变成条件序列生成问题,天然兼容flow matching / diffusion架构。

论文证据:ALTER不学Q函数,而是给每个状态打二元优势标签,用"Advantage: positive/negative"文本条件训练策略。部署时始终用"Advantage: positive"。在3个长程真机任务上达到75-95%。

推广场景:

  • 对话系统对齐:把RLHF的回报最大化转化为"在高优势回复条件下生成",天然兼容SFT流程。
  • 代码生成:把"生成正确代码"转化为"在’通过了测试’条件下生成",用已有正确/错误代码做条件训练。
  • 推荐系统:把"最大化用户满意度"转化为"在高满意度用户的行为模式下生成推荐"。
  • 内容创作:把"最大化传播"转化为"在高传播内容的风格条件下生成"。

灵感5:阶段时长校准的进度信号

核心思想:当不同任务、不同阶段的持续时间差异巨大时,用绝对时间作为进度会失真。解法是用clean demonstrations中每个阶段的平均持续时间做权重校准,得到跨任务可比的归一化进度。

论文证据:ALTER用 $\bar{d}_k$(阶段 $k$ 在clean demos中的平均持续时间)校准进度,得到 $\phi_t \in [0,1]$ 跨任务可比的进度信号。这个校准让进度模型能在不同任务间迁移。

推广场景:

  • 项目管理:不同项目阶段持续时间差异大,用历史平均持续时间校准进度,而非绝对时间。
  • 学习路径个性化:不同学生学习不同章节耗时不同,用群体平均时长校准每个学生的进度。
  • 生产流程:不同工序耗时差异大,用历史平均工时校准生产进度。
  • 健康康复:不同康复阶段持续时间因人而异,用群体平均时长校准个人康复进度。

灵感6:从成对比较中学习比从绝对评分中学习更稳定

核心思想:给模型看两个样本问"哪个更好",比让模型直接打绝对分更容易学——因为相对比较消除了评分尺度不一致的问题。

论文证据:ALTER的进度模型 $A_\theta(x_a, x_b)$ 学的是"两个观察之间谁的进度更高",而不是"给单个观察打进度分"。结合stage-level的dense regression和event-level的hinge loss,既有密集监督又有事件锚点。

推广场景:

  • 偏好学习:用户成对比较比绝对评分稳定(这是DPO的核心思想)。
  • 质量评估:让评审成对比较作品比给绝对分数更一致。
  • 排名系统:用成对比较构建排行榜(Elo评分系统)。
  • A/B测试:成对比较用户反馈比绝对评分更敏感。

附录:关键术语速查

术语含义
VTLAVision-Tactile-Language-Action,视-触-语-动模型
VLAVision-Language-Action,视-语-动模型(VTLA的不含触觉版本)
NeoData本文自建的大规模视-触机器人数据集
NeoReal本文的9任务真机评估基准
NeoSim本文的12任务仿真评估基准
UniVTAC触觉传感器与仿真器标准
Predictive Tactile Pathway预测性触觉通路,N₀-VTLA的核心架构创新
ALTERAdvantage-Conditioned Offline RL,本文的离线策略改进方法
DINOv2自监督视觉编码器,用于触觉图像编码(始终冻结)
InfoNCE对比学习损失,用于Stage 1的predictor锚定
Flow Matching动作生成范式,基于去噪扩散
χ₀π0.5的二元成功/失败分类器,作为ALTER的baseline对比

总结

N₀-VTLA是触觉感知进入VLA基础模型时代的标志性工作。它的三大贡献——大规模触觉预训练、预测性触觉通路、ALTER离线策略改进——共同回答了"如何让机器人不仅看见、还能摸到并从失败中学习"这个根本问题。

最深刻的启发不是某个具体技术,而是其结构化思维:它把"触觉应该何时影响决策"作为第一性问题(而不是"如何编码触觉"),用"预测未来接触"避免因果错位;它把"如何建立新通路的依赖"作为工程难题,用mask策略强制建立依赖;它把"如何从次优数据学习"作为优化问题,用二元标签转化为条件生成。这种先定角色再定机制、先建依赖再优化的思路,远超出机器人领域,值得在多模态融合、离线学习、条件生成等广泛场景中借鉴。