硅谷101 这期节目(主持人陈倩)走进了触觉传感器公司的一线实验室,讨论一个正在从"锦上添花"变成"必选项"的技术:机器人触觉。黄仁勋在多个场合把触觉称为"具身智能的最后一块拼图",而节目采访的几乎所有嘉宾在 2026 年这个时间点都给出了同一个判断——触觉已经处于爆发前夜。但与此同时,这个行业的可用训练数据"基本为零",把触觉信号直接输入现有模型反而会让任务成功率下降。本文按节目脉络梳理:为什么触觉重要、五条技术路线各自卡在哪、数据困局如何破解、模型侧的路线分歧,以及规模化的真正瓶颈。
为什么触觉突然变得重要:成功率是个伪命题
节目开场用了一个直观的实验:一堆花生里混着几颗石头做的假花生,人靠看几乎全猜错,搭载了触觉传感器的机器手却全部选对——因为假花生更冰凉、更光滑、更重,咬合时也缺少真花生果肉的震动感(转写原词有音误,疑为"咬合震动感")。这个例子背后是行业的一个基本共识:很多任务无法单靠视觉完成。节目引用了一个业内实验:把正常人手部的触觉神经短暂麻醉后,拧东西、抓握、系扣子这些操作立刻失灵。
更有意思的是对"无触觉机器人成功率也很高"这一反驳的回应。业内人士指出,成功率高不等于可用性强:只靠视觉的机器人动作极慢,每次微调一毫米、不断试错,“总归能完成任务”,所以只看成功率其实是个伪命题。力信息才是效率的关键——握多紧、两个物体有没有咬合、拧螺丝时力有没有过大(等视觉发现螺丝拧花就太晚了)、柔性操作中每根线的软硬度。
节目把触觉拆成两个维度:一是力的感知,又分静态力(抓握时持续施加的压力,告诉你捏得够不够紧、物体有多硬)和动态力(物体滑动时的高频信号,告诉你是不是要掉了、摩擦力够不够);二是形态学感知,即分辨不同材料——苹果和橘子、光滑和粗糙、摩擦时的振动频率。这些维度放在机器身上如何识别,就引出了五大技术路线之争。
五条技术路线与一个"不可能三角"
目前市面上的方案主要有五种,节目逐一拆解了原理与优劣:
| 路线 | 原理 | 优势 | 短板 |
|---|---|---|---|
| 压阻式 | 材料受力形变,电阻变化反推压力(电子秤原理) | 最传统成熟、便宜、门槛低 | 只能测垂直方向力,随温湿度漂移 |
| 压电式 | 石英、PZT 陶瓷受力时内部电荷中心偏移产生电压(类似打火机放电器) | 只对变化的力敏感,适合振动、冲击等高频动态信号 | 按住不动信号衰减到零,难以测静态力 |
| 电容式 | 平行板电容器受力形变,电容变化,可测三维力 | 灵敏度极高、响应快、成本较低 | 动态范围有限、易受电磁干扰 |
| 光学式(视触觉) | 顶层柔性材料形变,照明层打光,底部摄像头拍下形变后算法反算力分布 | 精度最高、同时解算接触形貌和接触力,行业最热 | 成本高、结构复杂 |
| 磁感应式 | 弹性材料加磁性颗粒,磁传感器捕捉磁场变化反算形变 | 结构类似光学式,可推三维力 | 易受电磁干扰、分辨率有限 |
此外还有磁流体、超声等小众路线,节目未展开。采访嘉宾认为,对机器人触觉来说多传感器结合也许是更好的方案——理由来自人体本身:指尖精度要求高,适合用光学式拿高分辨率;手掌、手臂面积大且精度要求没那么高,用昂贵的光学式不划算(大面积光学模块设计非常困难),压阻或电容更容易覆盖。节目在展会(转写作"BOSE 的展会",疑为 CES 音误)上已看到电容式传感器批量用于工厂分拣和检测,采购价约为光学式的四分之一到二分之一。即便是同一部位,未来也可能融合多种技术——电容灵敏度高但压紧后量程受限,压阻"必须硬碰硬",两者结合可行,前提是制造工艺、良率和量产能力跟得上。
光学式是当前精度最高、也最热门的路线,节目花了最大篇幅拆解。这条路线源自 MIT 教授 Edward Adelson 团队 2009 年提出的 GelSight,让机器人第一次拥有了"类似视觉"的触觉。分辨率上它已经超过人类:人一个指尖约一平方厘米、三千个触觉感知点、每个点下面约四个神经元(合计约一万两千),而受访公司(节目中先后写作"一木科技"和"移目科技",应为同一家,转写存疑)的传感器可以做到 24 万个感知点。
代价是一连串工程难题。材料上存在不可能三角:要软(杨氏模量低,才能细致反映硬度和力度)、要耐磨(否则久了性能漂移)、要薄(缩小传感器尺寸),三者天然对立,只能找平衡。行业出现了类似皮肤自愈的"可恢复性材料"——特殊官能团让断裂的分子键可以恢复,新型材料已经软到"像婴儿皮肤摸起来没有伤害"。结构上,视触觉背后需要感光芯片,微距成像需要物理距离,这是最底层的制约;该公司用自研超表面和芯片技术压缩视距、不用传统镜头,并做大量"光追踪"仿真设计照明光路(保证 270 度覆盖且光路可预测,否则光与光之间会串扰),甚至自己搭了价值百万级的 BSDF 光学测试装置。算法上有三种:标记点法(几十个 marker 点就是分辨率上限)、纹理分析法(光学鼠标就是简化版,但触觉需要三维解算、计算量大延迟高)、光度立体法(RGB 三色光从不同方向打光,逐像素分析颜色算形变,是精度与算力的折中)。成本上目前千元级,随出货量上升有望降到小几百元,但视觉模型大、算力要求高也是隐性成本。
数据困局:要采集触觉,就得先屏蔽触觉
模型侧之前,触觉的第一道障碍是数据。节目给出的判断很直接:“现在的触觉数据基本为零,可用的数据基本为零。“原因在于触觉强调实感,互联网上的视频和文字无法反映力的大小和方向,这个领域尤其依赖真机数据——而真机采集存在三大难点。
第一是采集悖论:采集人的触觉,就得在人手和物体之间垫一层传感器,而这恰恰屏蔽了人自己的触觉。节目用戴厚手套拿豆腐做了类比——要么滑下去,要么捏破,因为你判断不了摩擦力和形变程度。手套越厚,操作者的 demonstration 质量越差,训出来的数据就越无法让机器人拥有人的灵巧。解法是做更薄的传感器(该公司下一代产品仅 3 毫米,只在关键部位贴触觉点)和更符合人体工学的采集设备——嘉宾坦言这是与传感器设计"完全不相干"的学科交叉问题,也是接下来一年的重要课题。
第二是数据密度不够:目前最好的织物触觉手套一只手只有约 500 个感知点,与高分辨率传感器之间 gap 很大——戴着它抓一颗 M2 螺钉,螺钉上只对应一个点,根本测不出受力方向和大小,“模型再强也学不到”。节目提到于涛团队(北美)去年与 MIT 的合作:用这类手套采集的数据,大部分有效样本都是整个手掌抓大物件(对密度要求最低的任务),一旦涉及精细操作数据就失效。
第三是格式不统一:行业太早期,各家公司采集设备不同(两指夹爪设备不适合灵巧手训练)、数据格式各异,存储与对齐做得也不够好——触觉与视觉、本体感觉等模态在时间轴和数据本身上的对齐能力都是缺失的。嘉宾概括了一个恶性循环:设备不成熟→采不到高质量数据→训不出好模型→没人投资。
破解规模化难题的另一条路是仿真,这也是英伟达重点押注的方向,配套框架是 Isaac Lab。做法是把公有模型加入真实物理特性(螺母是刚性的、重的、表面光滑;毛线球多软、多重、表面多粗糙),再输入传感器特征(弹性体物理特性、光源分布),模拟接触形变和光路变化生成触觉数据,并用真机表现标定修正。今年五月一篇论文(节目读作 Taboro,转写存疑)提出了更巧妙的数据复用:把已有机器人数据的轨迹重新放入 Isaac Lab 并加入触觉模拟,批量生成视觉、触觉、语言、动作完整数据。核心难点是计算量——用有限元精细计算弹性体变形,一帧要一个小时。英伟达 2025 年发布的论文(节目读作 TechSL,转写存疑)用"软接触模型"替代有限元:物体和皮肤都当刚体但允许互相穿透,力越大穿透越多,精度略降但速度快得多。
仿真与现实永远有差距。Eric(受访公司创始人)称他们仿真的准确率在 90% 以上,剩下 10% 的差距主要在柔性物体的模拟,可以用少量真机后训练数据补齐——“八十分的模型加一点后训练就能到九十分以上”。TechSL 的训练策略印证了这个思路:随机化物理参数、对触觉图像做大量数据增强,最终在真机插拔销钉任务上实现零样本迁移,成功率 82.7%。真机与仿真的配比各家不同,短期判断是至少一比一,甚至仿真占多数。
数据量需要多少?节目采访了具身模型公司 Physical Intelligence 的嘉宾,其给出的参照系是:一百万小时约等于一个人一生的物理经验,“什么时候能收到一百万小时数据,可能我们才开始后面的探索”。但触觉有个乐观的例外——所需数据量只有视觉的十分之一,十万小时以上就开始出现泛化能力。原因是机器人行为数据里大量内容是转身、伸手、移动等过程信息,真正有效的是拿起、放下等关键操作;而触觉在无接触时输入基本为零,十万小时已经自动剔除了无效部分。
模型之争:加了触觉反而掉点,怎么用才是真问题
触觉的第二道障碍是算法模型。今年六月,伯克利、英伟达、斯坦福的学者(含李飞飞、Jim Fan)联合发布的论文(节目读作 T-Rex,转写存疑)给出一个反直觉的实验结果:把触觉信号直接输入 Pi 0.5 模型,各项任务的成功率反而下降了。加一个模态不等于模型变好——如何利用触觉信号,目前是最大挑战之一,因为大家对触觉模态还比较陌生,也还没有一个完整跑通训练闭环的 SOTA 模型。
此前触觉应用有三大挑战:一是触觉没法用规则定义(软还是硬、超过多大力度会破坏物品,纸杯稍变形可以接受,鸡蛋绝不能有形变);二是触觉信号维度太多,纵向压力、横向剪切力、摩擦力、温度、震动不加处理地输入模型就成了噪声;三是频率不匹配,触觉天然高频而视觉语言模型低频运行,直接结合会导致计算资源浪费、反应慢、噪声干扰高层规划。
AI 的进步正在逐个拆掉这些障碍。节目强调:触觉最近两年火起来,不是因为技术本身这两年才存在,而是长期"不知道怎么用”——端到端模型的成熟改变了这一点。端到端让模型自己学规则,解决了第一个挑战;自监督训练的编码器(tactile transformer encoder)把各类触觉模态甚至视觉打包成语义理解(软硬、摩擦、形态),再通过 attention 机制集成进更大的 backbone,解决了第二个挑战;第三个挑战则由论文中的 MOT 架构(借鉴 MOE 思想,转写存疑)解决——它设了三个专家:latent expert 处理视觉语言、做慢速认知预测;action expert 生成粗略动作序列;最关键的是 tactile expert,像机器人的反射系统,在动作执行中以更高频率独立运行、实时修正力度和角度。异步执行是点睛之笔:推理时复用已算好的上下文缓存,只做快速触觉推理,既保留大模型的理解能力,又获得类似人类触觉反射的快速响应——这与双系统架构的思想一致,system two 慢思考长程规划,system one 快反应管本能,触觉在边缘端快速响应的同时也把信息送回"大脑"影响长程决策。
业界在更根本的问题上存在分歧:触觉模型该单独训练,还是与视觉、激光雷达一起训练?Eric 倾向单独训练——触觉模态的语义理解本身可以形成闭环,训练测试闭环之后再与其他模态融合,模块可以像插件一样插进不同系统,跟其他模态对齐也更容易;混在一起训则"眉毛胡子一把抓”,模态间数据怎么平衡是个难题。北美的于涛则认为必须同时训练:视觉是全局的,触觉是非常局部的——手的形态一动,同一个传感器对应的空间分布就变了,要判断力在空间中的分布就需要触觉与视觉结合;同一 embodiment 内可行,跨 embodiment 的 transfer 非常难。他提到哥大李云竹老师(转写存疑)的工作是把触觉力分布结合到三维点上——力不只是"一个力",而是空间中的分布。于涛的思路对应 Taboro 论文:触觉应参与高层决策,理解"轻一点、重一点"的语义。简单概括两条路线的分野:Taboro 主打前置的语义力控,T-Rex 主打执行过程中的高频修正。节目强调,行业早期多路线并行探索,没有绝对优劣之分。
规模化、市场空间与"第一语言"
触觉的第三道障碍是量产,最大难题是性能一致性。上周的维也纳学术会议(转写作"ECHA 2026",疑为 ICRA 2026 音误)上,节目团队亲手测试了多家触觉传感器公司,发现大多数做不到一致——精密操作中输出力稍有偏差就可能导致任务失败,而弹性体厚度、弹性系数、传感器间距的细微差异都会造成参数偏差。这家公司的应对是两条产线协同:自动化量产线稳定交付标准品,试产线承接定制化需求和新工艺验证——试产车间里凝胶固化需要在局部百级超净工作台完成,气泡杂质靠视觉加上位机双重筛选,大量步骤仍依赖手工,因为这个品类太新,标准化自动化设备还没有统一;而且量产无法脱离上下游,数采设备、灵巧手各有协议接口,定制化不可避免。节目认为,两条线协同运转正是行业走向成熟的标志。
需求侧的信号已经出现:受访嘉宾表示今年触觉需求大幅上涨,行业认识到触觉数据对物理 AI 训练出更好的模型"非常重要";灵巧手上下游和具身智能整机都在拼命做出货,自然带动触觉传感成熟。CES 展会上已看到某大型汽车电池装配工厂把触觉传感器装上机械臂——电池包形态频繁变化,传统预编程自动化无法适应产线频繁调度,基于触觉获得了柔性装配能力;未来还会走向实验室的毫克级精密取液等场景。市场空间方面,节目引用美国银行预测:2030 年人形机器人出货量将达 120 万台,假设都装配触觉、每台十根手指,触觉传感器需求将达千万级。按量产倒推一到两年的研发测试周期,嘉宾判断产业里程碑"就今年或今年年初这个时间段发生"。
结尾处节目升华了触觉的意义:它不只是多了一个维度的数据,更是让机器人掌握了"人类的第一语言"——婴幼儿出生后最先依赖的不是看和听,而是伸手去摸妈妈的脸、摸床单的材质。Adelson 提出 GelSight 的灵感也源于观察小孩时发现触摸对他们更有吸引力。今天我们正在教机器人做同样的事:摸花生、摸树叶、摸鸡蛋,每摸一次,对物理世界的理解就多一点。或许多年后回望,转折点就在触觉普及时——那一刻,机器人才开始真正理解世界。
几点说明:本文依据节目转写整理,测试演示(花生挑战、夹薯片夹树叶)、公司数据和预测均为节目及受访嘉宾所述,未经独立核实。转写中无法确认的专名已标记:受访公司"一木/移目科技"两种写法并存、论文 Taboro/TechSL/T-Rex/MOT 均按节目读音记录、“ECHA 2026"疑为 ICRA 2026、“BOSE 展会"疑为 CES。