先说结论
2026年9月3日,特斯拉在奥斯汀发布了无方向盘、无踏板的原生无人车Cybercab,几天后向公众开放付费乘坐——这是特斯拉FSD(Full Self-Driving,完全自动驾驶)发展十三年后交出的最新答卷。硅谷101这期节目横跨数月制作,采访了在特斯拉工作近十二年的AI硬件工程师Carrie Liu和前AI软件工程总监Sreehari(曾负责Robotaxi与Optimus的AI工程团队),从硬件和软件两条线拆解了FSD的进化史。真正值得读的故事不是"特斯拉又赢了",而是三层结构性事实:第一,FSD的历史是被极致成本控制反复倒逼出来的技术路线——供应商绝裂、自研芯片、砍摄像头、删雷达,几乎每次重大技术决策背后都是马斯克"第一性原理+抠门"的双重驱动;第二,端到端神经网络的豪赌(30万行代码砍到2000行)在2023年前后被ChatGPT的爆发加速,如今V14模型参数较V12时代提升十倍,FSD V15瞄准10月底发布、参数规模再扩十倍以支持L4;第三,外部核验显示奥斯汀注册Robotaxi达476辆(409辆Model Y+67辆Cybercab,9月22日得州DMV数据),但社区追踪显示9月单周实际载客的活跃车辆一度只有约8辆——注册数与活跃数的巨大落差,正是特斯拉"规模叙事"与"安全验证"之间张力的最直观证据。
一、从黑盒分手到自研豪赌:FSD硬件十三年
故事从2013年开始。特斯拉决定做自动驾驶时最先找的是谷歌,但谷歌"高精地图+激光雷达"方案太贵,不符合马斯克的第一性原理;谷歌主张直接做L4,马斯克坚持先L2再迭代,双方分道扬镳——自动驾驶自此分成两条路线,争论至今。特斯拉选择了Mobileye供应商方案,2014年10月发布Hardware 1.0:一个前置摄像头、一个毫米波雷达、十二个超声波传感器,芯片为Mobileye IQ3。按Carrie的说法,这是"当时车规技术局限下没有别的选择"的方案。
真正的转折在2016年。5月7日佛罗里达州Model S撞拖挂货车致死事故后(系统未识别出横置的货车,节目称Mobileye事前曾警告特斯拉禁止双手离开方向盘未被当回事),双方合作彻底谈崩。Carrie揭示了分手的真实原因不是事故本身,而是黑盒模式的结构性矛盾:感知算法完全由Mobileye垄断,特斯拉只在规划与控制层主导,接口之下的内容拿不到控制权——“你想跨越或更改接口,但你没有控制权,这非常阻碍特斯拉开发”。2016年10月发布的Hardware 2.0换用英伟达Drive PX2、摄像头扩到八个,十个月后又追加GPU冗余推出Hardware 2.5,这是双芯片冗余架构的雏形。
自研芯片的豪赌同年启动。2016年1月马斯克挖来芯片设计传奇人物Jim Keller(AMD K7/K8与Zen架构、苹果A4/A5设计者),2月Peter Bannon(近四十年计算系统设计经验,领导过苹果A4到A9开发)加入。在两位芯片大神和三星团队帮助下,第一款自研FSD芯片AI3仅用18个月设计完成,2017年12月首次流片即基本无缺陷——Carrie强调这在芯片行业"凤毛麟角",多数芯片第一次流片连开机都难。AI3专为自动驾驶场景定制,相比Hardware 2.5的英伟达Pascal通用芯片,神经网络算力提升五倍以上,有效利用率达80%(通用芯片因线程调度、分支预测等开销,实际利用率难跑上去)。行业背景是:2016年时"业界没有一款从零设计的神经网络加速器,大家都在给CPU/GPU/DSP加指令"(Peter Bannon在AI Day的表述,节目引用)。
但AI3量产前三个月,团队几乎崩盘。软件团队同时支持量产中的Hardware 2.5和开发中的Hardware 3,人手严重不足,Carrie的硬件团队只能"自己hack、自己传软件、自己写指令来模拟",他称那是"在特斯拉最忙的三个月,基本没有休息"。这背后是马斯克持续至今的极度控制编制偏好——“他不喜欢招人,到今天FSD软件团队人也都很少”。
二、供应商博弈与两个关键决策失误
自研芯片带来的成本优势和主动权,背后是两个与供应商周旋的故事,以及两个后来被证明失误的决策。
TI压价故事被Carrie讲得极具细节:2018年底特斯拉现金流承压,要求TI全线降价被拒后,Carrie直接把整套TI芯片换成ADI同功能产品(“无论硬件软件都要做很多测试和开发,但我不管,必须换”),TI因这块业务占其营收重要份额反过来求情,CEO都跑来沟通,最终接受全线降价,一年省下约2000万美元,马斯克专门发信感谢。英伟达的故事则是配合度:特斯拉请求英伟达显示芯片温度传感器数据——“三行代码的事”——英伟达来回扯皮一周、要求付费、再等一周,这种合作模式让马斯克无法容忍。Carrie补充了一个判断:英伟达直到今天的Thor芯片仍是通用芯片,而"马斯克不希望被任何一家公司牵着鼻子走"。
第一个决策失误是摄像头。Hardware 4.0把像素从120万提到500万(车载场景优先稳定性、帧率而非堆像素——远距高速信号传输决定了不能无脑上亿级像素),同时马斯克以"人就两只眼,你放那么多摄像头干嘛"的第一性思维砍掉了前挡风三个摄像头中的一个。Carrie团队当时建议若前面只剩两个摄像头,应在车头位置补一个,被否。砍掉后出事了:此前毫米波雷达可探测前向距离,移除雷达后前保险杠位置成为盲区,停车场景可能碰撞。Carrie评价马斯克的逻辑"人开车也看不到车头下面有什么"有道理——人靠记忆——但车的记忆"需要专门训练模型",并不简单。从Cybertruck开始特斯拉又在前保险杠重新加上摄像头。这个反复展示了特斯拉的组织特征:老板有强判断,也允许被证伪后快速回改。
第二个决策失误是GDDR内存。AI4研发时真正卡脖子的是内存带宽而非算力——“一百个工人但高速公路一次只能运二十人的材料”。马斯克为追求带宽选了游戏显卡常用的GDDR(内存带宽排序:LPDDR<DDR<GDDR<HBM,功耗递增),但车规场景没人做GDDR,功耗高、价格高、厂商少,“不可能因为特斯拉一家让美光或三星专门研发大容量车规GDDR”。结果AI4流片三四次、严重延期,用了几年后内存容量成了瓶颈。Carrie说他是"唯一提出这个问题的人,但没人愿意听",现在特斯拉内部在做Hardware 4.5(播客称"哈佛四点三")改回LPDDR,牺牲一点带宽换容量。转写中"哈弗尔/哈佛"均为Hardware音误。
芯片数量的拉扯同样戏剧化。软件团队先说服马斯克"三颗芯片才能做FSD",三芯片架构(涉及复杂冗余判定逻辑)设计完成后,量产前一两个月项目管理提起"到底用两个还是三个",马斯克(转写中的"伊朗"为Elon音误,经上下文判断全部指马斯克本人)以"太贵了"为由最终裁定两颗:“这是最终决定,谁也不要再商量。“Carrie吐槽软件团队"你给我十倍算力,我能把它用掉”——算力永远不够的背后,是他认为模型团队人手太少、把精力放在扩大模型而非优化模型上,“至少特斯拉情况比较明显”。
三、算法线:从Karpasi重构到端到端豪赌
软件线的第一推手是Andrej Karpathy(转写"EdgeCapathy"为音误)。2017年Transformer论文发表后,这位三十岁的年轻人离开OpenAI,被时任OpenAI联席董事长马斯克挖到特斯拉直接汇报。Carrie点出他最大的价值首先是"recruiting”——“没有他,一个top AI talent毕业生为什么要去车厂?“2018到2021年间,感知模块完成了四大升级:用神经网络重构车道线/车辆/行人检测;HydraNet架构让所有任务共享一个特征提取Backbone、只在顶端分出任务Head(树干共享养分、树枝各长各的);从看图片转向看视频(利用时序信息获得短暂记忆,解决遮挡后目标持续追踪);Transformer加持的鸟瞰图BEV融合八摄像头信息投射到统一俯视坐标系(2.5D空间模型)。Carrier补充这些创新"不是特斯拉独有,更多是学界研究”。
2021年5月移除全部雷达的决策,Carrie揭示了教科书之外的真相:表面是"特斯拉内部认为融合多传感器增加算法负担和维护工程量”,实际催化剂是疫情供应链断裂——毫米波雷达供应商大陆集团(Continental)供不上货,谈判升级到马斯克与供应商CEO通话层面,“不配合的供应商就都被拉黑了”。而软件团队本该提前在算法中移除雷达的工作因人手不足一拖再拖,疫情只是压垮骆驼的最后一根稻草。去掉雷达后测距精度大幅下降,只能靠纯视觉预估速度,软件团队"进入新的作战模式",但据员工回忆此事反而鼓舞了士气——“验证了团队能力,也证明了马斯克方向是对的”。
十四个月后,2022年AI Day发布了占用网络(Occupancy Network):把周围空间划分成立方体小方块(体素voxel),被占据即有障碍。这解决了 bounding box 的表达缺陷——铰接公交车转弯时非长方体、挖掘机臂的长度高度决定能否从下穿过,3D占用表达天然更泛化。训练难题(无激光雷达点云做ground truth,人工标注3D场景成本是标物体框的十倍以上)靠特斯拉自研自动标注系统解决——值得注意的是,特斯拉内部确有少量配激光雷达的特殊车辆专门采集ground truth。
真正的豪赌是端到端。2022年7月Karpathy离职(转写Ashok “Ila Swamy/Elluswamy” 音误,软件团队创始成员接任),外界猜测技术困难股价下跌。转机来自马斯克收购Twitter后想抽调特斯拉工程师优化推荐算法:工程师Dhruv Shroff(转写"Davos Shroff"存疑)以"我在做车用的ChatGPT"留下——用神经网络替代所有规则算法,通过模仿人类驾驶学会开车,面对未见场景也能避障,必要时做出压实线避障等类人灵活判断。Shroff的解释击中了马斯克。2023年8月底马斯克直播FSD端到端首次公开演示(随机标记路径点,虽闯红灯被嘲,业内人士评价"全新技术路线做到这样已是强信号"),年底员工内测,2024年1月面向车主推送V12——30万行代码精简到2000行。前AI总监Sreehari证实端到端探索在ChatGPT之前就已开始,ChatGPT加速了进程;且V12并非抛弃前作,Karpathy时代的物体检测、occupancy网络"是下一步的种子"。V12的BEV显示输出由网络中间额外分出的一个"阑尾"任务头专门负责,除显示外不参与功能。
此后的进化沿着"验证→简化→扩张"推进:V13(2024年11月)让光子信息不经前置处理直接输入模型、提升帧率分辨率、优化AI芯片,被内部工程师比作SpaceX猛禽V3——Sreehari称之为"intelligence per watt"(每瓦智能)工程哲学。V14.1(2025年10月,跳过V14.0)是"V12之后第二大更新":参数提升十倍、Robotaxi技术首次大规模回流量产车、引入强化学习、升级视觉编码器、重写AI编译器。Sreehari的表述揭示了更深一层:“physical AI是个新领域,scaling law没有文献可循,我们得发明整套技术栈。“2025年底车主David Moss驾驶Model 3用FSD V14.2从加州到南卡罗来纳2732英里零接管横穿美国(约30次超充停靠全部自动泊车,FSD Database遥测验证)——这是2016年马斯克承诺"2017年底达成"的横穿美国目标,晚了八年。
四、世界模型仿真、音频输入与黑盒的三重解法
端到端的代价是黑盒:上亿token输入压缩到转向和加减速两个输出,巨大压缩比让网络可能学到虚假相关性(训练素材中驾驶员因前车刹车灯减速,模型误以为原因是旁边摇晃的树枝)。特斯拉AI软件副总裁Ashok Elluswamy近期分享的解法分三层:数据端在车端部署筛选器,只上传极限反应、复杂路况、特殊车辆等高价值片段(全量收集筛选"成本高到离谱”);可解释性让网络额外生成3D视觉表示供检查;可验证性则靠AI4服务器——一套与量产车同芯的推理集群,负责Pixel Injection像素注入(世界模型仿真训练)和推理验证(回放真实道路视频对比FSD决策与人类实际操作)。
世界模型仿真是对传统仿真的一次范式更替:传统仿真靠人工建模、定义物体、编写物理规则再渲染;世界模型直接生成每个传感器看到的内容,把建模渲染合一,还可基于已有视频延续rollout,flexibility和potential更高。但两大挑战明确:实时渲染的算力要求,以及生成世界必须足够真实(右转时行人、其他车辆的反应要符合现实演变)——这两点也是端到端黑盒验证链条上最薄弱的环节。最新的FSD算法还引入音频输入:目前主要用于识别警笛、紧急车辆等环境噪音,未来将融入语音控制指令——“人类看到的一切输入,能否都喂给AI并看到改进”。
五、下半场:经济之战与未解的规模难题
Cybercab的落地节奏比发布慢了一年:2024年10月发布(无方向盘无踏板),2025年6月奥斯汀Robotaxi试点(10-20辆Model Y),2026年9月3日Cybercab发布并随后开放付费乘坐。硬件上Robotaxi与量产车"没有任何区别”(安全冗余优化后来也下放所有车型),关键区别在软件:Robotaxi跑内部最新最强版本,长时间测试稳定后才推量产车。Sreehari给出一个关键判断:同一套大模型,放在消费者特斯拉上是L2,放在获政府许可的Robotaxi车队里就是L4——“技术不再是问题,现在是validation和regulation的游戏,是deployment的游戏……谁有对的基础设施能更快scale。“远程监管是当前每公里成本高昂的原因(“包含盯着我们的这些人的工资”),长期靠安全数据证明后降低人工比例。
但外部核验揭示了叙事的另一面。据得州DMV登记数据(经TechCrunch、社区追踪器Robotaxi Tracker等多源交叉),截至9月22日特斯拉在得州登记Robotaxi共476辆(409 Model Y+67 Cybercab),其中Cybercab从发布日的45辆增至67辆。然而社区追踪显示:476辆注册车中仅265辆匹配到实际见过的车牌,30天内见过的179辆,而9月单周在奥斯汀实际载客的仅约8辆——与2025年6月服务启动时持平,“十五个月零净增长”(Electrek 9月22日报道)。发布周 spike 过100辆后迅速回落,评论将此归因于远程监管"不可持续”:“如果真有全自主运营,就没有理由在ramp up后缩回去。“同期Waymo以约4000辆车在15城维持每周约50万单付费订单(TechCrunch 9月24日数据),运营规模差距仍然悬殊。监管侧,NHTSA已对Cybercab启动调查并于9月10日发出正式命令,要求特斯拉9月30日前以宣誓形式提交安全认证说明——Cybercab无方向盘无踏板的设计与美国以"存在驾驶员"为前提的联邦机动车安全标准存在天然张力,特斯拉的路径是自认证合规先行上线,监管裁决预计2026年底至2027年初。
下一步的观察指标已经清晰:FSD V15瞄准10月底发布(模型参数再扩十倍至约100亿、支持L4、先在Robotaxi车队验证),AI5芯片台积电版今年4月15日完成首次流片、预计2027年量产(马斯克称特定任务速度较AI4提升40倍,业界猜测算力2000-2500 TOPS;另有三星版并行推进,Carrie猜测可能同车型混用),Dojo超算项目已于2025年8月关停(马斯克称AI5/AI6训练能力足够,资源不分散到两款差异大的芯片)。十三年过去,谷歌路线(Waymo:昂贵传感器、严格冗余、先小区域做对再扩张)与特斯拉路线(摄像头进百万量产车、不成熟系统交给真实世界、事故争议返工中前进)依然没有分出胜负——但战争已经从技术路线之争转入经济之战:Waymo要证明多城扩张的同时单量与利用率同步增长(其每周订单数已在50万平台期停留数月),特斯拉要证明远程监管的规模成本曲线能降下来。正如节目结尾所言,真正困难的问题现在才开始:没有安全员、没有方向盘、面对数百万次真实出行时,还能不能保持足够稳定的安全性。
写在最后:可迁移的三条启发
**第一,成本约束作为技术路线的塑造力。**FSD历史上几乎每个关键决策——离开Mobileye、自研芯片、砍摄像头、删雷达、GDDR——都同时是技术判断和成本决策。值得注意的反面是:成本压力也直接造成了GDDR失误和三芯片改两芯片的反复,Carrie作为亲历者的反思是"这是当时决策上的失误”。对组织的启发是:极致成本控制能倒逼创新,但需要为"逆潮流提出异议"留通道——Carrie说他是GDDR问题"唯一提出的人,但没人愿意听”。
**第二,同一技术栈、双轨部署的验证飞轮。**Robotaxi先跑最新软件、稳定后回流量产车,同一模型在消费者手中是L2、在有许可的车队中是L4——这本质上是把监管许可与地理围栏当作了系统的一部分。这种"一套模型、两种部署边界"的架构,对任何需要"渐进验证+激进迭代"并行的AI产品都是可参考的范式。
**第三,黑盒的解法不是打开盒子,而是围绕盒子建验证。**端到端让30万行代码变2000行,代价是可解释性归零;特斯拉的回答不是退回规则代码,而是车端数据筛选器+3D中间表示+世界模型仿真三层验证闭环。在AI系统日益端到端化的今天,这个思路——用生成式仿真补齐真实数据的长尾、用中间表示检查模型关注点——对所有黑盒系统的工程化验证都有借鉴意义。但它的前提是世界模型足够真实,而这恰是当前最薄弱的环节:Sreehari们发明的"整套技术栈”,最终要由数百万次真实出行来评分。