物理AI的下一站:让AI发现人类不知道的方程

机器之心对话东方理工陈云天:从"知识嵌入"到"知识发现"的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程(如海浪破碎方程),用机械臂高通量实验找色谱方程替代耗时实验;他判断AI科学家"一定到了这个节点",但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap,而通用模型"每个行业都很浅",真正的机会在把物理一致性嵌进专业模型。

August 19, 2026 · 1 min

Addressable Memory for Video World Models 精读

交互式视频世界模型在长时程生成中会遇到一个隐蔽的「记忆失效」问题:KV cache 里明明存着过去的画面,模型却读不出来。本文精读 NVIDIA/Princeton/ Toronto 联合提出的 WorldTrace 框架,它精准定位了 RoPE 旋转位置编码超出训练范围导致的「内容不可寻址」根因,并用一套无需训练的虚拟槽位机制,在时间一致性上提升 15.5%、在 LoopBench 情景回忆上提升 19.5%。本精读将从世界模型的记忆机制讲起,逐层揭开位置编码、相位抵消、虚拟槽位、规范 key 平均等关键技术。

August 11, 2026 · 8 min

N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读

N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。

August 3, 2026 · 3 min

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读

深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把’未来预测’重新定义为’在紧凑潜在空间里对一个连续速度场做积分’,靠动力学解耦 + 直接一阶 JVP 监督,一举绕开 JEPA 长期头疼的表示坍缩难题;还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上,64 帧长程预测延迟仅 0.072 秒,并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。

August 3, 2026 · 8 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min

Momenta IPO 后再访曹旭东:没有尽头的 AI,从智驾到家庭机器人的十年推演

Momenta 创始人曹旭东在 IPO 后接受「晚点聊LateTalk」专访,回顾十年创业历程,系统阐述智驾竞争格局(中国两三家、全球三四家的终局判断)、“一个飞轮两条腿"战略、每年十倍的智驾摩尔定律、从自动驾驶向家庭机器人的技术外溢逻辑,以及从 AI 研究员到 CEO 的认知进化——“一流的工作不是想出来的,是做出来的”。

July 24, 2026 · 2 min

具身原生的豪赌:蚂蚁灵波沈宇军,为什么坚持从传感器和视频里重训整个机器人模型?

蚂蚁灵波首席科学家沈宇军的深度访谈。他从GAN研究起步,经字节、蚂蚁研究院,最终主导蚂蚁灵波做机器人"大脑"。文章梳理了灵波最核心的技术主张——“具身原生”:不再沿用数字世界的模型做下游适配,而是从传感器、视频时序、单向MoE架构出发,为物理世界从头训练一套完整的机器人基础模型(V-Ren、DEPS、VLA 2.0、Video、Word六件套)。沈宇军也坦率谈到了数据是当前最大瓶颈、灵波为什么不做本体、以及他对"大脑落后于本体"这一行业判断。

July 22, 2026 · 2 min

世界模型这半年:XLR Labs 谈原生路线、4D 数据护城河与物理 AGI 的下半场

《晚点聊》WAIC 期间对话 XLR Labs(拓元智慧)三位核心成员。这家从 2022 年起就押注"原生世界动作模型"的公司,分享了它与 VLA、隐式世界模型的路线分歧,千万小时级 4D 真实交互数据如何构成护城河,以及从智慧零售切入工业物流的"以终为始"商业化逻辑——一个关于"预训练与后训练一致性"的scaling law故事。

July 18, 2026 · 2 min