在算力最多的地方做世界模型:对话英伟达Cosmos掌舵人刘洺堉

英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路,到Cosmos 3为何将语言/视频/音频/动作统一进单一模型,到"模型竞争不是零和游戏"的Low Ego哲学,再到黄仁勋的第一性原理决策与"不裁员"文化。他认为模型能力终将收敛,真正决定胜负的是生态整合;他不想击败任何人,只想帮助Physical AI整个领域成功。

August 13, 2026 · 1 min

ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读

Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。

August 12, 2026 · 6 min

Addressable Memory for Video World Models 精读

交互式视频世界模型在长时程生成中会遇到一个隐蔽的「记忆失效」问题:KV cache 里明明存着过去的画面,模型却读不出来。本文精读 NVIDIA/Princeton/ Toronto 联合提出的 WorldTrace 框架,它精准定位了 RoPE 旋转位置编码超出训练范围导致的「内容不可寻址」根因,并用一套无需训练的虚拟槽位机制,在时间一致性上提升 15.5%、在 LoopBench 情景回忆上提升 19.5%。本精读将从世界模型的记忆机制讲起,逐层揭开位置编码、相位抵消、虚拟槽位、规范 key 平均等关键技术。

August 11, 2026 · 8 min

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 精读

VLA 模型做 RL 后训练时,critic(价值估计器)通常只看单帧画面——这和机器人控制’部分可观测’的本质根本不匹配。WCM(World Critic Model)基于 LeJEPA 架构,让 critic 同时预测未来潜在状态(世界建模)和估计价值,使 critic 的表示被显式训练去捕捉时序动态。在 149 个任务上,OpenVLA-OFT 的 in-distribution 成功率达 99.0%、out-of-distribution 达 77.9%;从 0.8% 的 zero-shot 提升超 12000%;7 个真实世界任务全面超越基线。本文从’纯标量回报回归不足以学时序动态’的第一性原理,解释为什么单纯加历史帧没用、必须加世界建模目标。

August 5, 2026 · 3 min

N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读

N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。

August 3, 2026 · 3 min

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读

深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把’未来预测’重新定义为’在紧凑潜在空间里对一个连续速度场做积分’,靠动力学解耦 + 直接一阶 JVP 监督,一举绕开 JEPA 长期头疼的表示坍缩难题;还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上,64 帧长程预测延迟仅 0.072 秒,并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。

August 3, 2026 · 8 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min

Momenta IPO 后再访曹旭东:没有尽头的 AI,从智驾到家庭机器人的十年推演

Momenta 创始人曹旭东在 IPO 后接受「晚点聊LateTalk」专访,回顾十年创业历程,系统阐述智驾竞争格局(中国两三家、全球三四家的终局判断)、“一个飞轮两条腿"战略、每年十倍的智驾摩尔定律、从自动驾驶向家庭机器人的技术外溢逻辑,以及从 AI 研究员到 CEO 的认知进化——“一流的工作不是想出来的,是做出来的”。

July 24, 2026 · 2 min

2026 Q2 AI季报:RSI从科幻走向创业赛道,Coding战场大洗牌,强者愈强的未来

2026年Q2 AI季报深度解读:Anthropic与OpenAI的模型竞争进入新阶段,GPT 5.6与Claude Maestro/Phable正面交锋;RSI(递归自进化)从科幻概念变成明确的创业方向,Recursive、Miranda等公司涌现;Cursor以600亿美元天价被收购;中国开源模型"四杀"引发全球关注;Anthropic的Cloud Tag与OpenAI的Record and Replay重新定义AI交互。本文基于播客全文转写整理,涵盖竞争格局、RSI、机器人、智能扩散、交互创新和公司动态。

July 22, 2026 · 3 min