N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读

N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出,是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作(VTLA)基础模型。方法核心是三步训练配方:(1)在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验;(2)分阶段触觉通路集成,用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整;(3)ALTER——一种优势条件离线RL方法,将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务,在20任务仿真套件上平均成功率63.8%(最强baseline π0.5为44.0%),ALTER训练策略在3个长程真机任务上达到75-95%成功率。

August 3, 2026 · 3 min

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读

深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把’未来预测’重新定义为’在紧凑潜在空间里对一个连续速度场做积分’,靠动力学解耦 + 直接一阶 JVP 监督,一举绕开 JEPA 长期头疼的表示坍缩难题;还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上,64 帧长程预测延迟仅 0.072 秒,并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。

August 3, 2026 · 8 min

【每日AI前沿追踪】2026年08月02日 核心技术与产业动态速递

PhiZero以物理语言重构世界模型范式,VideoCoCo用可执行Blender代码实现物理一致性视频生成;Meta AI提出记忆教练双智能体架构对抗行为状态衰减;DeepSeek V4 Flash以3美分单任务成本击穿行业斩杀线;OpenAI Astra数学成果被Gary Marcus批评过度吹捧但Claude Fable 24小时复现5项;苹果漏洞赏金邮箱被AI垃圾报告淹没致真实漏洞无人受理。

August 2, 2026 · 3 min

29岁空降改造腾讯混元:信任换来的不是模型,而是一支新军队

晚点记者高宏浩详述姚顺雨加入腾讯混元300天:这位29岁的OpenAI前研究员没有亲自下场做技术,而是用老板最信任的窗口期迅速换血关键岗位、重建infra、推动模型与产品深度绑定。但腾讯的联邦制基因、微信与混元的数据孤岛、以及算力硬约束,让这场改革的真实考验还在后面——当信任周期的红利耗尽,能否拿出第一梯队的模型才是生死线。

August 2, 2026 · 1 min

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems 精读

MANTA首次将多Agent系统的通信拓扑从’部署前固定的设计选择’重新定义为’推理时可自我演化的系统变量’。通过拓扑规划器、轨迹审计器和技能反射器三个编排组件,MANTA在任务执行期间监控协作过程并应用有界结构修复——修改角色、通信链路、执行顺序和信息可见性。在五个基准上平均74.0分,超越最强baseline 5.8分,且总token消耗最低。论文揭示了’拓扑是自我改进的独立层次’这一新范式。

August 2, 2026 · 3 min

Meta AI Proactive Memory Agent:记忆教练精读

Meta AI提出主动记忆智能体架构,用独立的’记忆教练’智能体在固定间隔审查行动智能体的近期步骤,更新结构化记忆库(私有状态/知识记忆/程序记忆),并决定是否注入定向提醒。核心创新在于’何时提醒’的策略决策——选择性干预优于全量检索。Terminal-Bench从38%提升至46%,tau2-Bench从55%提升至62%,超越Mem0生产记忆层。

August 2, 2026 · 2 min

Perception-Correction Distillation:多模态推理器感知蒸馏信用分配精读

中科院自动化所Hongyu Lin团队提出PCD(Perception-Correction Distillation),用下游失败和师生分歧作为互补见证的贝叶斯证据组合,形成软AND门精准识别’可纠正的感知失败’。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28,32B→8B从56.94提升至61.22。

August 2, 2026 · 1 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min

ShadowDancer: Teaching Video World Models Any Action by Learning Unified Dynamics Representations from a Video and Its Shadow 精读

ShadowDancer提出影子对(shadow pairs)和跨影子预测(cross-shadow prediction),通过构造方式解决潜在动作模型的外观-动力学耦合问题。同一动力学轨迹在不同外观下重放,预测一个影子所需的表示必然是共享动力学本身。任何演示片段成为可复用动作资产,在新环境中重放无需动作标签、运动估计器或微调,跨五族动力学平均盲测胜率86%。论文揭示了’构造性不变量提取’的全新自监督范式。

August 2, 2026 · 3 min

SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读

SpatialCLI提出Call-Learn-Internalize三阶段框架,教VLM先用空间专家工具(定位/分割/深度/姿态)学会组合感知,再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%,均超越GPT-5.6 Sol。论文揭示了’工具→RL→内化’的渐进式能力蒸馏新范式。

August 2, 2026 · 3 min