Agent-Editing World Model 精读

人大高瓴学院 AEWM 论文精读。论文把语言世界模型的预测目标从「重建环境观测」重构为「预测决策效果并直接编辑 agent 状态」,用 Action Judge 三分类(CRITICAL/EXPLORATORY/NOISY)+ State Revision 推理动作联合编辑组成推理时闭环 EditAct,再用 AEWM-RFT 把编辑能力内化回 agent。Action Judge 基准 macro-F1 70.5% 超最强基线 10.6pp;六基准三骨干平均提升 3.2–6.7 分;9B+EditAct 反超 35B+ReAct。本精读覆盖动机、方法、证据链、外部交叉验证与可迁移灵感。

September 26, 2026 · 7 min

Training Object Permanence in World Models 精读

16 所高校联合团队发布 WROP 基准与训练资源,用 150 个 Blender 参数化生成器、150 万样本的系统化合成数据,检验并训练视频世界模型的「客体永久性」与「客体固体性」两类核心认知先验。微调得到的 16B 模型 PWM-WROP 在 20 人盲测成对比较中以 Elo 1679.5 位列真续写模型第一、全场第三,超最强真续写对手 222.5 Elo,且在匹配分辨率下 LPIPS 0.081、MS-SSIM 0.921 全场最优。本精读覆盖背景、定位、问题定义、解法、实验证据、优势根源与外部交叉验证、知识反推与通用灵感九个部分。

September 26, 2026 · 6 min

在像素里复刻世界之前,先给世界定一把尺——云栖2026世界模型分论坛全记录

云栖2026「世界模型:从构建数字世界到物理世界」分论坛八场演讲与圆桌的完整复盘:阿里联合高校发布W1-W6能力分级、超1600用例的Benchmark与超10万次对战的Elo Arena,给名实混乱的世界模型定了第一把尺;长视频误差累积、GPT-6吞噬具身上层能力、实时会话基建与「消费即创作」的IGC叙事,构成从数字世界通往物理世界的四道门槛。

September 24, 2026 · 1 min

WorldCrafter:用隐式 3D 感知记忆打造可一致探索的视频世界模型 精读

深度精读腾讯 IEG ARC Lab 与北京大学联合提出的 WorldCrafter。它用一个「隐式 3D 感知记忆」模块让视频世界模型在长时间、可自由探索的交互中保持场景一致性:以 LagerNVS 初始化记忆编码器、用姿态引导读出、与视频 DiT 联合训练,配合最大覆盖历史检索与少步蒸馏,在 4 卡上达到 16fps 实时。重访一致性 LPIPS 从 Lyra 2.0 的 0.487 降到 0.255,相机控制旋转误差 13.536 为全场最低。

September 23, 2026 · 3 min

机器人 Scaling Law 出现了吗?——徐梦迪的答案:有信号,但真正的分水岭是 in-context learning

清华叉院助理教授徐梦迪在「十字路口」提出:具身领域已出现预训练数据从十万到百万小时、held-out loss 随规模下降的 scaling 信号(如 Dyna-2 百万小时人类视频预训练),但 loss 与真机成功率脱钩,真正有意义的是『未见任务成功率随规模上升』的 scaling law;她判断当前主流 VLA 的『预训练+微调』范式对应 GPT-1 时刻,期待的是通过 prompting 适应个体偏好的 GPT-3 时刻。本文拆解她论证中的证据链、与世界模型路线的关系,以及数据定义由模型能力反推的行业机制。

September 21, 2026 · 2 min

JEPA-Anything: Learning Predictive Models across Different Worlds 精读

世界模型至今一域一模型:视觉用 V-JEPA、细胞用 Cell-JEPA、控制用 Dreamer——能否用一个学习原理统治所有’世界’?PhAI Labs 联合八机构的 JEPA-Anything 提出正交预测因子分解(OPF):把 JEPA 的单一目标嵌入拆成 K 个正交子空间各配专属预测头,再用伪逆合成完整潜状态。同一核心横跨视觉、单细胞、临床、控制、分子动力学、PDE、天气七域,10 项动力学任务全胜匹配 JEPA 基线,Interventional Pong 单干预误差降 34.8%,四分子系统 100 步 rollout 全部最低误差;因子坐标提名的 IL-18+CD73 联合干预在类器官与小鼠实验中获得验证,轨道潜模式恢复开普勒指数 -1.4991。

September 20, 2026 · 3 min

具身智能的四条路线分歧:数据、Astra 与商业化的真问题

2026 外滩大会圆桌实录:苏度韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳许华哲四位一线创业者正面回答具身智能三场路线之争——仿真还是真机、GPT-6 Astra 是否构成降维打击、跨过泡沫的指标是什么。共识是具身不会复刻语言模型路径,分歧在数据从哪来、智能住在哪里、钱从哪来。

September 14, 2026 · 1 min

Memory as Plans 精读:把记忆从执行期条件重构为规划期证据,机器人非马尔可夫任务 SOTA

哈工大×NTU×山大提出 MaP-WAM:将记忆依赖的世界-动作建模拆解为记忆锚定规划与计划条件执行两层——情景区段记忆作为规划期证据,因果世界模型(WAN-2.2-5B 微调)生成视觉计划,World-Action-Progress 模型把任务进度升级为一等模态。RMBench 83.3% SOTA、真机 78.0%,执行器延迟随历史增长恒定;Swap T/Press Button 达 96%。

September 13, 2026 · 1 min

Recursive Code World Models 精读:global-local-global 递归构造可执行 3D 世界

佐治亚理工提出 RCWM:从单张参考图重建复杂 3D 世界为可执行场景代码。核心是递归场景程序(RSP)表示 + 自递归构造求解器——每次调用遵循建立整体→递归重建未解部分→回访整体精炼组合的 global-local-global 循环,参考对齐视图跨层级传播共享相机投影,父级回访修正局部精炼后浮现的边界错误。三级递归较固定二级 whole-frame PSNR 16.8→19.0、local SSIM 0.52→0.60,全面超越 image-to-scene-program 基线。

September 13, 2026 · 1 min

World in World 精读:免训练控制视频世界模型的统一证据接口

西湖大学 AGI Lab 提出 World in World:training-free 推理时接口,把四类异构控制证据(源视频观测/目标视角投影/几何渲染/检索生成态)统一转为带相机与时间标注的干净视觉状态,经冻结视频世界模型的原生 self-attention 读入;对应路由器建立 token 对应关系,证据级 attention CFG(EWA)按通道独立调权。同一冻结骨干完成相机控制重渲染/长时程回访/人体动作迁移,重渲染全指标超 ReCamMaster 等训练方法(CLIP-Sim 92.5 vs 83.8)。

September 13, 2026 · 1 min