ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读

Bang Liu 团队 38 页范式论文,提出继 Digital Agents(数字状态)和 Embodied Agents(物理状态)之后的第三种 Agentic AI 行动基底——Combodied Agents(以人的演化状态为核心)。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架,并把’保留并增强人类 agency’首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。

August 12, 2026 · 6 min

Addressable Memory for Video World Models 精读

交互式视频世界模型在长时程生成中会遇到一个隐蔽的「记忆失效」问题:KV cache 里明明存着过去的画面,模型却读不出来。本文精读 NVIDIA/Princeton/ Toronto 联合提出的 WorldTrace 框架,它精准定位了 RoPE 旋转位置编码超出训练范围导致的「内容不可寻址」根因,并用一套无需训练的虚拟槽位机制,在时间一致性上提升 15.5%、在 LoopBench 情景回忆上提升 19.5%。本精读将从世界模型的记忆机制讲起,逐层揭开位置编码、相位抵消、虚拟槽位、规范 key 平均等关键技术。

August 11, 2026 · 8 min

MASS:用权威共享状态解耦多智能体世界模型——多人游戏架构如何破解视频世界模型的可扩展性瓶颈

MASS 借鉴在线游戏的权威服务器架构,将多人世界模型分解为推进权威类型化状态的 Logic Engine 与按需生成视角的 Rendering Engine,在匹配 Snake 基准上取得 0.764 的状态恢复(最强视频基线仅 0.128),并支持 1,024 个并发玩家、10,000 个循环 tick 的结构稳定预测。

August 9, 2026 · 3 min

EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读

蚂蚁集团与上海交通大学联合提出 EnvACE,让一个策略同时扮演「行动者」和「环境」两个角色:Acting 角色生成工具调用,Rehearsal 角色生成对应的环境响应,两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互,却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline,综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是,模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling,在提交执行前先在内部排练验证,把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」,并提炼出三条可迁移到其他领域的通用灵感。

August 8, 2026 · 6 min

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models 精读

腾讯提出WorldCycle,利用可逆动作循环的物理对称性作为免标注自验证RL信号。通过空间闭合奖励和时间一致性奖励,将视频世界模型的状态返回漂移降低44%,复合动作准确率提升近4倍。核心突破在于:不需要任何ground-truth未来状态,物理可逆性本身就是密集监督信号。

August 6, 2026 · 2 min

Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent 精读

上海 AI Lab 等机构联合提出 Video-DeepResearch(Video-DR),把多模态 Deep Research Agent 从静态图像推进到连续视频流。论文诊断出当前 Agent 的两大顽疾——模态偏见(回避视觉工具转向文本搜索)与参数知识泄露(靠内部记忆蒙答案而非真正调用工具),并设计解耦感知-探索流水线 + 阶段式工具解锁 + SFT+GRPO 两阶段训练予以破解。其 35B-A3B 模型以 64.0% 平均准确率刷新 VideoDR-Bench SOTA,超越 Claude-4.5-Sonnet 5.0 分、GPT-5 11.5 分;30B 变体也追平 Claude-4.5-Sonnet。本文从机制因果层面解释:为何一个激活参数仅 3B 的模型能在视频 Deep Research 任务上反超数十倍体量的顶级闭源模型。

August 5, 2026 · 3 min

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 精读

VLA 模型做 RL 后训练时,critic(价值估计器)通常只看单帧画面——这和机器人控制’部分可观测’的本质根本不匹配。WCM(World Critic Model)基于 LeJEPA 架构,让 critic 同时预测未来潜在状态(世界建模)和估计价值,使 critic 的表示被显式训练去捕捉时序动态。在 149 个任务上,OpenVLA-OFT 的 in-distribution 成功率达 99.0%、out-of-distribution 达 77.9%;从 0.8% 的 zero-shot 提升超 12000%;7 个真实世界任务全面超越基线。本文从’纯标量回报回归不足以学时序动态’的第一性原理,解释为什么单纯加历史帧没用、必须加世界建模目标。

August 5, 2026 · 3 min

Mental World Modeling 精读

世界模型已经能很好地预测物理场景将如何演化,但它常常预测错人类会做什么——因为人不是被物理推动的,而是被自己的信念、目标、情绪和社会规范推动的。本文提出 Mental World Modeling(MWM)框架,把心理变量从’事后解释’提升为世界状态的’一等公民’,并用一个无需训练的六阶段基线 MENTIS 验证:在 448 条情境决策数据上,显式建模心智让 8 个大模型的决策预测 F1 平均提升到 87.9%,而删掉心智通道会掉 12.1 分,最大瓶颈是’耦合世界状态如何转移’。本精读按九部分结构展开,从’世界模型是什么’讲起,逐层拆解 MWM 的形式化、MENTIS 流水线、评估设计与瓶颈归因。

August 3, 2026 · 7 min

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读

深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把’未来预测’重新定义为’在紧凑潜在空间里对一个连续速度场做积分’,靠动力学解耦 + 直接一阶 JVP 监督,一举绕开 JEPA 长期头疼的表示坍缩难题;还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上,64 帧长程预测延迟仅 0.072 秒,并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。

August 3, 2026 · 8 min

PhiZero: A World Model Built Around Physical Language 精读

PhiZero由中科院自动化所提出,通过自监督学习从野外视频中提取紧凑离散的’物理语言’表示世界状态转移,采用’先推理后渲染’范式:自回归VLM先推理物理语言序列,再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号(比Wan2.2 VAE压缩175倍),在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。

August 2, 2026 · 2 min