UniMPA 精读:给 VLA 模型一个“动作锚定”的统一接口,训练 epoch 砍半还涨点
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
南京大学+九天团队提出 UniMPA:统一记忆-预测-动作模型,用共享的’动作锚定转移接口’解决 VLA 的转移可实现性缺口(转移歧义/预测失准/多阶段混淆)。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp,只需 25-50% 训练 epoch。
Programmable World Model(PWM)把视频世界模型拆成两层:agent 把自然语言编译为可执行程序(实体状态+转移规则),轻量引擎执行程序维护显式持久全局状态(含屏外实体与非视觉属性);状态经增广 3D OBB 中间表示+相机轨迹确定性编译为像素对齐条件信号,驱动预训练视频模型当生成渲染器。自建 CombatStateBench 上 Count Accuracy 94%(超 LingBot-World-V2 达 53.25 分)、State Accuracy 98%(超 90 分),支持连贯长时程生成。本文精读’符号引擎管规则、生成模型管外观’的解耦架构为何系统性消灭状态漂移。
流式视频理解的主流范式是’存历史、按需检索’,但外部证据永远只是临时上下文。南京理工×蚂蚁×NUS×港中文的 LatentStream 把范式翻转为’检索并内化’:分层流记忆 + 渐进扩张感受野的 latent token 把历史证据固化进固定长度潜记忆,用熵构造的渐进置信奖励在测试时联合优化。OVO-Bench 64.2%、StreamingBench 76.9%、MLVU +6.1,全部 SOTA。
Web agent 用世界模型做测试时动作选择:采样候选动作→预测下一状态→排序执行。但现有世界模型都用监督式’下一状态预测’训练——花大量 token 复述页面上没变化的部分,而下游 ranker 需要的恰恰是’不同动作导致的差异’。UC Berkeley 联合 MIT-IBM Watson AI Lab 提出 predicted-state matching:预测表示必须把真实结果状态从替代动作的结果状态中区分出来。同一份数据、同一个 Qwen3-8B 底座,仅换训练目标,匹配准确率从 47.77% 跳到 80.80%,WebArena-Lite 端到端成功率从 13.94% 提到 28.48%。本精读拆解’训练目标与下游任务对齐’这一教科书级修正的完整证据链。
深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观(EWR 三元组),把’从观测恢复世界表示’建模为溯因式的 agent 发现环:提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM,9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8,27B 推理变体 58.6 分超过全部基线。
复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM,首个面向电子游戏原生键鼠闭环控制(游戏玩法+GUI)的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配,同时生成未来视觉观测与可执行动作;用每步动作路由器区分 gameplay/GUI 两种控制分布,用预测长执行短的块周期控制解耦规划与承诺,用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7(次优 36.8)且执行步数全面最少,零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式:采样动作源的低频分量会系统性牵引生成相机运动,复用可致原地旋转。整篇论文训练仅 2.79B token,是 Game-TARS 配方的 1/200。
用强化学习训练手机 GUI 智能体,为什么必须忍受昂贵的真实环境交互?华东师范大学提出的 WM-R1 给出了第一个完全相反的答案:把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移,Agent 通过 GRPO 在纯模拟环境中学习;更关键的是 <call_wm> 机制把世界模型嵌进思维链,让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA(超 UI-R1 达 9 个百分点),OOD 平均提升 +16.0,训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。
深度精读上海交大、上海AI实验室、Krea AI、Hugging Face 等多方合作的 PAWBench:把「概率对齐」形式化为视频世界模型的分布级标准——固定初始观测与动作下,模型诱导的未来分布应匹配物理上有效结果的正确概率。50 场景两套件评测 11 个视频生成模型,无一同时做到概率准、覆盖广、场景稳;核心洞见是「一条合理的未来不等于分布对齐」,加大采样预算只提高覆盖率、纠正不了概率分配。
Station v2(DualverseAI × 剑桥 × 港大 × UCSD)把 AI 数学发现从『固定管线里的工具』搬进开放世界多智能体环境:6 个跨模型家族的 agent 在无中央协调器的房间制生态里自选方向、跑实验、发论文积累共享文献。在 AlphaEvolve 目录 12 个构造类问题上 5 题产出相对既有文献新颖的结果——kissing 数 d=11 三个精确 604 点构型(两个为新等距类)、Erdős 最小重叠下界 0.37912→0.380552(闭合已发表区间约 82%)、有限域 Kakeya 新无穷族、离散 Kakeya 针 CT(128)≤0.107067、符号不确定性 0.3089;还独立重构 Jacobian 猜想反例。机制归因:高度自主使 agent 能直接追求不可打分的广义数学目标,评估耗时上限倒逼理论引导构造,46.4% 的亮点结果来自跨模型家族协作。
西湖大学 AGI Lab 与南洋理工提出 Code World Model:让编码 Agent 充当「世界大脑」,用可执行代码维护持久世界状态并驱动世界演化,再通过 proxy(粗粒度代理视频)接口把状态翻译成帧级时空约束,交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦,直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后,模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动,并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。