MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读

大连理工牵头、联合牛津等七校提出 MA-VLA:面向多机械臂协作的组合泛化——测试时协作模式(角色/顺序/交互结构)训练中未见过,但原子动作全在分布内。方法三件套:VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零,MA-VLA 达 13.0%;真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。

August 27, 2026 · 3 min

SimVerity: When Does Simulated Agent Success Survive Physical Deployment? 精读

Agent 产品上线前,模拟器给的「绿色对勾」在真实物理部署中还能信几分?帝国理工学院的 SimVerity 给出了第一个系统化量化:判定保真度 VF 与假清关风险 FCR。在真实智能家居测试床上,先进模拟器通过了全部 240 个开灯试验,相机却抓到 42 个亚秒级物理失败——同一执行裂解为完成/上报/可观察/沉淀四种判决。更惊人的是,假清关可以被预测:评测前 SHA-256 冻结的风险画像在从未物理测量过的路径上 11/11 会话全胜盲基线;而第二台合格模拟器与第一台零分歧——共识只是换了种方式放弃覆盖。本精读拆解这套「先证明证人资格、缺证据一律弃权」的判定迁移审计方法论。

August 27, 2026 · 4 min

Inducing Task Models from Computer-Use Traces 精读

本文精读斯坦福与CMU合作的论文《Inducing Task Models from Computer-Use Traces》(arXiv 2608.20319)。日常电脑录屏与鼠标键盘事件流中沉淀着大量从未文档化的工作知识,论文提出TMI方法:先把低层事件接地为语义活动,再把多线程交织的活动流拆解为潜在任务,最后为每个任务调和生成配对目标层次与控制流的符号化任务模型。在真实人类工作会话上,TMI以0.974的ARI还原交织任务,步骤描述准确率74.9%远超最强基线30.3%;用任务模型生成Agent技能可使held-out准确率相对提升30%。

August 24, 2026 · 3 min

Q-Learning with World Models 精读

斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线:世界模型完全不参与策略与价值函数的训练,只在测试时(在线采样与评估执行)通过树搜索帮助挑选动作。策略提议 N=8 个候选动作,世界模型为每个动作想象 K=8 个未来状态,递归展开至深度 4,节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上,模型偏差不会复合进策略;在 Robomimic 与 LIBERO 机器人操作基准上,QWM 在样本效率与最终性能上均显著超越强基线,而传统 model-based 方法几乎无法在同等预算内学出非零成功率。

August 24, 2026 · 3 min

世界模型是具身的永动机吗:北京人形谈 VLA 续命、大一统与机器人幼儿园

《晚点聊》WRC 期间对话北京人形创新中心戴勇、张怡与前华为 AI 专家唐都钰。VLA 与世界模型的路线之争被拆到表征层:VLA 泛化差的病根是"特征漏斗+预训练与后训练范式不一致";世界模型则被戴勇称为"AI 时代的永动机"——指望它生产数据,它本身却缺数据,“至少到现在是个童话”。北京人形的答案是 Pelican-Unify 大一统强耦合路线,年底 2.0 要拿出具身领域的 scaling law;唐都钰离职创业做"主动式物理因果模型",并转述图灵奖得主 Sutton 的机器人幼儿园设想。

August 22, 2026 · 2 min

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读

阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA(WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%)。核心论点是’对齐每一层’而非单点规模:结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹(仅用成功数据的SFT只能恢复8.5%的错误步骤)、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配,并发布双语真实网页基准BrowserBench(350任务均37.9步)。

August 20, 2026 · 2 min

Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读

清华大学 AIR 团队提出 Zetta,一个能在部署时自我进化的闭环具身智能框架:冻结 VLA 基座策略不动,用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行,配合三时间尺度进化循环(动作级治理、批次级失败诊断修复、验证门控技能晋升)与专用推理基建 Z-Infra,在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%,在 RoboCasa 18 任务上从 73.56% 提升到 93.56%,推理延迟较 RPent 降低 91%,并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。

August 20, 2026 · 8 min

VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读

港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent(从用户查询端到端构建可交互3D开放世界)的开源基准+训练统一框架:VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器(物理可行性+意图满足);VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5(57.3%)与Qwen3.8-Max(56.9%)均远未解决该任务、瓶颈定位在精确3D世界编辑;RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一,8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88,为agentic RL提供了可靠奖励服务。

August 19, 2026 · 2 min

物理AI的下一站:让AI发现人类不知道的方程

机器之心对话东方理工陈云天:从"知识嵌入"到"知识发现"的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程(如海浪破碎方程),用机械臂高通量实验找色谱方程替代耗时实验;他判断AI科学家"一定到了这个节点",但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap,而通用模型"每个行业都很浅",真正的机会在把物理一致性嵌进专业模型。

August 19, 2026 · 1 min

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 精读

交互式世界模型要同时做到“记得住、答得快、跑得久”,但三者天然冲突。Alaya-EVOKE 给出了一个系统级解法:把持久记忆外部化为按相机位姿索引的世界状态库,让去噪器上下文有界;同时把“教师”本身当作设计变量,用稀疏注意力改造出能看 30 秒的长视野教师,再经 DMD 蒸馏出三步、无 CFG 的学生模型。结果是:WBench 导航拆分三组指标全第一、VBench-2.0 总分 66.77 登顶(超过 Veo 3),单卡 H200 上每 1.5 秒内容只需 2.11 秒生成,并且能连续跑一个多小时不崩。本精读面向初学者,拆解其三大机制、实验证据与效果优势的因果链。

August 15, 2026 · 3 min