VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning 精读

NTU 牵头、20 个机构 50 余位研究者共建的 VBVR-Pro,为「原生视觉推理」——把视觉生成当推理介质本身——建立了可训练、可验证、可优化、可受控比较的闭环测试床:300 个程序生成任务(347 万图+130 万视频)、100 个任务的确定性奖励评分器(人类对齐超 GPT-5.5 且完全可复现)、30+ 生成器受控比较。训练使 9 个开源模型平均 +0.29 并在 7 个外部基准迁移 +28 分级别;RLVR 优于 RLVLM;三面证据链证明「视觉轨迹比语言 CoT 更关键」是范式级发现。

August 27, 2026 · 3 min

Q-Learning with World Models 精读

斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线:世界模型完全不参与策略与价值函数的训练,只在测试时(在线采样与评估执行)通过树搜索帮助挑选动作。策略提议 N=8 个候选动作,世界模型为每个动作想象 K=8 个未来状态,递归展开至深度 4,节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上,模型偏差不会复合进策略;在 Robomimic 与 LIBERO 机器人操作基准上,QWM 在样本效率与最终性能上均显著超越强基线,而传统 model-based 方法几乎无法在同等预算内学出非零成功率。

August 24, 2026 · 3 min

世界模型是具身的永动机吗:北京人形谈 VLA 续命、大一统与机器人幼儿园

《晚点聊》WRC 期间对话北京人形创新中心戴勇、张怡与前华为 AI 专家唐都钰。VLA 与世界模型的路线之争被拆到表征层:VLA 泛化差的病根是"特征漏斗+预训练与后训练范式不一致";世界模型则被戴勇称为"AI 时代的永动机"——指望它生产数据,它本身却缺数据,“至少到现在是个童话”。北京人形的答案是 Pelican-Unify 大一统强耦合路线,年底 2.0 要拿出具身领域的 scaling law;唐都钰离职创业做"主动式物理因果模型",并转述图灵奖得主 Sutton 的机器人幼儿园设想。

August 22, 2026 · 2 min

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 精读

SemComp-Bench由中国科学技术大学联合FrameX.AI与中山大学提出,定义了结果导向的语义任务完成视频生成任务:给定参考图像与指令,要求生成视频既达成指定结果,又与参考保持任务相关的语义接地(如把钞票折成乌龟,结果必须是那张钞票折成的乌龟)。团队从Koala-36M约2万条视频经四阶段管线构造1273个结构化实例,并设计OA/GR双维度VLM评测协议。七个代表模型中最高OA仅37.8%,I2V全面碾压T2V(37.8% vs 4.4%),brief指令下OA暴跌至1.7%,GR与OA排名显著错位,揭示了当前视频生成模型会生成却不会完成任务的系统性缺口。

August 20, 2026 · 4 min

HarnessEval-W: Agentifying the Evaluation of Visual Worlds 精读

北大、清华、上海AI Lab等机构30余位作者联合提出HarnessEval-W,把LLM生态的harness范式首次引入世界模型基准测试:父Agent解释每个评测案例的语境并路由到技能库(记录激活与跳过理由),技能把问题分解为可测子问题、交给配备诊断工具的专职子Agent,证据经校验后聚合为分数——每次评测产出一棵可回溯到具体子问题与工具证据的证据树。在330案例×18个世界模型上,与5000次人类A/B判断拟合的Bradley-Terry排序对比达Spearman 0.93(Intentional)/0.87(Physical);对照最接近的WBench协议,Physical成对准确率从31.9%提至71.7%、平局率从52.2%降至1.8%。榜单揭示:Seedance 2.0综合75.5居首,视频生成器改造为世界模型会重新分配能力而非均匀提升。

August 19, 2026 · 2 min

物理AI的下一站:让AI发现人类不知道的方程

机器之心对话东方理工陈云天:从"知识嵌入"到"知识发现"的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程(如海浪破碎方程),用机械臂高通量实验找色谱方程替代耗时实验;他判断AI科学家"一定到了这个节点",但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap,而通用模型"每个行业都很浅",真正的机会在把物理一致性嵌进专业模型。

August 19, 2026 · 1 min

AI for Science 爆发前夜:曹原谈验证瓶颈、概念抽象与 AGI 的最后一公里

Jeff Dean 带三位谷歌元老出走创立 Discovery Loop 当周,前 DeepMind 科学家、Unreasonable Labs 联合创始人曹原在硅谷101拆解 AI for Science 为何在此时爆发:代码与数学能力到位后科研成为下一个智能爆发点,但真正的瓶颈从建模移到了物理世界的验证环节;LLM 无法凭训练数据产生真正新的科学概念,概念抽象可能是 AGI 的"最后一公里"甚至不可计算;他主张 AI and Science 而非 AI for Science——科学难题是驱动 AI 本身进化的催化剂,并给出"AI 拿诺贝尔奖至少还需二三十年"的长期判断。

August 15, 2026 · 2 min

Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 精读

交互式世界模型要同时做到“记得住、答得快、跑得久”,但三者天然冲突。Alaya-EVOKE 给出了一个系统级解法:把持久记忆外部化为按相机位姿索引的世界状态库,让去噪器上下文有界;同时把“教师”本身当作设计变量,用稀疏注意力改造出能看 30 秒的长视野教师,再经 DMD 蒸馏出三步、无 CFG 的学生模型。结果是:WBench 导航拆分三组指标全第一、VBench-2.0 总分 66.77 登顶(超过 Veo 3),单卡 H200 上每 1.5 秒内容只需 2.11 秒生成,并且能连续跑一个多小时不崩。本精读面向初学者,拆解其三大机制、实验证据与效果优势的因果链。

August 15, 2026 · 3 min

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 精读

可交互世界模型(如 Genie 3)正在爆发式涌现,但“每个模型用自家基准自测”使得跨模型公平比较几乎不可能——固定动作序列在不同模型上会走出完全不同的轨迹。PlayWorld 提出 Agent-as-Player 范式:让多模态 Agent 像人类玩家一样,为指定的长时程目标(转一圈看环境是否一致、走进水里看有没有涟漪)主动探索交互,再用四维度 VQA 体系打分。171 个人工标注场景、9 个世界模型的大规模评测显示:最高的 Genie 3 Overall 也只有 2.12/5,且所有模型在“视野外演化”“洞察演化”两类长时程状态维持维度上普遍不超过 2 分——“能演、但不能持续演化”是当前公认瓶颈。本精读覆盖其动机、方法、实验证据与因果链根源解释。

August 15, 2026 · 3 min

在算力最多的地方做世界模型:对话英伟达Cosmos掌舵人刘洺堉

英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路,到Cosmos 3为何将语言/视频/音频/动作统一进单一模型,到"模型竞争不是零和游戏"的Low Ego哲学,再到黄仁勋的第一性原理决策与"不裁员"文化。他认为模型能力终将收敛,真正决定胜负的是生态整合;他不想击败任何人,只想帮助Physical AI整个领域成功。

August 13, 2026 · 1 min