世界模型是具身的永动机吗:北京人形谈 VLA 续命、大一统与机器人幼儿园

《晚点聊》WRC 期间对话北京人形创新中心戴勇、张怡与前华为 AI 专家唐都钰。VLA 与世界模型的路线之争被拆到表征层:VLA 泛化差的病根是"特征漏斗+预训练与后训练范式不一致";世界模型则被戴勇称为"AI 时代的永动机"——指望它生产数据,它本身却缺数据,“至少到现在是个童话”。北京人形的答案是 Pelican-Unify 大一统强耦合路线,年底 2.0 要拿出具身领域的 scaling law;唐都钰离职创业做"主动式物理因果模型",并转述图灵奖得主 Sutton 的机器人幼儿园设想。

August 22, 2026 · 2 min

ASI-Bench: At the Dawn of Artificial Superintelligence 精读

清华联合MIT、哈佛、CMU等13机构40余位专家、投入31000+工时构建ASI-Bench——首个联合评估AI创新探索与自主科研能力的基准。核心设计是在同一研究项目内渐进撤除人类方法学指导:B1给完整方法、B2只给方法名、B3需自主定方法、B4加干扰。18个agent×模型配置的评估揭示了关键瓶颈:平均分从B1的50.91骤降至B2的29.10(-21.82),而B2到B3仅再降2.48——瓶颈不在选方法而在把方法变成完整可执行研究流程的方法操作化。

August 20, 2026 · 2 min

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows 精读

字节跳动Seed联合南京大学发布StartupBench——首个从市场验证的AI创业产品反推任务的E2E agent基准。方法论颠覆在于任务来源:不是研究者预设什么能力重要,而是系统研究哪些AI产品已被真实付费采用,把其工作流翻译为六领域(医疗/金融/法律/管理/STEM/教育)多格式交付任务,以细粒度rubric评分。结果揭示’高分低完成’剪刀差:Kimi-K3平均73.67%但严格达标完成率仅29.55%,无模型超1/3——瓶颈已从执行工作流转移到稳定产出可直接商用的交付物。

August 20, 2026 · 2 min

三位AI博士的真话:Token比人便宜吗,泡沫何时破,以及就业市场的一线行情

三位背景互补的AI博士——在读多模态方向的“两两”、临毕业做医疗AI的“十四”、入工业界两年半的“罗克”——对谈近期AI大新闻与真实就业:Token与人力的成本真相、泡沫论的时间表、开源闭源之争与Anthropic为何遭恨、DeepSeek护城河的组织学解释,以及大厂、研究所、高校的薪资行情与“赛博土木”警告。三人难得达成的一条共识是:优秀的硕士并不比博士差,增量机会在AI加制造、医疗等落地场景。

August 20, 2026 · 2 min

从烧钱竞赛到精打细算:一个Token重度用户的Agent进化史

硅谷101对话黄东旭与张宏江:当Uber四个月烧穿全年AI预算、Meta给员工设token上限,“Token Maxing"的烧钱竞赛到达转折点。亲历者黄东旭讲述自己从日烧四五百美元的最强模型依赖,转向本地DeepSeek V4 Flash加云端Fable 5的混布组合;这场从token maxing到token efficient的转向,本质是模型能力跨过工程化门槛后,成本结构与企业KPI的重算。张宏江判断AGI奇点已至,而更深的分歧在于:单模型智商碾压与多agent蜂群,谁是终局。

August 20, 2026 · 1 min

StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling 精读

四位独立研究者(含 UT Austin 张satz Atlas 王)在不改模型权重的前提下,用 YAML 状态机运行时 StateM 把 GPT-5.5 在 Terminal-Bench 2.1 上从 83.1% 拉到 92.1%,冻结迁移到 GPT-5.6 Sol 达 95.28% raw,把 DeepSeek-V4-Flash 适配到 88.09% 而最终评测成本仅约 15 美元——对照 GPT 参考运行的 574.68 美元。论文提出 harness scaling 作为与 model scaling 正交的能力轴:把可变状态外置、以状态为上下文与契约双重边界、用受检转换取代 agent 自证完成,将失败分类为认知缺口/程序记忆缺口/程序遵从缺口三类并逐一施加控制点。负迁移分析(RefactorBench -2.78 分)进一步证明控制必须挂在正确的执行边界上。

August 19, 2026 · 3 min

物理AI的下一站:让AI发现人类不知道的方程

机器之心对话东方理工陈云天:从"知识嵌入"到"知识发现"的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程(如海浪破碎方程),用机械臂高通量实验找色谱方程替代耗时实验;他判断AI科学家"一定到了这个节点",但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap,而通用模型"每个行业都很浅",真正的机会在把物理一致性嵌进专业模型。

August 19, 2026 · 1 min

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents 精读

长程Agent任务中早期错误同时污染上下文与环境状态,现有方法(计划精化/安全检查)只防错不恢复。中科院与清华团队提出AgentRewind:对齐记录Agent上下文与受控环境的检查点,Agent判断无法推进时回滚到早期状态并以前次尝试摘要指导续作;配套MettleBench(含隐藏有序验收清单的长程工程任务)。Terminal-Bench 2.0全量上成功率83.1% vs Continue的78.7%与Restart的70.8%;回滚增益随执行horizon增长显著扩大。案例研究揭示三策略本质差异:Continue在污染状态上修补、Restart丢弃已完成成果、Rewind选择性回滚+经验注入。

August 18, 2026 · 1 min

Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读

Transformer的知识(FFN)与推理(Self-Attention)逐层绑定,模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构:全局共享的Memory(FFN知识向量库)+多个Reasoner(Self-Attention)以隐状态为载体反复查询知识库,原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU(1.6倍数据效率),Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31,端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链,并展望自进化、世界模型与软硬件协同四个延伸方向。

August 18, 2026 · 1 min

MobileMem: Learning from a Year of Mobile Experiences 精读

下一代个人AI助手需要跨年月的长期记忆,但现有基准无法反映移动场景的真实复杂性——异构、多模态、演化、深度个人。OPPO与浙大Ningyu Zhang团队(OpenKG联合)发布MobileMem:以知识引导的合成管线从用户先验知识构建年度尺度一致的长程轨迹,覆盖单跳/多跳/时序推理、知识更新与隐式偏好推断,另有MobileMem-Omni多模态版本。评测揭示行业分野:A-MEM 78.39与HippoRAG2 80.06领先而Mem0仅42.61、LangMem低至30.33——保真派碾压压缩派;时序推理全面失守;对抗问题上“记忆越强越容易中招”;Long Context在GPT-5.4-mini上反而更差。

August 18, 2026 · 1 min