<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>具身智能 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/</link><description>Recent content in 具身智能 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E5%85%B7%E8%BA%AB%E6%99%BA%E8%83%BD/index.xml" rel="self" type="application/rss+xml"/><item><title>GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读：harness 自进化在 GUI、机器人、图像生成三条垂直域的落地</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-harness-vertical-trio-paper-reading/</guid><description>「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线：GUI-HARVEST 用重复视觉执行证据加行为预测双门，在 OSWorld 六个骨干上最高提升 12.33 个百分点；DynaHarness 用快慢脑加物理执行契约，把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%；EvoGen-Harness 用 where+how 联合归因进化，让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作，本文合读三者的共同骨架、域特化设计与实验证据链，并讨论 harness 工程的边界与反例。</description></item><item><title>训练前沿四重奏：蒸馏外推、规模解除、奖励治理与具身评测 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</guid><description>本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文：RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推，四组基座全部追平或超越教师；OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」，用验证脚手架解除；ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式，合取式协议级评分回收三分之一损失；GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线：监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。</description></item><item><title>Self-Evolving Coding Agents × RE-0：从数字程序到物理世界的自进化智能体 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-physical-agentic-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-physical-agentic-duet-paper-reading/</guid><description>二重奏精读两篇互补论文：hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式，用 Code as World + Code as Policy 双可执行表征与类型化验证器，把编码代理范式迁移到物理世界，在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%；吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入，仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练，勾勒物理世界自进化智能体的完整图景。</description></item><item><title>编码智能体规划、信任原生 Agent OS 与开源后训练配方：三篇系统论文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</guid><description>本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》：现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略，平均成功率反超手工 TAMP planner（95%/82% vs 47%），决策速度毫秒级，为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》：提出首个以安全为第一设计约束的智能体操作系统，用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播，把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》：Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方，9.01M 样本 SFT 加多阶段 RL，IFBench 76.9 对官方 33.6，并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。</description></item><item><title>Agent的确定性从哪来：全栈平台与草台班子的双向奔赴</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-enterprise-agent-infrastructure/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-enterprise-agent-infrastructure/</guid><description>云栖2026「企业级Agent基础设施」论坛全记录：阿里云发布Agent Studio全栈服务平台与硬件版，把开发、运行、评测、进化收进一条链路；千问端侧模型、高通异构计算、英伟达边缘推理引擎三方把Agent送往手机、座舱与机器人；友邦、阿里云产品博士、三棵小草给出「从答得准到办得成」的客户账本；OPC圆桌则揭示确定性最终由真实场景构建者反推。含转写校正、七项外部核验与四条机制-影响-启发链。</description></item><item><title>为Agent重做数据层：湖库一体、多模数据库与KV Cache，云栖2026一场论坛的五个答案</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-agent-native-lakebase/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-agent-native-lakebase/</guid><description>2026云栖大会数据库论坛《为Agent重做数据层》全链路复盘：Apsara LakeBase以湖库一体与秒级弹性重做Agent成本曲线，PolarDB多模引擎、ADB具身数据闭环、SelectDB/ClickHouse/Lindorm各守一环，Tair语义缓存把QReCC命中率13%提到80%、KV Cache让百炼命中率90%→96%。当Agent成为数据的主要生产者与消费者，数据层正从容器变成工作底座。</description></item><item><title>从繁星到灯塔：当数据耗尽成为时间表，AI 竞争换到了哪条赛道</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-data-evaluation-lighthouse/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-data-evaluation-lighthouse/</guid><description>云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘：七场分享拼出一条主线——人类数据将在2026-2032年间触及上限，合成数据有塌缩与奖励欺骗两大天然短板，模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建，以及&amp;quot;人类数据是RSI锚点&amp;quot;的判断，并给出五条可观察的行业机制链。</description></item><item><title>在像素里复刻世界之前，先给世界定一把尺——云栖2026世界模型分论坛全记录</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-world-model-digital-to-physical/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-world-model-digital-to-physical/</guid><description>云栖2026「世界模型：从构建数字世界到物理世界」分论坛八场演讲与圆桌的完整复盘：阿里联合高校发布W1-W6能力分级、超1600用例的Benchmark与超10万次对战的Elo Arena，给名实混乱的世界模型定了第一把尺；长视频误差累积、GPT-6吞噬具身上层能力、实时会话基建与「消费即创作」的IGC叙事，构成从数字世界通往物理世界的四道门槛。</description></item><item><title>存储走上业务关键路径：从具身数据洪流到Agent记忆底座——云栖2026「AI and Agentic存储解决方案」五场景实录</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-ai-agentic-storage-solutions/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-ai-agentic-storage-solutions/</guid><description>云栖大会2026「AI and Agentic存储解决方案」专场，阿里云与穹彻智能、卓驭科技、小鹏、美图、智创星云沿数据旅程拆解存储如何从后台走到业务关键路径：具身数据年增477.78%下的众包上行与帧级随机读写、智驾闭环的稳快省、Lance加OSS加速器让30PB数据湖读吞吐提升20倍、AI重写存储治理范式，以及Session与Memory分家的Agent存储底座。附系统性同音词ASR校正实录。</description></item><item><title>当智能体替人跑一整天：PAI 分论坛上，AI 基础设施的三次换轨</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-pai-agentic-ai-infra/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-pai-agentic-ai-infra/</guid><description>2026 云栖大会「人工智能平台 PAI」分论坛全程复盘。PAI 负责人周文超用负载、范式、边界三个词定义 Agentic AI 对基础设施的重塑：推理调用次数增长数百倍使 KV cache 命中率成为第一指标，RL 算力消耗逼近预训练把「稳」变成生产化门槛，具身智能则把战场拉回数据质量。文中串联小米广告 +8 个点收入、大众故障归因数天级压缩、SciMaster 六小时顶博士三个月、圆桌「一千小时低质数据不如一小时高质量」等关键证据，提炼出从压榨算力到压榨数据、从模型精度到迭代周期的观察坐标。</description></item><item><title>真武是系统，不只是芯片：平头哥算力峰会上的超节点方法论</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-yunmo-zhenwu-ai-chip/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-yunmo-zhenwu-ai-chip/</guid><description>整理2026云栖大会平头哥算力峰会「云模之芯，共筑非凡」全场内容。平头哥副总裁李伟良梳理真武810E→M890→V900→J900的年度迭代节奏；阿里云王超给出「系统语义不在物理边界断裂」的真超节点判据；Kimi许欣然拆解100毫秒decode里的访存经济学；元戎启行曹通易与无界动力夏中谱讲物理AI的数据量级与快慢脑；圆桌与倚天CPU、磐脉920网卡两场把Agent时代的关键路径补完整。芯片竞争已从单卡指标转向系统协同。</description></item><item><title>RoboDawn：让通用 VLM 零训练接管机器人控制，以及 GPT-6 Astra 的零样本佐证 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-vlm-robot-transfer-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-vlm-robot-transfer-paper-reading/</guid><description>以清华大学胡事民团队 RoboDawn 为主线精读：它用一套人类直觉的「语义原语接口」（离散平移/旋转/夹爪命令）把机器人控制暴露给 agentic VLM，配合无需参数更新的 in-context learning 与闭环决策，在 RoboTwin 2.0 上单样本 73.6% 成功率，超 HarnessVLA 的 58.4%。同日 RoboProbe 等发布的 GPT-6 Astra 在 RoboDojo 零样本 22.48% SR 登顶，却能力两极化（Precision 仅 4.00 vs DM0.5 16.75），为「通用大模型已具备机器人控制潜质、但精度是短板」提供独立佐证。</description></item><item><title>WorldCrafter：用隐式 3D 感知记忆打造可一致探索的视频世界模型 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-worldcrafter-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-worldcrafter-paper-reading/</guid><description>深度精读腾讯 IEG ARC Lab 与北京大学联合提出的 WorldCrafter。它用一个「隐式 3D 感知记忆」模块让视频世界模型在长时间、可自由探索的交互中保持场景一致性：以 LagerNVS 初始化记忆编码器、用姿态引导读出、与视频 DiT 联合训练，配合最大覆盖历史检索与少步蒸馏，在 4 卡上达到 16fps 实时。重访一致性 LPIPS 从 Lyra 2.0 的 0.487 降到 0.255，相机控制旋转误差 13.536 为全场最低。</description></item><item><title>机器人 Scaling Law 出现了吗？——徐梦迪的答案：有信号，但真正的分水岭是 in-context learning</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-21-xumengdi-scaling-law-signal/</link><pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-21-xumengdi-scaling-law-signal/</guid><description>清华叉院助理教授徐梦迪在「十字路口」提出：具身领域已出现预训练数据从十万到百万小时、held-out loss 随规模下降的 scaling 信号（如 Dyna-2 百万小时人类视频预训练），但 loss 与真机成功率脱钩，真正有意义的是『未见任务成功率随规模上升』的 scaling law；她判断当前主流 VLA 的『预训练+微调』范式对应 GPT-1 时刻，期待的是通过 prompting 适应个体偏好的 GPT-3 时刻。本文拆解她论证中的证据链、与世界模型路线的关系，以及数据定义由模型能力反推的行业机制。</description></item><item><title>JEPA-Anything: Learning Predictive Models across Different Worlds 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-20-jepa-anything-paper-reading/</link><pubDate>Sun, 20 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-20-jepa-anything-paper-reading/</guid><description>世界模型至今一域一模型：视觉用 V-JEPA、细胞用 Cell-JEPA、控制用 Dreamer——能否用一个学习原理统治所有&amp;rsquo;世界&amp;rsquo;？PhAI Labs 联合八机构的 JEPA-Anything 提出正交预测因子分解（OPF）：把 JEPA 的单一目标嵌入拆成 K 个正交子空间各配专属预测头，再用伪逆合成完整潜状态。同一核心横跨视觉、单细胞、临床、控制、分子动力学、PDE、天气七域，10 项动力学任务全胜匹配 JEPA 基线，Interventional Pong 单干预误差降 34.8%，四分子系统 100 步 rollout 全部最低误差；因子坐标提名的 IL-18+CD73 联合干预在类器官与小鼠实验中获得验证，轨道潜模式恢复开普勒指数 -1.4991。</description></item><item><title>ActionPiece 精读：用『物理秩一致性』拯救动作 tokenization 的关系保真</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-actionpiece-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-actionpiece-paper-reading/</guid><description>华中科大×DeepCybo 等七机构联合提出 ActionPiece：自回归 VLA 模型的动作 tokenizer 传统上只用 MSE 评估重建精度，但点态误差小不等于关系保真——压缩后『不同情境所需的差异化动作』可能被压缩、扭曲甚至反转。论文提出 Physical Rank Consistency（PRC）度量局部物理距离排序的保持，并通过对表示学习与量化的联合监督（物理秩保持+量化正则）让离散 token 保留连续动作空间的局部序结构。同一 Qwen3-VL-4B 策略训练设置下：LIBERO 94.8%、未见 LIBERO-Plus 68.8%、SimplerEnv 71.9%。</description></item><item><title>大脑归基模，小脑归自己：24 岁首席科学家王家伟的具身下注</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-shenpu-wangjiawei-embodied/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-shenpu-wangjiawei-embodied/</guid><description>GPT-6 Astra 直接驱动机械臂刷屏、&amp;lsquo;基模降维打击具身&amp;rsquo;之说盛行的当口，深朴智能首席科学家王家伟（24 岁，少年班—MSRA—DeepSeek—Seed 路径）给出分层答案：大脑已收敛给基模，实时可控的动作模型与场景数据闭环仍是创业公司的自留地。本文梳理他的数据性价比账、zero-shot 泛化信号与具身评估真空里的噪音辨别，并给出可迁移的判断框架。</description></item><item><title>具身智能的四条路线分歧：数据、Astra 与商业化的真问题</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-14-embodied-intelligence-crossroads/</link><pubDate>Mon, 14 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-14-embodied-intelligence-crossroads/</guid><description>2026 外滩大会圆桌实录：苏度韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳许华哲四位一线创业者正面回答具身智能三场路线之争——仿真还是真机、GPT-6 Astra 是否构成降维打击、跨过泡沫的指标是什么。共识是具身不会复刻语言模型路径，分歧在数据从哪来、智能住在哪里、钱从哪来。</description></item><item><title>Memory as Plans 精读：把记忆从执行期条件重构为规划期证据，机器人非马尔可夫任务 SOTA</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-memory-as-plans-map-wam-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-memory-as-plans-map-wam-paper-reading/</guid><description>哈工大×NTU×山大提出 MaP-WAM：将记忆依赖的世界-动作建模拆解为记忆锚定规划与计划条件执行两层——情景区段记忆作为规划期证据，因果世界模型（WAN-2.2-5B 微调）生成视觉计划，World-Action-Progress 模型把任务进度升级为一等模态。RMBench 83.3% SOTA、真机 78.0%，执行器延迟随历史增长恒定；Swap T/Press Button 达 96%。</description></item><item><title>Recursive Code World Models 精读：global-local-global 递归构造可执行 3D 世界</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-recursive-code-world-models-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-recursive-code-world-models-paper-reading/</guid><description>佐治亚理工提出 RCWM：从单张参考图重建复杂 3D 世界为可执行场景代码。核心是递归场景程序（RSP）表示 + 自递归构造求解器——每次调用遵循建立整体→递归重建未解部分→回访整体精炼组合的 global-local-global 循环，参考对齐视图跨层级传播共享相机投影，父级回访修正局部精炼后浮现的边界错误。三级递归较固定二级 whole-frame PSNR 16.8→19.0、local SSIM 0.52→0.60，全面超越 image-to-scene-program 基线。</description></item><item><title>UniMPA 精读：给 VLA 模型一个“动作锚定”的统一接口，训练 epoch 砍半还涨点</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-12-unimpa-memory-prediction-action-paper-reading/</link><pubDate>Sat, 12 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-12-unimpa-memory-prediction-action-paper-reading/</guid><description>南京大学+九天团队提出 UniMPA：统一记忆-预测-动作模型，用共享的&amp;rsquo;动作锚定转移接口&amp;rsquo;解决 VLA 的转移可实现性缺口（转移歧义/预测失准/多阶段混淆）。LIBERO/LIBERO-Plus/RoboTwin 2.0 Hard/真机四线超 π0.5 达 1.7/11.7/18.5/12.6pp，只需 25-50% 训练 epoch。</description></item><item><title>Show-Harness: Just a VLM Agent Can Play Robots 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-11-show-harness-vlm-robot-paper-reading/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-11-show-harness-vlm-robot-paper-reading/</guid><description>Show-Harness 用一组离散语义动作单元（单步方向移动+夹爪动作）作为 VLM 与任意机器人本体之间的唯一接口：VLM 在语义空间推理意图，本体专属解释器把语义动作确定性落地为局部控制，VLM 始终对细粒度物理决策负责。同一接口实现零样本解锁前沿闭源 VLM（ZS 60%→82%）与几 GPU 小时微调小模型（FT 40%→65%），GUMI GUI 接口让人类与智能体用同一套语义动作采数据。本文精读其 perceive-reason-act 插件体系、语义-物理解耦机制与为何它能在跨任务/跨本体/跨环境全面超越 VLA 与智能体基线。</description></item><item><title>EmbodiedSkills：把 VLA 动作预测升级为提案-验证循环的技能编排框架 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-embodiedskills-vla-agent-framework-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-embodiedskills-vla-agent-framework-paper-reading/</guid><description>浙大×云深处科技等推出 EmbodiedSkills：把每个技能决策当作执行提案，守卫运行时执行前验证前置条件、执行后验证结果，固定的可执行技能契约连接 Qwen3-VL 高层选择与 π0.5 低层执行。RoboTwin 2.0 全 50 任务宏平均 86.20%（π0.5 基线 82.74%），LIBERO 四套件 97.40%，并诚实暴露记忆依赖任务 12.5% 的缺口。</description></item><item><title>SimpleMemVLA：不做记忆模块的具身记忆——原生视频上下文的范式反转 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-simplememvla-native-video-memory-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-simplememvla-native-video-memory-paper-reading/</guid><description>HUST×清华×面壁智能等推出 SimpleMemVLA：去掉检索/压缩/循环等专门记忆模块，把完整采样历史以时间戳视频格式直接喂给 VLM 主干，子任务隐藏状态作为唯一记忆通道。四个记忆基准全部 SOTA（RoboMME 88.3% vs 检索 31.5%/压缩 22.6%/循环 20.6%，真值感知上限也仅 84.1%），通用控制无损（LIBERO 97.5%），因果干预证实策略真实读取历史。</description></item><item><title>触觉是具身智能的最后一块拼图吗：五大技术路线、数据困局与模型之争</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-robot-tactile-sensing/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-robot-tactile-sensing/</guid><description>硅谷101走进触觉传感器实验室，梳理压阻、压电、电容、光学、磁感应五条技术路线，解释触觉数据为何接近于零、真机采集的&amp;quot;屏蔽悖论&amp;quot;，以及端到端时代触觉融入模型的两种范式之争。几乎所有受访嘉宾认为2026年触觉处于爆发前夜，量产一致性与数据生态是接下来一年的关键观察点。</description></item><item><title>具身智能的金钱游戏：钱很多、花得很少，IPO 成了主竞赛</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-03-embodied-money-game/</link><pubDate>Thu, 03 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-03-embodied-money-game/</guid><description>晚点聊邀请《具身的金钱游戏》两位作者复盘具身智能行业：融资额屡创新高，但算力和数据这两个最需要花钱的地方投入寥寥；收入靠地方政府数采中心与制造业关联交易撑起，IPO 成为行业主竞赛。本文拆解数采中心合资模式、制造业&amp;quot;互买&amp;quot;闭环、Club Deal 攒局玩法，以及这场资本竞赛背后的技术不确定性与观察指标。</description></item><item><title>GameWAM: A World Action Model for Video Games 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-gamewam-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-gamewam-paper-reading/</guid><description>复旦、腾讯光子与清华深圳研究生院团队提出 GameWAM，首个面向电子游戏原生键鼠闭环控制（游戏玩法+GUI）的世界-动作模型。它用并行 Video-DiT 与 Action-DiT 做块因果联合流匹配，同时生成未来视觉观测与可执行动作；用每步动作路由器区分 gameplay/GUI 两种控制分布，用预测长执行短的块周期控制解耦规划与承诺，用分层历史压缩维持长时程记忆。在 Minecraft MCU 上平均成功率 50.7（次优 36.8）且执行步数全面最少，零样本迁移 VoxeLibre 达 59.2%。论文还发现并命名了 LASI 失效模式：采样动作源的低频分量会系统性牵引生成相机运动，复用可致原地旋转。整篇论文训练仅 2.79B token，是 Game-TARS 配方的 1/200。</description></item><item><title>WM-R1: Training GUI Agents to Reason and Leverage World Models with Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-wm-r1-gui-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-wm-r1-gui-paper-reading/</guid><description>用强化学习训练手机 GUI 智能体，为什么必须忍受昂贵的真实环境交互？华东师范大学提出的 WM-R1 给出了第一个完全相反的答案：把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移，Agent 通过 GRPO 在纯模拟环境中学习；更关键的是 &amp;lt;call_wm&amp;gt; 机制把世界模型嵌进思维链，让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA（超 UI-R1 达 9 个百分点），OOD 平均提升 +16.0，训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。</description></item><item><title>UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-urbanground-spatial-agency-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-urbanground-spatial-agency-paper-reading/</guid><description>深度精读上海交大、新加坡国立大学、美团、港中文、牛津等合作的 UrbanGround：基于香港地政署全境 3D 地理数据构建真实尺度城市沙盒，以五级「空间能动性阶梯」810 个人工验证实例评测 MLLM Agent 能否把局部感知转化为可靠行动。结果尖锐：视觉识别可高达 80-93% 但方向理解接近四选一随机；短导航最高 75% 而长导航几乎全军覆没（最高 3.8%）——局部能力存在，却无法组合成持续目标导向行为。</description></item><item><title>Code World Model: Coding Agent as World Brain 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-code-world-model-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-code-world-model-paper-reading/</guid><description>西湖大学 AGI Lab 与南洋理工提出 Code World Model：让编码 Agent 充当「世界大脑」，用可执行代码维护持久世界状态并驱动世界演化，再通过 proxy（粗粒度代理视频）接口把状态翻译成帧级时空约束，交给视频模型渲染高保真画面。该框架把「世界演化」与「视觉实现」解耦，直面视频世界模型只能从画面反推规则、上下文不足一分钟、离屏后果无法延续三大结构性缺陷。在仅 5.6 小时 GTA V 游戏数据上 LoRA 微调 MiniMax-H3 后，模型即可跟随 proxy 指定的角色位置、轨迹、场景布局与相机运动，并泛化到训练之外的角色与风格。本精读覆盖其问题定义、方法组件、数据管线与局限。</description></item><item><title>MA-VLA: Multi-Arm Vision-Language-Action Model for Collaboration and Compositional Generalization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ma-vla-multiarm-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ma-vla-multiarm-paper-reading/</guid><description>大连理工牵头、联合牛津等七校提出 MA-VLA：面向多机械臂协作的组合泛化——测试时协作模式（角色/顺序/交互结构）训练中未见过，但原子动作全在分布内。方法三件套：VLM Planner 把高层指令分解为按时序的原子 prompt 分配到各臂、Pi0 执行器统一推断全臂动作、训练期 Arm Shuffle 置换各臂四元组打破身份绑定。OOD 协作中 Pi0/DP 基线全部归零，MA-VLA 达 13.0%；真机 SO101 上从全 0 到 10/20。「原子动作+角色洗牌」让语言成为主动协调通道。</description></item><item><title>SimVerity: When Does Simulated Agent Success Survive Physical Deployment? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-simverity-deploy-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-simverity-deploy-paper-reading/</guid><description>Agent 产品上线前，模拟器给的「绿色对勾」在真实物理部署中还能信几分？帝国理工学院的 SimVerity 给出了第一个系统化量化：判定保真度 VF 与假清关风险 FCR。在真实智能家居测试床上，先进模拟器通过了全部 240 个开灯试验，相机却抓到 42 个亚秒级物理失败——同一执行裂解为完成/上报/可观察/沉淀四种判决。更惊人的是，假清关可以被预测：评测前 SHA-256 冻结的风险画像在从未物理测量过的路径上 11/11 会话全胜盲基线；而第二台合格模拟器与第一台零分歧——共识只是换了种方式放弃覆盖。本精读拆解这套「先证明证人资格、缺证据一律弃权」的判定迁移审计方法论。</description></item><item><title>Inducing Task Models from Computer-Use Traces 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-task-model-induction-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-task-model-induction-paper-reading/</guid><description>本文精读斯坦福与CMU合作的论文《Inducing Task Models from Computer-Use Traces》（arXiv 2608.20319）。日常电脑录屏与鼠标键盘事件流中沉淀着大量从未文档化的工作知识，论文提出TMI方法：先把低层事件接地为语义活动，再把多线程交织的活动流拆解为潜在任务，最后为每个任务调和生成配对目标层次与控制流的符号化任务模型。在真实人类工作会话上，TMI以0.974的ARI还原交织任务，步骤描述准确率74.9%远超最强基线30.3%；用任务模型生成Agent技能可使held-out准确率相对提升30%。</description></item><item><title>Q-Learning with World Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-qwm-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-qwm-paper-reading/</guid><description>斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线：世界模型完全不参与策略与价值函数的训练，只在测试时（在线采样与评估执行）通过树搜索帮助挑选动作。策略提议 N=8 个候选动作，世界模型为每个动作想象 K=8 个未来状态，递归展开至深度 4，节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上，模型偏差不会复合进策略；在 Robomimic 与 LIBERO 机器人操作基准上，QWM 在样本效率与最终性能上均显著超越强基线，而传统 model-based 方法几乎无法在同等预算内学出非零成功率。</description></item><item><title>世界模型是具身的永动机吗：北京人形谈 VLA 续命、大一统与机器人幼儿园</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-world-model-perpetual-motion-embodied/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-world-model-perpetual-motion-embodied/</guid><description>《晚点聊》WRC 期间对话北京人形创新中心戴勇、张怡与前华为 AI 专家唐都钰。VLA 与世界模型的路线之争被拆到表征层：VLA 泛化差的病根是&amp;quot;特征漏斗+预训练与后训练范式不一致&amp;quot;；世界模型则被戴勇称为&amp;quot;AI 时代的永动机&amp;quot;——指望它生产数据，它本身却缺数据，&amp;ldquo;至少到现在是个童话&amp;rdquo;。北京人形的答案是 Pelican-Unify 大一统强耦合路线，年底 2.0 要拿出具身领域的 scaling law；唐都钰离职创业做&amp;quot;主动式物理因果模型&amp;quot;，并转述图灵奖得主 Sutton 的机器人幼儿园设想。</description></item><item><title>Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</guid><description>阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA（WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%）。核心论点是&amp;rsquo;对齐每一层&amp;rsquo;而非单点规模：结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹（仅用成功数据的SFT只能恢复8.5%的错误步骤）、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配，并发布双语真实网页基准BrowserBench（350任务均37.9步）。</description></item><item><title>Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-zetta-closed-loop-embodied-harness-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-zetta-closed-loop-embodied-harness-paper-reading/</guid><description>清华大学 AIR 团队提出 Zetta，一个能在部署时自我进化的闭环具身智能框架：冻结 VLA 基座策略不动，用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行，配合三时间尺度进化循环（动作级治理、批次级失败诊断修复、验证门控技能晋升）与专用推理基建 Z-Infra，在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%，在 RoboCasa 18 任务上从 73.56% 提升到 93.56%，推理延迟较 RPent 降低 91%，并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。</description></item><item><title>VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-vibeworlding-3d-agent-rl-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-vibeworlding-3d-agent-rl-paper-reading/</guid><description>港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent（从用户查询端到端构建可交互3D开放世界）的开源基准+训练统一框架：VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器（物理可行性+意图满足）；VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5（57.3%）与Qwen3.8-Max（56.9%）均远未解决该任务、瓶颈定位在精确3D世界编辑；RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一，8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88，为agentic RL提供了可靠奖励服务。</description></item><item><title>物理AI的下一站：让AI发现人类不知道的方程</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-chen-yuntian-physical-ai-paradigm/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-chen-yuntian-physical-ai-paradigm/</guid><description>机器之心对话东方理工陈云天：从&amp;quot;知识嵌入&amp;quot;到&amp;quot;知识发现&amp;quot;的双向耦合范式。用AI从真实实验数据中找出人类未知的控制方程（如海浪破碎方程），用机械臂高通量实验找色谱方程替代耗时实验；他判断AI科学家&amp;quot;一定到了这个节点&amp;quot;，但资本市场节奏与湿实验闭环的天然慢速之间正在撕开一个gap，而通用模型&amp;quot;每个行业都很浅&amp;quot;，真正的机会在把物理一致性嵌进专业模型。</description></item><item><title>Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-15-alaya-evoke-endless-world-paper-reading/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-15-alaya-evoke-endless-world-paper-reading/</guid><description>交互式世界模型要同时做到“记得住、答得快、跑得久”，但三者天然冲突。Alaya-EVOKE 给出了一个系统级解法：把持久记忆外部化为按相机位姿索引的世界状态库，让去噪器上下文有界；同时把“教师”本身当作设计变量，用稀疏注意力改造出能看 30 秒的长视野教师，再经 DMD 蒸馏出三步、无 CFG 的学生模型。结果是：WBench 导航拆分三组指标全第一、VBench-2.0 总分 66.77 登顶（超过 Veo 3），单卡 H200 上每 1.5 秒内容只需 2.11 秒生成，并且能连续跑一个多小时不崩。本精读面向初学者，拆解其三大机制、实验证据与效果优势的因果链。</description></item><item><title>在算力最多的地方做世界模型：对话英伟达Cosmos掌舵人刘洺堉</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-liu-mingyu-nvidia-cosmos-world-model/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-liu-mingyu-nvidia-cosmos-world-model/</guid><description>英伟达研究副总裁、Cosmos Lab负责人刘洺堉的4小时深度访谈。从GAN到Diffusion到世界模型的20年研究者之路，到Cosmos 3为何将语言/视频/音频/动作统一进单一模型，到&amp;quot;模型竞争不是零和游戏&amp;quot;的Low Ego哲学，再到黄仁勋的第一性原理决策与&amp;quot;不裁员&amp;quot;文化。他认为模型能力终将收敛，真正决定胜负的是生态整合；他不想击败任何人，只想帮助Physical AI整个领域成功。</description></item><item><title>ComBodied Agents: a New Paradigm of Human-Centric Agentic AI 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-12-combodied-agents-paper-reading/</link><pubDate>Wed, 12 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-12-combodied-agents-paper-reading/</guid><description>Bang Liu 团队 38 页范式论文，提出继 Digital Agents（数字状态）和 Embodied Agents（物理状态）之后的第三种 Agentic AI 行动基底——Combodied Agents（以人的演化状态为核心）。文章构建了一个以事件级多模态感知、可纠正纵向记忆、Personal World Models、可接受干预策略四模块组成的闭环框架，并把&amp;rsquo;保留并增强人类 agency&amp;rsquo;首次系统化为可评估的指标体系。本文从背景、定位、问题抽象、解法机制、评估体系、优势根源、必要知识反推、通用性灵感八个维度逐层精读。</description></item><item><title>Addressable Memory for Video World Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-worldtrace-video-memory-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-worldtrace-video-memory-paper-reading/</guid><description>交互式视频世界模型在长时程生成中会遇到一个隐蔽的「记忆失效」问题：KV cache 里明明存着过去的画面，模型却读不出来。本文精读 NVIDIA/Princeton/ Toronto 联合提出的 WorldTrace 框架，它精准定位了 RoPE 旋转位置编码超出训练范围导致的「内容不可寻址」根因，并用一套无需训练的虚拟槽位机制，在时间一致性上提升 15.5%、在 LoopBench 情景回忆上提升 19.5%。本精读将从世界模型的记忆机制讲起，逐层揭开位置编码、相位抵消、虚拟槽位、规范 key 平均等关键技术。</description></item><item><title>WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-wcm-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-wcm-paper-reading/</guid><description>VLA 模型做 RL 后训练时，critic（价值估计器）通常只看单帧画面——这和机器人控制&amp;rsquo;部分可观测&amp;rsquo;的本质根本不匹配。WCM（World Critic Model）基于 LeJEPA 架构，让 critic 同时预测未来潜在状态（世界建模）和估计价值，使 critic 的表示被显式训练去捕捉时序动态。在 149 个任务上，OpenVLA-OFT 的 in-distribution 成功率达 99.0%、out-of-distribution 达 77.9%；从 0.8% 的 zero-shot 提升超 12000%；7 个真实世界任务全面超越基线。本文从&amp;rsquo;纯标量回报回归不足以学时序动态&amp;rsquo;的第一性原理，解释为什么单纯加历史帧没用、必须加世界建模目标。</description></item><item><title>N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</guid><description>N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出，是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作（VTLA）基础模型。方法核心是三步训练配方：（1）在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验；（2）分阶段触觉通路集成，用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整；（3）ALTER——一种优势条件离线RL方法，将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务，在20任务仿真套件上平均成功率63.8%（最强baseline π0.5为44.0%），ALTER训练策略在3个长程真机任务上达到75-95%成功率。</description></item><item><title>ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-odeworld-continuous-world-model-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-odeworld-continuous-world-model-paper-reading/</guid><description>深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把&amp;rsquo;未来预测&amp;rsquo;重新定义为&amp;rsquo;在紧凑潜在空间里对一个连续速度场做积分&amp;rsquo;，靠动力学解耦 + 直接一阶 JVP 监督，一举绕开 JEPA 长期头疼的表示坍缩难题；还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上，64 帧长程预测延迟仅 0.072 秒，并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。</description></item><item><title>PhiZero: A World Model Built Around Physical Language 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-02-phizero-paper-reading/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-02-phizero-paper-reading/</guid><description>PhiZero由中科院自动化所提出，通过自监督学习从野外视频中提取紧凑离散的&amp;rsquo;物理语言&amp;rsquo;表示世界状态转移，采用&amp;rsquo;先推理后渲染&amp;rsquo;范式：自回归VLM先推理物理语言序列，再由扩散解码器渲染为视频。4秒33帧视频仅需256个离散符号（比Wan2.2 VAE压缩175倍），在Physics-IQ、PhyGround、WorldModelBench、IntPhys2四个基准上物理一致性全面超越Sora 2、Cosmos3等。</description></item><item><title>SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-02-spatialcli-paper-reading/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-02-spatialcli-paper-reading/</guid><description>SpatialCLI提出Call-Learn-Internalize三阶段框架，教VLM先用空间专家工具（定位/分割/深度/姿态）学会组合感知，再通过双视图训练将专家能力内化为无工具推理。8B模型内化后无工具达72.7%、带工具达91.3%，均超越GPT-5.6 Sol。论文揭示了&amp;rsquo;工具→RL→内化&amp;rsquo;的渐进式能力蒸馏新范式。</description></item><item><title>Momenta IPO 后再访曹旭东：没有尽头的 AI，从智驾到家庭机器人的十年推演</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-24-momenta-cao-xudong-endless-ai/</link><pubDate>Fri, 24 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-24-momenta-cao-xudong-endless-ai/</guid><description>Momenta 创始人曹旭东在 IPO 后接受「晚点聊LateTalk」专访，回顾十年创业历程，系统阐述智驾竞争格局（中国两三家、全球三四家的终局判断）、&amp;ldquo;一个飞轮两条腿&amp;quot;战略、每年十倍的智驾摩尔定律、从自动驾驶向家庭机器人的技术外溢逻辑，以及从 AI 研究员到 CEO 的认知进化——&amp;ldquo;一流的工作不是想出来的，是做出来的&amp;rdquo;。</description></item><item><title>2026 Q2 AI季报：RSI从科幻走向创业赛道，Coding战场大洗牌，强者愈强的未来</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-22-ai-q2-review-rsi-coding/</link><pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-22-ai-q2-review-rsi-coding/</guid><description>2026年Q2 AI季报深度解读：Anthropic与OpenAI的模型竞争进入新阶段，GPT 5.6与Claude Maestro/Phable正面交锋；RSI（递归自进化）从科幻概念变成明确的创业方向，Recursive、Miranda等公司涌现；Cursor以600亿美元天价被收购；中国开源模型&amp;quot;四杀&amp;quot;引发全球关注；Anthropic的Cloud Tag与OpenAI的Record and Replay重新定义AI交互。本文基于播客全文转写整理，涵盖竞争格局、RSI、机器人、智能扩散、交互创新和公司动态。</description></item><item><title>具身原生的豪赌：蚂蚁灵波沈宇军，为什么坚持从传感器和视频里重训整个机器人模型？</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-22-embodied-native-model-ant-lingbo/</link><pubDate>Wed, 22 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-22-embodied-native-model-ant-lingbo/</guid><description>蚂蚁灵波首席科学家沈宇军的深度访谈。他从GAN研究起步，经字节、蚂蚁研究院，最终主导蚂蚁灵波做机器人&amp;quot;大脑&amp;quot;。文章梳理了灵波最核心的技术主张——&amp;ldquo;具身原生&amp;rdquo;：不再沿用数字世界的模型做下游适配，而是从传感器、视频时序、单向MoE架构出发，为物理世界从头训练一套完整的机器人基础模型（V-Ren、DEPS、VLA 2.0、Video、Word六件套）。沈宇军也坦率谈到了数据是当前最大瓶颈、灵波为什么不做本体、以及他对&amp;quot;大脑落后于本体&amp;quot;这一行业判断。</description></item><item><title>世界模型这半年：XLR Labs 谈原生路线、4D 数据护城河与物理 AGI 的下半场</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-18-world-model-xlr-labs/</link><pubDate>Sat, 18 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-18-world-model-xlr-labs/</guid><description>《晚点聊》WAIC 期间对话 XLR Labs（拓元智慧）三位核心成员。这家从 2022 年起就押注&amp;quot;原生世界动作模型&amp;quot;的公司，分享了它与 VLA、隐式世界模型的路线分歧，千万小时级 4D 真实交互数据如何构成护城河，以及从智慧零售切入工业物流的&amp;quot;以终为始&amp;quot;商业化逻辑——一个关于&amp;quot;预训练与后训练一致性&amp;quot;的scaling law故事。</description></item><item><title>硅谷101 5月观点总结</title><link>https://inkeast.github.io/MessageDaily/posts/2026-05-28-guigu101-may-opinion-summary/</link><pubDate>Thu, 28 May 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-05-28-guigu101-may-opinion-summary/</guid><description>整理自硅谷101五月发布的五期播客节目，涵盖 Token 经济学、Google Gemini 发展历程与出走创业、机器人数据困境、AI Agent 社交革命、DeepSeek 与模型效率突围等话题。共5大主题，每期以&amp;quot;新变化&amp;quot;+&amp;ldquo;作者观点+解释&amp;quot;双维度整理，附4条跨期交叉洞察，让没看过原节目的读者也能快速理解观点背后的推理逻辑。</description></item></channel></rss>