Self-Evolving Coding Agents × RE-0:从数字程序到物理世界的自进化智能体 精读

二重奏精读两篇互补论文:hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式,用 Code as World + Code as Policy 双可执行表征与类型化验证器,把编码代理范式迁移到物理世界,在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%;吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入,仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练,勾勒物理世界自进化智能体的完整图景。

September 30, 2026 · 7 min

真武是系统,不只是芯片:平头哥算力峰会上的超节点方法论

整理2026云栖大会平头哥算力峰会「云模之芯,共筑非凡」全场内容。平头哥副总裁李伟良梳理真武810E→M890→V900→J900的年度迭代节奏;阿里云王超给出「系统语义不在物理边界断裂」的真超节点判据;Kimi许欣然拆解100毫秒decode里的访存经济学;元戎启行曹通易与无界动力夏中谱讲物理AI的数据量级与快慢脑;圆桌与倚天CPU、磐脉920网卡两场把Agent时代的关键路径补完整。芯片竞争已从单卡指标转向系统协同。

September 24, 2026 · 1 min

机器人 Scaling Law 出现了吗?——徐梦迪的答案:有信号,但真正的分水岭是 in-context learning

清华叉院助理教授徐梦迪在「十字路口」提出:具身领域已出现预训练数据从十万到百万小时、held-out loss 随规模下降的 scaling 信号(如 Dyna-2 百万小时人类视频预训练),但 loss 与真机成功率脱钩,真正有意义的是『未见任务成功率随规模上升』的 scaling law;她判断当前主流 VLA 的『预训练+微调』范式对应 GPT-1 时刻,期待的是通过 prompting 适应个体偏好的 GPT-3 时刻。本文拆解她论证中的证据链、与世界模型路线的关系,以及数据定义由模型能力反推的行业机制。

September 21, 2026 · 2 min

ActionPiece 精读:用『物理秩一致性』拯救动作 tokenization 的关系保真

华中科大×DeepCybo 等七机构联合提出 ActionPiece:自回归 VLA 模型的动作 tokenizer 传统上只用 MSE 评估重建精度,但点态误差小不等于关系保真——压缩后『不同情境所需的差异化动作』可能被压缩、扭曲甚至反转。论文提出 Physical Rank Consistency(PRC)度量局部物理距离排序的保持,并通过对表示学习与量化的联合监督(物理秩保持+量化正则)让离散 token 保留连续动作空间的局部序结构。同一 Qwen3-VL-4B 策略训练设置下:LIBERO 94.8%、未见 LIBERO-Plus 68.8%、SimplerEnv 71.9%。

September 18, 2026 · 2 min

具身智能的四条路线分歧:数据、Astra 与商业化的真问题

2026 外滩大会圆桌实录:苏度韩铮、蚂蚁灵波沈宇军、自变量王潜、破壳许华哲四位一线创业者正面回答具身智能三场路线之争——仿真还是真机、GPT-6 Astra 是否构成降维打击、跨过泡沫的指标是什么。共识是具身不会复刻语言模型路径,分歧在数据从哪来、智能住在哪里、钱从哪来。

September 14, 2026 · 1 min

触觉是具身智能的最后一块拼图吗:五大技术路线、数据困局与模型之争

硅谷101走进触觉传感器实验室,梳理压阻、压电、电容、光学、磁感应五条技术路线,解释触觉数据为何接近于零、真机采集的"屏蔽悖论",以及端到端时代触觉融入模型的两种范式之争。几乎所有受访嘉宾认为2026年触觉处于爆发前夜,量产一致性与数据生态是接下来一年的关键观察点。

September 7, 2026 · 1 min

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning 精读

深度精读 MirroS 联合清华、北大、南洋理工的技术报告 Code as Worlds。论文提出用可执行代码表示物理世界的组成、演化与外观(EWR 三元组),把’从观测恢复世界表示’建模为溯因式的 agent 发现环:提出-实例化-执行-渲染-验证迭代修正。再用验证过的世界免费生成带精确物理量标签的 VQA 数据训练 VLM,9B 模型在 QuantiPhy 上 55.4 分超过 Gemini-3.1 Flash 的 54.8,27B 推理变体 58.6 分超过全部基线。

August 31, 2026 · 3 min

PLCBench: Can Autonomous LLM Agents Turn PLC Access into Sustained Physical Impact? 精读

浙大、西交大与布里斯托尔大学团队提出 PLCBench,首个真 PLC 硬件在环(HIL)评估框架,系统测量自主 LLM agent 能否把网络可达的工业控制器转化为持续物理影响。框架保留四家厂商原生协议语义,用六层隐藏诊断旗标与四源确定性取证把攻击能力拆解为接口获取与物理转化两段。在 4 台商用 PLC、4 个闭环工况、5 个模型、3 个种子共 240 个有效回合(118 聚合 PLC 小时)中,31.3% 达成持续物理影响,GPT 5.5 以 79.2% 覆盖全部 16 个格子,而最弱模型仅 10.4%;98 个回合停在接口获取,62 个停在物理转化,丰富观测使写后条件达成率提升 19.8 个百分点。本精读逐节拆解其设计因果链与防御启示。

August 29, 2026 · 7 min

Redwood: A Frontier AI Accelerator Designed, Verified, and Deployed from Scratch in 2 Weeks by AI 精读

Architect Labs 的 AI 系统在两名人类架构师只写高层规范的前提下,用不到两周自主生成性能模型、RTL、UVM 验证环境、形式证明、固件与计算内核,所有模块达成 95% 代码与功能覆盖率,首次上 FPGA 零 bug,架构变更 48 小时内完成再验证再部署;投影至 Samsung 8nm 工艺后,Redwood 以 49 tokens/s@1.335W 对比 Jetson Orin Nano 同模型实测 28 tokens/s@2.59W,能效提升 3.4 倍。本精读面向软件背景读者,补全 RTL、UVM、形式验证、FPGA、roofline 等概念,剖析单一规范源全栈协同生成的因果链,并提炼七条可迁移的系统设计灵感。

August 29, 2026 · 7 min

世界模型是具身的永动机吗:北京人形谈 VLA 续命、大一统与机器人幼儿园

《晚点聊》WRC 期间对话北京人形创新中心戴勇、张怡与前华为 AI 专家唐都钰。VLA 与世界模型的路线之争被拆到表征层:VLA 泛化差的病根是"特征漏斗+预训练与后训练范式不一致";世界模型则被戴勇称为"AI 时代的永动机"——指望它生产数据,它本身却缺数据,“至少到现在是个童话”。北京人形的答案是 Pelican-Unify 大一统强耦合路线,年底 2.0 要拿出具身领域的 scaling law;唐都钰离职创业做"主动式物理因果模型",并转述图灵奖得主 Sutton 的机器人幼儿园设想。

August 22, 2026 · 2 min