GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读:harness 自进化在 GUI、机器人、图像生成三条垂直域的落地

「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线:GUI-HARVEST 用重复视觉执行证据加行为预测双门,在 OSWorld 六个骨干上最高提升 12.33 个百分点;DynaHarness 用快慢脑加物理执行契约,把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%;EvoGen-Harness 用 where+how 联合归因进化,让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作,本文合读三者的共同骨架、域特化设计与实验证据链,并讨论 harness 工程的边界与反例。

October 3, 2026 · 6 min

训练前沿四重奏:蒸馏外推、规模解除、奖励治理与具身评测 精读

本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文:RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推,四组基座全部追平或超越教师;OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」,用验证脚手架解除;ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式,合取式协议级评分回收三分之一损失;GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线:监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。

October 2, 2026 · 8 min

Self-Evolving Coding Agents × RE-0:从数字程序到物理世界的自进化智能体 精读

二重奏精读两篇互补论文:hexafuture.ai 的 Self-Evolving Coding Agents 提出物理编码范式,用 Code as World + Code as Policy 双可执行表征与类型化验证器,把编码代理范式迁移到物理世界,在 RoboCasa365 上把成功率从 56.6% 提升到 61.1%;吉林大学与大连理工的 RE-0 用 locate-verify-weight 递归和 LCB 准入,仅凭 3-67 条验证数据把具身 Code-as-Policy 基线从 4-68% 提升到 62-100%。一篇搭系统、一篇做训练,勾勒物理世界自进化智能体的完整图景。

September 30, 2026 · 7 min

编码智能体规划、信任原生 Agent OS 与开源后训练配方:三篇系统论文精读

本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》:现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略,平均成功率反超手工 TAMP planner(95%/82% vs 47%),决策速度毫秒级,为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》:提出首个以安全为第一设计约束的智能体操作系统,用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播,把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》:Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方,9.01M 样本 SFT 加多阶段 RL,IFBench 76.9 对官方 33.6,并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。

September 26, 2026 · 8 min

Agent的确定性从哪来:全栈平台与草台班子的双向奔赴

云栖2026「企业级Agent基础设施」论坛全记录:阿里云发布Agent Studio全栈服务平台与硬件版,把开发、运行、评测、进化收进一条链路;千问端侧模型、高通异构计算、英伟达边缘推理引擎三方把Agent送往手机、座舱与机器人;友邦、阿里云产品博士、三棵小草给出「从答得准到办得成」的客户账本;OPC圆桌则揭示确定性最终由真实场景构建者反推。含转写校正、七项外部核验与四条机制-影响-启发链。

September 24, 2026 · 1 min

为Agent重做数据层:湖库一体、多模数据库与KV Cache,云栖2026一场论坛的五个答案

2026云栖大会数据库论坛《为Agent重做数据层》全链路复盘:Apsara LakeBase以湖库一体与秒级弹性重做Agent成本曲线,PolarDB多模引擎、ADB具身数据闭环、SelectDB/ClickHouse/Lindorm各守一环,Tair语义缓存把QReCC命中率13%提到80%、KV Cache让百炼命中率90%→96%。当Agent成为数据的主要生产者与消费者,数据层正从容器变成工作底座。

September 24, 2026 · 1 min

从繁星到灯塔:当数据耗尽成为时间表,AI 竞争换到了哪条赛道

云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘:七场分享拼出一条主线——人类数据将在2026-2032年间触及上限,合成数据有塌缩与奖励欺骗两大天然短板,模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建,以及"人类数据是RSI锚点"的判断,并给出五条可观察的行业机制链。

September 24, 2026 · 2 min

在像素里复刻世界之前,先给世界定一把尺——云栖2026世界模型分论坛全记录

云栖2026「世界模型:从构建数字世界到物理世界」分论坛八场演讲与圆桌的完整复盘:阿里联合高校发布W1-W6能力分级、超1600用例的Benchmark与超10万次对战的Elo Arena,给名实混乱的世界模型定了第一把尺;长视频误差累积、GPT-6吞噬具身上层能力、实时会话基建与「消费即创作」的IGC叙事,构成从数字世界通往物理世界的四道门槛。

September 24, 2026 · 1 min

存储走上业务关键路径:从具身数据洪流到Agent记忆底座——云栖2026「AI and Agentic存储解决方案」五场景实录

云栖大会2026「AI and Agentic存储解决方案」专场,阿里云与穹彻智能、卓驭科技、小鹏、美图、智创星云沿数据旅程拆解存储如何从后台走到业务关键路径:具身数据年增477.78%下的众包上行与帧级随机读写、智驾闭环的稳快省、Lance加OSS加速器让30PB数据湖读吞吐提升20倍、AI重写存储治理范式,以及Session与Memory分家的Agent存储底座。附系统性同音词ASR校正实录。

September 24, 2026 · 1 min

当智能体替人跑一整天:PAI 分论坛上,AI 基础设施的三次换轨

2026 云栖大会「人工智能平台 PAI」分论坛全程复盘。PAI 负责人周文超用负载、范式、边界三个词定义 Agentic AI 对基础设施的重塑:推理调用次数增长数百倍使 KV cache 命中率成为第一指标,RL 算力消耗逼近预训练把「稳」变成生产化门槛,具身智能则把战场拉回数据质量。文中串联小米广告 +8 个点收入、大众故障归因数天级压缩、SciMaster 六小时顶博士三个月、圆桌「一千小时低质数据不如一小时高质量」等关键证据,提炼出从压榨算力到压榨数据、从模型精度到迭代周期的观察坐标。

September 24, 2026 · 3 min