GUI-HARVEST + DynaHarness + EvoGen-Harness 三篇合读:harness 自进化在 GUI、机器人、图像生成三条垂直域的落地

「冻结骨干、进化运行时」正在成为 agent 自进化的主流路线:GUI-HARVEST 用重复视觉执行证据加行为预测双门,在 OSWorld 六个骨干上最高提升 12.33 个百分点;DynaHarness 用快慢脑加物理执行契约,把冻结 π0.5 机器人策略从 17.5% 拉到 74.25%;EvoGen-Harness 用 where+how 联合归因进化,让冻结文生图模型在 GenEval2 上从 0.4456 涨到 0.7089。三篇论文分别代表 GUI、物理机器人、图像生成三条垂直域的 harness 进化代表作,本文合读三者的共同骨架、域特化设计与实验证据链,并讨论 harness 工程的边界与反例。

October 3, 2026 · 6 min

Encoder-Free Scaling Laws × UMM-Reflection:统一多模态模型的架构与反思双问 精读

本精读合并解读两篇直指「统一多模态模型」根本问题的论文:腾讯 + CASIA + UCAS 的 Encoder-Free Scaling Laws 用两条架构共享同一 11 级稀疏 MoE 解码器阶梯(1.1B–44B 总参)与同数据同优化设置的受控对比,首次给出 encoder-free 与 encoder-based MLLM 的双向 scaling law——文本目标两架构前沿几乎重叠(γ 0.0973 vs 0.0979),多模态目标 encoder-free 当前更差但下降更快(γ 0.3778 vs 0.2998),外推交叉点 6.1×10²¹ FLOPs(比旗舰模型预训练算力低约三个数量级),分主题 STEM 最早追平、OCR/Caption 最晚,配注意力质量(0.217→0.645)+ 表征余弦 + 专家路由三层机制探针解释「视觉 token 先慢后骤降」的学习动力学;NTU + 上海交大 + 东京大学的 UMM-Reflection 则是首个对统一模型完整多轮反思轨迹做 RL 的工作——共享根采样(K=16 兄弟轨迹共用一张 detach 初始图,组优势只比反思策略不比首抽运气)+ 整轨迹单一优势同时更新文本头与流头,GenEval 从 0.71 升至 0.84(超 SFT +12.05 点)、条件修复率 20.59%→64.94% 翻三倍,换指令实验(48.4% vs 20.5%)与线性探针(AUC 0.804→0.815 几乎不动、失败图落入 pass 区 34%→62%)证明 RL 是在骨干已有修复分布中「选对的切片」而非创造新能力。一篇回答预训练的结构问题(要不要视觉编码器),一篇回答后训练的能力问题(会不会自我反思),合成统一模型路线的完整纵切面。

September 30, 2026 · 6 min

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders 精读

本文精读 arXiv 2609.31620《FuseReg》。表示自编码器(RAE)用冻结视觉编码器的特征做扩散模型的 latent,但「融合哪些层」一直是个手工选择的固定配置:浅层利于重建、深层利于生成,一个固定融合把两个偏好不同的阶段绑死在一起。FuseReg 把层融合从「待选择的配置」重构为「训练分布」:训练时对编码器层做归一化随机子集采样,理论上证明该操作保持全层均值不变、恰好沿层间分歧方向注入方差,且二阶矩与任何确定性融合不可等价。仅换一个 FuseReg decoder 就把 ImageNet-256 无引导 gFID 从 3.01 降到 2.21(-27%),k=7 迁移场景从 27.73 降到 1.92,联合正则在 DiT-Base 上从 13.96 降到 9.93(-29%)。本精读覆盖背景、关联谱系、问题抽象、方法机制、实验证据链、外部交叉验证与可推广灵感。

September 29, 2026 · 7 min

AI 智能体行为的水印税与全模态 harness 双精读:Provenance Tax × Qwen3.8-Omni-Flash

本期二重奏精读收录两项围绕「AI 智能体」的研究。上篇解读 Lasso Security 的企业研究 The Provenance Tax:Anthropic 即将在 Claude 中部署的 SynthID-Text 水印虽然宣称非失真,但改变了逐 token 采样过程,实验证明它会改变智能体的工具调用与拒绝行为,注入攻击下 gemma-3-27b 的逐项判定翻转率高达 23.5%。下篇解读阿里通义千问技术报告 Qwen3.8-Omni-Flash:一个原生全模态智能体模型,凭 Thinker-Talker 架构、1M 上下文与智能体式选择性感知,把音视频理解的准确率与 token 成本同时推向新平衡,并开源 Qwen-MM-Plugins 与 Qwen-Live-Harness 两个框架。两篇文章合起来,恰好构成 2026 年智能体工程的两条主线:模型行为的可靠性边界,与全模态 harness 的系统化设计。

September 27, 2026 · 7 min

Training Object Permanence in World Models 精读

16 所高校联合团队发布 WROP 基准与训练资源,用 150 个 Blender 参数化生成器、150 万样本的系统化合成数据,检验并训练视频世界模型的「客体永久性」与「客体固体性」两类核心认知先验。微调得到的 16B 模型 PWM-WROP 在 20 人盲测成对比较中以 Elo 1679.5 位列真续写模型第一、全场第三,超最强真续写对手 222.5 Elo,且在匹配分辨率下 LPIPS 0.081、MS-SSIM 0.921 全场最优。本精读覆盖背景、定位、问题定义、解法、实验证据、优势根源与外部交叉验证、知识反推与通用灵感九个部分。

September 26, 2026 · 6 min

7B模型挤进闭源效果区、8块钱的翻唱与六个人的偶像工厂:云栖2026视听生成专场复盘——当创作被批量供给,稀缺的成了故事与判断

2026 云栖「视听生成:多模态创作与文化娱乐」专场复盘:千问Image 2.1 以 7B 开源挤进闭源效果区并获英特尔 Day Zero 端侧支持;Wan 3.0 与 Agentic PE 把视频生成推向导演思维;Happy Shrimp 1.1 要让不懂乐理的人「像写代码一样做音乐」;太合音乐总裁余灏摊开 8 元 AI 翻唱对 5000—30000 元实录的成本塌缩与 3000 个版本的维权困局;小旭音乐六人团队运营十几个 AI 歌手、四五个月全网播放破两亿。当供给端被无限放大,「为什么表达」成了全场最贵的提问。

September 24, 2026 · 4 min

从繁星到灯塔:当数据耗尽成为时间表,AI 竞争换到了哪条赛道

云栖2026「从繁星到灯塔」数据与评测分论坛全程复盘:七场分享拼出一条主线——人类数据将在2026-2032年间触及上限,合成数据有塌缩与奖励欺骗两大天然短板,模型竞争从拼参数量转向数据资产厚度、闭环转速与评测可信度。文中整理数据飞轮七节点框架、基准设计的科学与艺术、科学/具身两条垂类数据基建,以及"人类数据是RSI锚点"的判断,并给出五条可观察的行业机制链。

September 24, 2026 · 2 min

入口在嘴、生产力在 Agent:语音大模型降价九成五之后——云栖2026 千问语音论坛综述

2026 云栖大会千问语音论坛发布 Qwen-Audio-3.1:ASR 从转写走向理解、TTS 一次生成全声景、Realtime 前台双工加后台 Agent 框架,全线 API 降价最高九成五。得到、网易、人民日报、容联云四家展示了笔记、游戏、媒体、催收的落地。本文梳理其机制、二阶影响与读者可用的判断标准。

September 24, 2026 · 3 min

台前是 Agent,台后是数据湖:云栖 2026 多模态数据训推论坛复盘

云栖 2026「多模态数据处理与模型训推论坛」八场演讲复盘:预训练红利见顶后,数据生产成本与模态复杂度同步上升,竞争焦点转向数据闭环与模型闭环的双飞轮。本文梳理卓驭一湖两域、PAI 的 token 经济学、TeleAgent 六十万员工规模化、DLF agentic lake、乐享元游 Data Agent 与微财 L0-L3 特征开发自动化六条主线,拆解"深度用户仅约 5%“背后的语义、权限与血缘瓶颈,并给出可迁移的机制—影响—启发链条。

September 24, 2026 · 3 min

存储走上业务关键路径:从具身数据洪流到Agent记忆底座——云栖2026「AI and Agentic存储解决方案」五场景实录

云栖大会2026「AI and Agentic存储解决方案」专场,阿里云与穹彻智能、卓驭科技、小鹏、美图、智创星云沿数据旅程拆解存储如何从后台走到业务关键路径:具身数据年增477.78%下的众包上行与帧级随机读写、智驾闭环的稳快省、Lance加OSS加速器让30PB数据湖读吞吐提升20倍、AI重写存储治理范式,以及Session与Memory分家的Agent存储底座。附系统性同音词ASR校正实录。

September 24, 2026 · 1 min