IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读

IER-OPD(MBZUAI + 蚂蚁集团)研究同策略蒸馏(On-Policy Distillation, OPD)中一个反直觉的事实:训练学生模型时,绝大多数 token 的梯度几乎不携带有用学习信号,只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解,定义信息效率比 IER = 信号/噪声,并据此设计候选集近似与 soft OR/AND 多准则融合,用 IER 分数筛选「高信息效率」的 token。实验显示:仅用 0.1% 的 token 预算,AIME26 即可达到全量训练的近乎持平(58.9 vs 59.9);1% 预算下 AIME25 甚至超过全量(17.0 vs 14.4),且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验,并通过外部检索交叉验证 on-policy distillation(MiniLLM、GKD)与稀疏 token 选择等相关工作。

September 23, 2026 · 5 min

One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)

阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。

September 23, 2026 · 6 min

onPanda: 通过 Token 级纠错高效标注 LLM 与 Agent 的同策略对齐数据 精读

onPanda(阶跃星辰 StepFun + 厦门大学)提出以 token 级纠错为核心的新型标注范式:标注者只需定位第一个不合适的 token,从模型候选集中点选或自由改写,系统随即截断后续内容并由模型从修正后的前缀继续生成(locate-correct-continue 循环)。该范式让绝大多数 token 由 rollout 模型原生生成,从而在低成本标注的同时高度保留同策略(on-policy)保真度,并自动产出可精细到位置的监督信号。本文按九部分结构精读其动机、系统设计、实验证据,并通过外部检索交叉验证标注效率、同策略数据价值与 RLHF 标注工具(Argilla/POTATO/Reptile)等相关工作。

September 23, 2026 · 6 min

OSWorld-Pro:用过程式评测给 Computer-Use Agent 做「分步体检」

OSWorld-Pro 是 NVIDIA 提出的首个面向 Computer-Use Agent(CUA)的过程式评测基准,用来补 OSWorld 那类「只看最终结果」评测的盲区。它包含 305 个长程任务、2814 个顺序依赖子目标、67,264 条步级人工标注(>5000 人时),覆盖 Diversity(117)/ Coordination(109,需跨 ≥4 个应用)/ Robustness(79,跨 Linux 发行版与 GUI)三类,任务平均 9.2 个顺序子目标、3.45 个应用(OSWorld 仅 1.34)。论文用与人类对齐的 LLM-Judge(GPT-5.6-Sol Max)做子目标完成度判定,其 1-MAE 达 93.0,逼近人类标注的 96.0。核心发现:即便最强模型也很吃力——Claude Opus 4.8 Max 以 77.7% 总完成率居首(OSWorld 同级最强 Opus 为 83.4%);开源最佳 Qwen3.8 Flash Next 仅 55.1%,且在 Robustness 上骤降到 32.9%;Minimax M3 从 OSWorld 的 75.2% 暴跌到 28.9%。过程式视角还暴露了结果式评测看不到的失败模式:强模型也会陷在 subgoal-irrelevant 动作里(Claude Opus 5 曾卡 59 步做无关操作),弱模型则在 click 坐标这类基础操作上频繁出错。本文按九部分结构拆解其背景、定位、问题定义、数据构建、LLM-Judge 设计、外部交叉验证、核心结果、失败模式分析与启示。

September 23, 2026 · 5 min

RoboDawn:让通用 VLM 零训练接管机器人控制,以及 GPT-6 Astra 的零样本佐证 精读

以清华大学胡事民团队 RoboDawn 为主线精读:它用一套人类直觉的「语义原语接口」(离散平移/旋转/夹爪命令)把机器人控制暴露给 agentic VLM,配合无需参数更新的 in-context learning 与闭环决策,在 RoboTwin 2.0 上单样本 73.6% 成功率,超 HarnessVLA 的 58.4%。同日 RoboProbe 等发布的 GPT-6 Astra 在 RoboDojo 零样本 22.48% SR 登顶,却能力两极化(Precision 仅 4.00 vs DM0.5 16.75),为「通用大模型已具备机器人控制潜质、但精度是短板」提供独立佐证。

September 23, 2026 · 3 min

RRSI: Regularized Recursive Self-Improvement of Agent Harnesses 精读

深度精读 Google Cloud AI Research 等提出的 RRSI——首个把机器学习正则化思想系统迁移到 Agent Harness 递归自我改进的工作。文章从 Harness 与 RSI 概念讲起,拆解过拟合问题的成因,逐一讲解提案侧 L0 式退火编辑预算、证据感知信用分配、结构化探索,与选择侧泄漏筛查、噪声调整底线、L2 式成本门槛、L1 式结构剪枝,并结合八基准三域实验与外部检索交叉验证,剖析其「为何能泛化」的根源性解释与可迁移灵感。

September 23, 2026 · 5 min

VibeMemBench:在真实仓库任务上用可执行测试受控评测 Coding Agent 记忆系统

VibeMemBench 是首个把「真实仓库编程任务 + 可执行测试」与「持久记忆系统」接起来的受控评测基准:它不考记忆系统能否答对回忆题,而考注入的历史经验能否真正提升可执行的仓库修复结果。论文用 SIEVE 四阶段流水线(来源校验、补丁模式筛选、历史执行与经验蒸馏、验证 uplift 并冻结)从 90 个仓库筛出 111 个目标与 3634 条历史轨迹,并提出「只改记忆开关」的匹配干预协议。核心结论有反差感:冻结的、已被执行验证过有用的经验,迁移到 5 个预留 solver 时让 4 个的解决率提升 1.1~4.5 个百分点、且步数全面下降;但当 Mem0 / SimpleMem / MemoryOS / A-MEM 这四个现有记忆系统必须从同一段历史里自己写、自己检索经验时,12 组 solver×系统配对中有 11 组没能超过「不开记忆」的配对基线。失败归因显示主因不是「没检索到」(ranking miss 仅 1.3%),而是「记录形态崩坏」(form degradation 占 69.3%)——strip 消融进一步证明危害来自原始 transcript 的体积而非指令语义。本文按九部分结构拆解其背景、定位、问题定义、构建方法、评估协议、外部交叉验证、核心结果、根因分析与启示。

September 23, 2026 · 4 min

WorldCrafter:用隐式 3D 感知记忆打造可一致探索的视频世界模型 精读

深度精读腾讯 IEG ARC Lab 与北京大学联合提出的 WorldCrafter。它用一个「隐式 3D 感知记忆」模块让视频世界模型在长时间、可自由探索的交互中保持场景一致性:以 LagerNVS 初始化记忆编码器、用姿态引导读出、与视频 DiT 联合训练,配合最大覆盖历史检索与少步蒸馏,在 4 卡上达到 16fps 实时。重访一致性 LPIPS 从 Lyra 2.0 的 0.487 降到 0.255,相机控制旋转误差 13.536 为全场最低。

September 23, 2026 · 3 min

从卖 Token 到交付结果:云栖 MaaS & Agent 主论坛,阿里把'智能的价值密度'摆上台面

2026 云栖技术主论坛 MaaS & Agent 场(14009 秒官方回放完整转写):文征以’智能价值密度’回应 token 通缩论,千问 AI 平台扩展为模型服务+Agent 服务+行业方案三层,发布 Agent Studio、Token Plan 订阅、Qoder 全新升级、千问办公企业上下文、QwenNote A2、Qwen Intelligence 手机方案,云市场升级为 AI 应用市场。圆桌上贝壳、安克、西门子、基元律动、元戎给出落地路径与真实分歧,关键数字经外部多源核验,自报口径已标注。

September 23, 2026 · 5 min

当昂贵的 GPU 开始等便宜的数据:云栖 2026 存储专场,CPFS 商用与 KVCacheStore 首发背后的一笔账

2026 云栖大会存储专场全程复盘(10757 秒转写):训练迈向百万卡、推理上下文冲向百万 token,瓶颈正从算力转向数据存取。阿里云商用全栈自研 CPFS(单文件系统 100PB),首发 KVCacheStore(用 SSD 换显存,Kimi 实测 TTFT 降 54%),OSS 表格桶补齐全模态湖仓,EBS 从盘进化为池。关键数字经外部交叉核验,自报口径已标注。

September 23, 2026 · 4 min