编码智能体规划、信任原生 Agent OS 与开源后训练配方:三篇系统论文精读

本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》:现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略,平均成功率反超手工 TAMP planner(95%/82% vs 47%),决策速度毫秒级,为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》:提出首个以安全为第一设计约束的智能体操作系统,用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播,把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》:Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方,9.01M 样本 SFT 加多阶段 RL,IFBench 76.9 对官方 33.6,并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。

September 26, 2026 · 8 min

PACT: From Credit Assignment to Critic Alignment 精读

强化学习已成为大语言模型后训练的核心组件,但 token 级信用分配始终缺乏公认的数学定义。本精读拆解 AllSpark 团队的 PACT 论文:以完备性、前缀一致性、中性性三个正则条件唯一确定 token 级信用——即条件奖励预测的鞅差分序列;由此统一解释理想教师下的在线蒸馏等价隐式 critic、RLOO 的梯度等价性、以及 GAE 中间 critic 误差可淹没真实信用等现象;进而提出 Actor-then-Critic 更新顺序、重要性采样修正与 BCE 损失的 PACT 训练流程。在四个数学基准上平均 72.87%,SWE-bench Verified 达 67.4%,分别超越 GRPO 8.80 与 2.0 个百分点。

September 25, 2026 · 7 min

Harness-Zero:通过 Agent-as-Harness 实现 Harness 蒸馏——论文精读

精读北京大学与 Google 合作的 Harness-Zero,提出 agent-as-harness 范式:用一个审查型智能体在学生模型的响应边界上把进化出的专用 harness 收益「翻译」成可训练轨迹,经 SFT 把外挂行为蒸馏进权重,部署时彻底移除外挂。Qwen3.5-9B 宏平均成功率从 23.3% 提升到 44.3%,甚至超过挂载原 harness 的 41.7%。

September 23, 2026 · 6 min

IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读

IER-OPD(MBZUAI + 蚂蚁集团)研究同策略蒸馏(On-Policy Distillation, OPD)中一个反直觉的事实:训练学生模型时,绝大多数 token 的梯度几乎不携带有用学习信号,只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解,定义信息效率比 IER = 信号/噪声,并据此设计候选集近似与 soft OR/AND 多准则融合,用 IER 分数筛选「高信息效率」的 token。实验显示:仅用 0.1% 的 token 预算,AIME26 即可达到全量训练的近乎持平(58.9 vs 59.9);1% 预算下 AIME25 甚至超过全量(17.0 vs 14.4),且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验,并通过外部检索交叉验证 on-policy distillation(MiniLLM、GKD)与稀疏 token 选择等相关工作。

September 23, 2026 · 5 min

One to More, More to One:面向软件工程 Agent 的类别感知迭代专家训练(类别感知 SWE 专家训练精读)

阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架:SWE Labeler 用 47 个语义族 227 个标签做多轴标注,Agentic-miniRL 在可执行奖励下做长程 RL,RRE 循环(Refresh-Repair-Expand)让专家自蒸馏成功轨迹,Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%(较基座 +5.39),多语言 59.00%(+2.78),且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。

September 23, 2026 · 6 min

onPanda: 通过 Token 级纠错高效标注 LLM 与 Agent 的同策略对齐数据 精读

onPanda(阶跃星辰 StepFun + 厦门大学)提出以 token 级纠错为核心的新型标注范式:标注者只需定位第一个不合适的 token,从模型候选集中点选或自由改写,系统随即截断后续内容并由模型从修正后的前缀继续生成(locate-correct-continue 循环)。该范式让绝大多数 token 由 rollout 模型原生生成,从而在低成本标注的同时高度保留同策略(on-policy)保真度,并自动产出可精细到位置的监督信号。本文按九部分结构精读其动机、系统设计、实验证据,并通过外部检索交叉验证标注效率、同策略数据价值与 RLHF 标注工具(Argilla/POTATO/Reptile)等相关工作。

September 23, 2026 · 6 min

StudentSim: Training LLM-based Student Simulators 精读

微软研究院与 UIUC 的 StudentSim 把’AI 学生模拟器’形式化为可优化的双目标问题:行为保真度 F(复现特定学生的真实行为)与指导响应度 R(被导师教会的能力)。两阶段训练——跨学生池化预训练学共享模式 + 每生 LoRA 特化——让 Qwen3-4B 在国际象棋、二语写作、数学三个领域 F/R 双指标全面超过 prompted GPT-5.4(chess 0.51/0.91 vs 0.23/0.72),用其做奖励的导师 RL 经专家盲评三轴全胜(准确率 90.5% vs GPT-5.4 奖励的 71.6%)。本精读覆盖 F×R 分解的问题化、‘池化贡献多样性而非更新量’的消融证据、4B 特化胜过前沿 API 的机制根源,以及’模拟器即基础设施’的通用性灵感。

September 21, 2026 · 4 min

RetireOPD × EOS 终止符失配:在线策略蒸馏动力学二重奏 精读

两篇同日论文从训练动力学层面解剖在线策略蒸馏(OPD)。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突,于是让学生在分歧停止收缩且达到教师成功率阈值时自动’退休’教师,ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级:基座学生与后训练教师可能把停止概率放在不同 EOS token 上(即使声明停止集相同),把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读,构成’OPD 何时该用、何时会坏’的完整图景。

September 19, 2026 · 2 min

ComPO 零阶偏好对齐 与 SpectralShift 线性注意力长上下文扩展 精读(二重奏)

两篇训练方法学论文合并精读。UC Berkeley×NYU×阿里达摩院的 ComPO 提出 LLM 偏好对齐的零阶范式:不在偏好对上直接优化可微损失,而是用 comparison oracle 提取方向信息——规避 DPO 类方法在低似然边际对上的 likelihood displacement 失效,五个模型家族上改进含长度控制胜率,并给出收敛与性能保证。人大高瓴×MSRA 的 SpectralShift 从转移矩阵谱视角重新审视 Gated DeltaNet 的长上下文扩展:慢谱带宽度决定长程检索、快衰减模式负责状态清理,重参数化 alpha 投影初始化+学习率缩放即可让 10B 模型 8K→128K 课程扩展持续增益(RULER 64K +4.2)。

September 18, 2026 · 2 min

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读

上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』:蒙特卡洛估计的状态价值在响应内剧烈变化,critic 预测却近乎水平线。诊断出两大根因(MSE 隐含方差惩罚+相邻状态冗余更新)后提出 SP3O:每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp,K=3 优于 K=64,越稀疏越好——一个『少即是多』的教科书式发现。

September 18, 2026 · 3 min