ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读

上海交通大学提出ABSeeker,通过答案回溯线索恢复(ABCR)和线索锚定步级评分(CASS),将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本,ABSeeker在BrowseComp上达55.3%,匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。

August 6, 2026 · 2 min

OPD-V: Visual On-Policy Self-Distillation with Modality Balance 精读

本文揭示了多模态LLM推理中’模态不平衡’对自蒸馏(OPSD)效果的隐性破坏。通过构建Positive Teacher(放大图像)和Negative Teacher(遮蔽图像),发现模态平衡本身可作为特权信息。提出模态平衡信任域选择on-policy token进行蒸馏,跨6个基准、4个MLLM基座、5种后训练方法一致提升推理性能并降低训练成本。

August 6, 2026 · 1 min

Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation 精读

微软研究院系统性诊断自蒸馏(SD)作为RLVR替代方案的根本缺陷。通过单一因果链揭示:特权信息(PI)偏见使教师的per-token目标偏向特定参考解而非通用正确性,学生损失集中于低信息token,最终训练信号与任务成功解耦。在QA、数学、编码和Agent工具使用四个领域跨模型规模和PI形式验证,为OPSD/SDPO研究方向提供根本性警示。

August 6, 2026 · 2 min

SafeCommit: Certifying When Memory-Grounded Agents May Safely Act 精读

本文形式化定义了’记忆不确定性下的安全承诺’问题——Agent在记忆过时、冲突或被污染时不应执行不可逆的外部动作。SafeCommit在Agent推理与外部执行间插入风险控制层,利用保形预测构建可能潜在世界集合,仅当动作在每个保留世界中安全时才允许执行。在校准世界覆盖下,不安全认证承诺概率被数学保证不超过目标水平α。

August 6, 2026 · 2 min

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models 精读

腾讯提出WorldCycle,利用可逆动作循环的物理对称性作为免标注自验证RL信号。通过空间闭合奖励和时间一致性奖励,将视频世界模型的状态返回漂移降低44%,复合动作准确率提升近4倍。核心突破在于:不需要任何ground-truth未来状态,物理可逆性本身就是密集监督信号。

August 6, 2026 · 2 min

【论文精读】Any-OPD:通过表示空间桥接实现异构流匹配模型的在策略蒸馏

京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。

August 5, 2026 · 4 min

AURORA-LM:连续潜在扩散语言模型精读

深度精读南京大学联合 HKUST 等校的 AURORA-LM:把文本生成从离散 token 推向连续潜在空间。它用 Query-based 编解码器构建高容量可解码潜在序列,用块因果扩散 Transformer 左到右生成块、块内并行去噪,靠噪声输入瓶颈、自轨迹一致性等创新,在 OpenWebText 和 XSum 上拿下所有连续/扩散语言模型最优,1B 参数版本超越更大的 Cola-DLM(1.8B),全程在昇腾 NPU 上完成。

August 5, 2026 · 2 min

DAPD: Dual-Anchored Policy Distillation 精读

On-policy 自蒸馏(OPSD)本该是 LLM 后训练的稳妥方法,但它会让模型越练越差——DAPD 首次诊断出根因是’特权幻觉’:训练时教师能看到参考答案,推理时学生看不到,学生却表现得像参考答案还在一样。DAPD 用双路径锚定(DPA)和双源锚定(DSA)在匹配信息可用性下对齐,让 Qwen3-4B 平均 +2.00,且关键的是——OPSD 增益在 8B 以上几乎消失,DAPD 在 32B 仍稳定 +2.78。本文从’信息不对称’的第一性原理出发,解释为什么改信号不如改结构。

August 5, 2026 · 2 min

DiffusionGemma Technical Report 精读

自回归(AR)LLM 逐 token 解码是根本瓶颈——DiffusionGemma 把语言模型生成从’逐 token 预测’改成'256 token 块并行精炼’。基于 Gemma 4 MoE(3.8B 激活/25.2B 总参)微调,两阶段训练(SFT 教双向去噪 + RL+采样器蒸馏提升质量与效率)用不到原 AR 模型 10% 的训练 token 预算,实现单张 H100 上约 1500 tokens/秒、约 20 tokens/forward pass,确立速度-能力新帕累托前沿。它仍保留 thinking mode、多模态、长上下文,且能 AR 生成,为混合扩散-AR 解码铺路。本文从’扩散模型并行精炼 vs AR 顺序解码’的第一性原理,解释为什么这条路能打破 AR 的固有瓶颈。

August 5, 2026 · 1 min

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories 精读

Agent 部署后会积累大量失败轨迹,但它的行为通常固定不变——模型不更新,Harness(运行时框架)也不更新。Harness-R1 首次把’编辑可执行运行时’本身变成一个可被在线 RL 训练的能力:一个 9B 的’harness 工程师’模型从失败批次中生成可执行补丁,用冻结目标 Agent 重跑的真实成功率作为奖励。结果这个 9B 工程师反超 GLM-5.2、GPT-5.5、DeepSeek-V4-Pro 等所有更大的前沿模型编辑器;即便目标 Agent 微调后,工程师仍能再 +5.0pp。本文从’把脚手架变成可学习对象’的第一性原理,解释为什么小模型+真实结果奖励能赢过大模型+教师提议。

August 5, 2026 · 2 min