ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读

上海交通大学提出ABSeeker,通过答案回溯线索恢复(ABCR)和线索锚定步级评分(CASS),将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本,ABSeeker在BrowseComp上达55.3%,匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。

August 6, 2026 · 2 min

OPD-V: Visual On-Policy Self-Distillation with Modality Balance 精读

本文揭示了多模态LLM推理中’模态不平衡’对自蒸馏(OPSD)效果的隐性破坏。通过构建Positive Teacher(放大图像)和Negative Teacher(遮蔽图像),发现模态平衡本身可作为特权信息。提出模态平衡信任域选择on-policy token进行蒸馏,跨6个基准、4个MLLM基座、5种后训练方法一致提升推理性能并降低训练成本。

August 6, 2026 · 1 min

Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation 精读

微软研究院系统性诊断自蒸馏(SD)作为RLVR替代方案的根本缺陷。通过单一因果链揭示:特权信息(PI)偏见使教师的per-token目标偏向特定参考解而非通用正确性,学生损失集中于低信息token,最终训练信号与任务成功解耦。在QA、数学、编码和Agent工具使用四个领域跨模型规模和PI形式验证,为OPSD/SDPO研究方向提供根本性警示。

August 6, 2026 · 2 min

【论文精读】Any-OPD:通过表示空间桥接实现异构流匹配模型的在策略蒸馏

京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题:用冻结DINOv2表示空间桥接不兼容的潜在空间,仅训练LoRA适配器,将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生,在多项指标上实现’学生超越教师’的奇迹。ImageReward提升是教师自身优势的近4倍。

August 5, 2026 · 4 min

DAPD: Dual-Anchored Policy Distillation 精读

On-policy 自蒸馏(OPSD)本该是 LLM 后训练的稳妥方法,但它会让模型越练越差——DAPD 首次诊断出根因是’特权幻觉’:训练时教师能看到参考答案,推理时学生看不到,学生却表现得像参考答案还在一样。DAPD 用双路径锚定(DPA)和双源锚定(DSA)在匹配信息可用性下对齐,让 Qwen3-4B 平均 +2.00,且关键的是——OPSD 增益在 8B 以上几乎消失,DAPD 在 32B 仍稳定 +2.78。本文从’信息不对称’的第一性原理出发,解释为什么改信号不如改结构。

August 5, 2026 · 2 min

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读

RLVR(带可验证奖励的强化学习)让 LLM 在数学、代码等可确定性判对的领域突飞猛进,却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL:借鉴自监督学习「构造前置任务」的思路,把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的,投票结果天然可验证,从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero,甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案,且成本为 0。

August 3, 2026 · 9 min

Perception-Correction Distillation:多模态推理器感知蒸馏信用分配精读

中科院自动化所Hongyu Lin团队提出PCD(Perception-Correction Distillation),用下游失败和师生分歧作为互补见证的贝叶斯证据组合,形成软AND门精准识别’可纠正的感知失败’。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28,32B→8B从56.94提升至61.22。

August 2, 2026 · 1 min

β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读

β-OPSD揭示在线策略自蒸馏(OPSD)是KL正则化策略优化家族中β=1的特例,将β从隐式固定值变为可控参数后,最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标,用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分,持续超越vanilla OPSD、SFT和GRPO。

August 2, 2026 · 2 min

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读

RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施,隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」:Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试,但在达到峰值后继续搜索时,78.26% 反而退化。强运行轨迹有四种模式:准确假设、验证信号、行为对齐数据、保留最佳检查点。

July 31, 2026 · 3 min

Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models 精读

这篇 ACL 2026 Main 论文首次系统性地揭示了「不完全学习现象」(ILP):即使训练损失收敛,LLM 仍有约15%的训练样本无法被正确复现。论文将这一现象归因为五个可诊断的来源,并提出了一个「先诊断、再对症下药」的框架,证明了SFT失败的异质性——不同原因需要不同解法。

July 13, 2026 · 4 min