<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>知识蒸馏 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E7%9F%A5%E8%AF%86%E8%92%B8%E9%A6%8F/</link><description>Recent content in 知识蒸馏 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Fri, 02 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E7%9F%A5%E8%AF%86%E8%92%B8%E9%A6%8F/index.xml" rel="self" type="application/rss+xml"/><item><title>训练前沿四重奏：蒸馏外推、规模解除、奖励治理与具身评测 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</guid><description>本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文：RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推，四组基座全部追平或超越教师；OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」，用验证脚手架解除；ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式，合取式协议级评分回收三分之一损失；GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线：监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。</description></item><item><title>Harness-Zero：通过 Agent-as-Harness 实现 Harness 蒸馏——论文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-harness-zero-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-harness-zero-paper-reading/</guid><description>精读北京大学与 Google 合作的 Harness-Zero，提出 agent-as-harness 范式：用一个审查型智能体在学生模型的响应边界上把进化出的专用 harness 收益「翻译」成可训练轨迹，经 SFT 把外挂行为蒸馏进权重，部署时彻底移除外挂。Qwen3.5-9B 宏平均成功率从 23.3% 提升到 44.3%，甚至超过挂载原 harness 的 41.7%。</description></item><item><title>One to More, More to One：面向软件工程 Agent 的类别感知迭代专家训练（类别感知 SWE 专家训练精读）</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</guid><description>阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架：SWE Labeler 用 47 个语义族 227 个标签做多轴标注，Agentic-miniRL 在可执行奖励下做长程 RL，RRE 循环（Refresh-Repair-Expand）让专家自蒸馏成功轨迹，Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%（较基座 +5.39），多语言 59.00%（+2.78），且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。</description></item><item><title>Building the Harness Automatically: Self-Play in Code Distills a Text Harness for Black-Box Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-11-selfplay-text-harness-bbo-paper-reading/</link><pubDate>Fri, 11 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-11-selfplay-text-harness-bbo-paper-reading/</guid><description>Google 的这篇论文问了一个极简的问题：agent 能否通过&amp;rsquo;写优化器代码并评估&amp;rsquo;的可执行实践学会一个搜索策略，然后把这个策略蒸馏成一段文本、迁移给从未见过这段实践的其他模型？答案是肯定的——自博弈产出的 197 词文本 harness（Harness A）使 Gemini Flash 在黑盒优化上 regret 降低 48%（N=30，p&amp;lt;.001），同一文本让所有受测 Gemini 执行器与 Claude Sonnet 都改善（regret -43%~-49%），独立复现的 Harness B 性能同档。&amp;lsquo;语言是部署搜索策略的便携介质&amp;rsquo;——harness 自动生成从进化搜索走向了实践蒸馏。</description></item><item><title>AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</guid><description>AgentOPSD 把 Agent 强化学习中长期被回避的&amp;rsquo;信用分配&amp;rsquo;难题重新拉回中心：在多轮交互、稀疏奖励的 Agent 任务里，GRPO 这类方法只能把最终成败均摊到每个动作上，导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师（注入了成功技能 c+）与学生之间的 token 级对数概率差聚合为 turn 级证据，再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k，最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把&amp;rsquo;稀疏结果监督&amp;rsquo;转化为&amp;rsquo;每一步的密集信用&amp;rsquo;，在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%（+7.9pp），长程任务每轮交互衰减仅 0.54 点（GRPO 衰减 2.91 点）。消融实验进一步证明：先验锚定贡献 -10.2pp 是最关键设计，贝叶斯方向（符号保持）次之 -8.6pp。</description></item><item><title>【论文精读】Any-OPD：通过表示空间桥接实现异构流匹配模型的在策略蒸馏</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-any-opd-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-any-opd-paper-reading/</guid><description>京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题：用冻结DINOv2表示空间桥接不兼容的潜在空间，仅训练LoRA适配器，将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生，在多项指标上实现&amp;rsquo;学生超越教师&amp;rsquo;的奇迹。ImageReward提升是教师自身优势的近4倍。</description></item></channel></rss>