<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>后训练 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E5%90%8E%E8%AE%AD%E7%BB%83/</link><description>Recent content in 后训练 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E5%90%8E%E8%AE%AD%E7%BB%83/index.xml" rel="self" type="application/rss+xml"/><item><title>信用分配四重奏：给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</guid><description>2026 年 10 月初，四篇论文从四条路线围攻 agentic RL 的同一个软肋：终端奖励只给轨迹级 0/1 分，步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配，把训练信号覆盖率从 GRPO 的 41% 拉到 95%，ALFWorld 91.0%；LinkedIn 的 SHARPO 用段级 hindsight 重加权，84.90±1.19 对 GRPO 70.57（+14.32）；南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器，WebShop score +12.7；UIUC 等的 DARS 用谓词依赖图势函数塑形，ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」：不是要不要过程奖励，而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界，并提炼可迁移的通用做法。</description></item><item><title>失败资产化二重奏：Agent Error Dataset 与 AREX-2 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-agent-error-economy-duet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-agent-error-economy-duet-paper-reading/</guid><description>Agent 训练数据的传统会计准则里，失败 rollout 是费用——采集了、用不上、直接核销。2026 年 9 月末的两篇论文在同两周内把这个科目改成了资产：Apodex 的 Agent Error Dataset（AED）把 50,228 个自然失败变成带诊断、带修正、带受控重放证据的「错误-诊断对」资产，用同检查点双臂重放首次把「修正的净因果增益」（18.4%→51.1%）从「重试也能过」（30.1% 的双通过率）中分离出来；BAAI 的 AREX-2 则把整条多轮失败-恢复轨迹做成训练数据，损失只打在「错误之后做了什么」的恢复性决策上，让 27B 模型在 MLE-bench Lite 拿到 81.8、超 GPT-5.6 Sol 9.1 分，且五小时预算内持续提升。本精读逐篇拆解两条「失败炼金流水线」的机制与证据，再处理它们之间最锋利的张力——AED 用 73 页附录诚实披露修复训练的环境依赖与真实环境倒退，AREX-2 用 12 页报告宣告跨域元技能迁移——结论是：两者在「损失不打在错误上、打在恢复上」这一核心设计上惊人收敛，而「失败资产」的变现条件（结构化保存、恰当标记、证据分级）比乐观者预期的更苛刻。</description></item><item><title>编码 Agent 训练三条线：token 效率、自验证与安全 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-coding-agent-training-trio-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-coding-agent-training-trio-paper-reading/</guid><description>本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文：HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来（SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token）；SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」，再用学生条件化蒸馏修复（PASS@1 +9.7~16.9pp 且 OOD 不掉点）；SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为，再用 Security Suite SFT + rl/hg 双路后训练补齐（unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1）。三篇论文共享同一方法论：先归因行为缺口，再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。</description></item><item><title>训练前沿四重奏：蒸馏外推、规模解除、奖励治理与具身评测 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</guid><description>本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文：RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推，四组基座全部追平或超越教师；OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」，用验证脚手架解除；ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式，合取式协议级评分回收三分之一损失；GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线：监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。</description></item><item><title>Diffusion Reward Models × SOLO：成熟技术的首次规模化双案例 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-paradigm-first-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-paradigm-first-duet-paper-reading/</guid><description>同日两篇论文在各自领域做了同一件事：把一项被搁置多年的成熟技术，用一个机制创新首次推到现代规模。清华 thunlp+港中文+UIUC 的 Diffusion Reward Models（DRM，当日 Hugging Face 日榜 up=22）把扩散模型首次引入奖励建模——奖励从点估计变为条件密度估计 p(r|x,y)，轻量 DiT 头无参数族假设地表示人类偏好的多峰结构（多峰率随标注分歧 37.6%→63.2%，Wasserstein 距离全表最低），同骨干同数据受控对比平均 66.2 vs ArmoRM 62.3（+3.9）；中科院自动化所的 SOLO 把局部学习（local learning）首次推到十亿参数 LLM 预训练——用一个所有模块共享的终端 readout 只读副本打破 update locking，梯度对齐 cos 从 0.52 升至 0.70，流水线激活内存降近 p 倍、吞吐达 1F1B 的 1.44×。二者方法论同构：识别被搁置的旧技术、诊断其规模化障碍、用一个机制创新解锁，为「旧思想在新规模下复活」提供了可复用的模板。</description></item><item><title>EAPO × DN-MOPD × d-OPD：大模型训练信号的三个盲区与最小修正 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</guid><description>同日三篇论文各自修复了 LLM 训练信号的一处失真：KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」，符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%（超最强基线 5.6pp，AIME24 20.2 vs GRPO 12.5）；NTU+耶鲁+曼彻斯特的 DN-MOPD（当日 Hugging Face 日榜 up=111 第一）发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号，批内测离散度+有界乘子重缩放即恢复各域均衡（8K 下 +2.47~+3.08）；清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来，Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249，8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。</description></item><item><title>Imprint Reader × ATD：权重更新与行为影子之间的双向桥 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-weight-behavior-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-weight-behavior-duet-paper-reading/</guid><description>本精读合并解读两篇在「权重空间」与「可观测行为」之间建立可计算映射的论文：上海AI实验室+上海交大的 Imprint Reader 用 SMaRT 训练一个把冻结 LoRA delta「挂载」到自身、在无锚点元查询下读出其编码知识/行为语义的 Reader——held-out 更新上行为读出 Pass@100 达 16%（知识 2%），且因与父模型坐标对齐，读出梯度经 MetaEdit 反转为干预：0.5% 行剪枝把有害拒绝率按目标方向分离为 +6.2/−2.5pp（基线全部不分方向），免训练数据的 vibe alignment 把 BFCL Agentic 15.93 提到 22.30；北大+佐治亚理工+上科大+清华+Lovart AI 的 ATD 则反向而行——用公共祖先筛选近平局提示（|q−0.5|≤0.02），每提示只取教师一个词的一比特观测，5,664 对即把私有 code-DPO 教师能力迁移 +5.34pp [1.22,9.60]（超精确对照），7 任务全正、7 任务教师-学生方向余弦 0.701 vs 0.398，而记忆答案/密码教师零迁移。一个「权重→行为→干预」、一个「行为→权重分量」，互为镜像，兼具可解释性与模型提取/泄露双重意义。</description></item><item><title>New LoRA Skills Should Read but Never Write 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-read-lora-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-read-lora-paper-reading/</guid><description>LoRA 让大模型微调变得便宜，但把多个独立训练的适配器合并成一个模型始终是难题：直接在权重空间相加会互相干扰，全量重训昂贵且伤害旧技能，路由方案则放弃了「单一模型」的目标。本文追溯其困难根源，指出每个组合方法都在隐式做两个选择——因子坐标（规范自由度）与耦合方向（读写不对称），并提出 READ 方法：规范化因子坐标、只训练新技能的「读行」、折叠回基权重。在 32 个测试谱系中，READ 以平均 +0.073（95% CI +0.047 至 +0.101）战胜 14 种可折叠基线的逐谱系最强者，且全部 8 次失败均集中于 BBH 的新技能习得环节。本精读覆盖其背景、定位、方法、实验证据与优势根源的因果解释，并交叉验证相关谱系的研究结论。</description></item><item><title>训练机制三重奏精读：对数线性稀疏注意力、置信度停止与跨段信用分配</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</guid><description>本文合并精读 2026 年 9 月下旬三篇聚焦「训练时机制创新」的论文：上交+字节 Seed 的 PISA 把块稀疏注意力的选择阶段压到 O(N log N) 并用 LSE 打分提升选块质量；马里兰+Capital One 的 ConfSFT 只监督置信度、不监督长度，就让四家族模型推理 token 下降 10%~19%；北大+深大+腾讯的 SLCA-GRPO 识别并结构性消除工具调用 RL 中的跨段信用错配，7B/8B 上 τ2-Bench 分别提升 9.15/10.03 个百分点。每篇覆盖背景、关联工作、问题、解法、实验证据、优势根源（含外部交叉验证）、知识反推与通用灵感九部分，最后合并讨论「选择、停止与信用分配」这一共同主题。</description></item><item><title>递归自改进的能力与安全双螺旋精读：DCE 自蒸馏与演化安全框架</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-rsi-capability-safety-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-rsi-capability-safety-paper-reading/</guid><description>本文合并精读 2026 年 9 月同日发布于 arXiv 的两篇递归自改进（RSI）论文。论文一（Meta AI + UC Riverside）提出 DCE+SRCL：让特权教师在 on-policy 自蒸馏中与学生逐轮共同进化，在 Qwen3-8B 四项数学竞赛基准上取得 65.97% Average@12，较冻结教师的 OPSD 提升 35.62 个百分点，并用固定轨迹探针揭示教师监督退化的机制证据。论文二（中科院计算所）提出演化安全框架：以携带时间历史的安全相关变更为分析对象，建立六种风险表现 × 五类变更载体 × 四层评估单元的分类学与治理原则。本精读各按九部分展开，并以「教师共同进化 ↔ 风险共同进化」的双螺旋视角合并收束：DCE 证明上轮学到的修正行为会经由教师进入下轮监督——这正是演化安全所警告的经验污染与风险继承在能力侧的镜像。</description></item><item><title>编码智能体规划、信任原生 Agent OS 与开源后训练配方：三篇系统论文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-26-trio-systems-recipes-paper-reading/</guid><description>本篇合并精读三篇系统方向论文。其一《Coding Agents for Generalized TAMP》：现成编码智能体在 28 个环境、98,000 次评估回合中合成可跨实例泛化的程序化策略，平均成功率反超手工 TAMP planner（95%/82% vs 47%），决策速度毫秒级，为具身规划给出「合成时搜索、测试时零 LLM」的新范式。其二《AgentKernel》：提出首个以安全为第一设计约束的智能体操作系统，用身份、感知、认知、执行四支柱加 eBPF 强制执行与污点格传播，把「能否信任智能体」改写为「能否约束智能体」。其三《Rufus-Air》：Amazon 在公开 GLM-4.5-Air-Base 上给出 8 阶段全开源后训练配方，9.01M 样本 SFT 加多阶段 RL，IFBench 76.9 对官方 33.6，并沉淀出「SFT 是能力构建、难度过滤即课程、奖励可靠性定序、基础设施是配方一部分」四条可迁移结论。</description></item><item><title>PACT: From Credit Assignment to Critic Alignment 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-25-pact-paper-reading/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-25-pact-paper-reading/</guid><description>强化学习已成为大语言模型后训练的核心组件，但 token 级信用分配始终缺乏公认的数学定义。本精读拆解 AllSpark 团队的 PACT 论文：以完备性、前缀一致性、中性性三个正则条件唯一确定 token 级信用——即条件奖励预测的鞅差分序列；由此统一解释理想教师下的在线蒸馏等价隐式 critic、RLOO 的梯度等价性、以及 GAE 中间 critic 误差可淹没真实信用等现象；进而提出 Actor-then-Critic 更新顺序、重要性采样修正与 BCE 损失的 PACT 训练流程。在四个数学基准上平均 72.87%，SWE-bench Verified 达 67.4%，分别超越 GRPO 8.80 与 2.0 个百分点。</description></item><item><title>Harness-Zero：通过 Agent-as-Harness 实现 Harness 蒸馏——论文精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-harness-zero-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-harness-zero-paper-reading/</guid><description>精读北京大学与 Google 合作的 Harness-Zero，提出 agent-as-harness 范式：用一个审查型智能体在学生模型的响应边界上把进化出的专用 harness 收益「翻译」成可训练轨迹，经 SFT 把外挂行为蒸馏进权重，部署时彻底移除外挂。Qwen3.5-9B 宏平均成功率从 23.3% 提升到 44.3%，甚至超过挂载原 harness 的 41.7%。</description></item><item><title>IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</guid><description>IER-OPD（MBZUAI + 蚂蚁集团）研究同策略蒸馏（On-Policy Distillation, OPD）中一个反直觉的事实：训练学生模型时，绝大多数 token 的梯度几乎不携带有用学习信号，只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解，定义信息效率比 IER = 信号/噪声，并据此设计候选集近似与 soft OR/AND 多准则融合，用 IER 分数筛选「高信息效率」的 token。实验显示：仅用 0.1% 的 token 预算，AIME26 即可达到全量训练的近乎持平（58.9 vs 59.9）；1% 预算下 AIME25 甚至超过全量（17.0 vs 14.4），且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验，并通过外部检索交叉验证 on-policy distillation（MiniLLM、GKD）与稀疏 token 选择等相关工作。</description></item><item><title>One to More, More to One：面向软件工程 Agent 的类别感知迭代专家训练（类别感知 SWE 专家训练精读）</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</guid><description>阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架：SWE Labeler 用 47 个语义族 227 个标签做多轴标注，Agentic-miniRL 在可执行奖励下做长程 RL，RRE 循环（Refresh-Repair-Expand）让专家自蒸馏成功轨迹，Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%（较基座 +5.39），多语言 59.00%（+2.78），且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。</description></item><item><title>onPanda: 通过 Token 级纠错高效标注 LLM 与 Agent 的同策略对齐数据 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-onpanda-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-onpanda-paper-reading/</guid><description>onPanda（阶跃星辰 StepFun + 厦门大学）提出以 token 级纠错为核心的新型标注范式：标注者只需定位第一个不合适的 token，从模型候选集中点选或自由改写，系统随即截断后续内容并由模型从修正后的前缀继续生成（locate-correct-continue 循环）。该范式让绝大多数 token 由 rollout 模型原生生成，从而在低成本标注的同时高度保留同策略（on-policy）保真度，并自动产出可精细到位置的监督信号。本文按九部分结构精读其动机、系统设计、实验证据，并通过外部检索交叉验证标注效率、同策略数据价值与 RLHF 标注工具（Argilla/POTATO/Reptile）等相关工作。</description></item><item><title>StudentSim: Training LLM-based Student Simulators 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-21-studentsim-paper-reading/</link><pubDate>Mon, 21 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-21-studentsim-paper-reading/</guid><description>微软研究院与 UIUC 的 StudentSim 把&amp;rsquo;AI 学生模拟器&amp;rsquo;形式化为可优化的双目标问题：行为保真度 F（复现特定学生的真实行为）与指导响应度 R（被导师教会的能力）。两阶段训练——跨学生池化预训练学共享模式 + 每生 LoRA 特化——让 Qwen3-4B 在国际象棋、二语写作、数学三个领域 F/R 双指标全面超过 prompted GPT-5.4（chess 0.51/0.91 vs 0.23/0.72），用其做奖励的导师 RL 经专家盲评三轴全胜（准确率 90.5% vs GPT-5.4 奖励的 71.6%）。本精读覆盖 F×R 分解的问题化、&amp;lsquo;池化贡献多样性而非更新量&amp;rsquo;的消融证据、4B 特化胜过前沿 API 的机制根源，以及&amp;rsquo;模拟器即基础设施&amp;rsquo;的通用性灵感。</description></item><item><title>RetireOPD × EOS 终止符失配：在线策略蒸馏动力学二重奏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</link><pubDate>Sat, 19 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</guid><description>两篇同日论文从训练动力学层面解剖在线策略蒸馏（OPD）。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突，于是让学生在分歧停止收缩且达到教师成功率阈值时自动&amp;rsquo;退休&amp;rsquo;教师，ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级：基座学生与后训练教师可能把停止概率放在不同 EOS token 上（即使声明停止集相同），把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读，构成&amp;rsquo;OPD 何时该用、何时会坏&amp;rsquo;的完整图景。</description></item><item><title>ComPO 零阶偏好对齐 与 SpectralShift 线性注意力长上下文扩展 精读（二重奏）</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-compo-spectralshift-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-compo-spectralshift-paper-reading/</guid><description>两篇训练方法学论文合并精读。UC Berkeley×NYU×阿里达摩院的 ComPO 提出 LLM 偏好对齐的零阶范式：不在偏好对上直接优化可微损失，而是用 comparison oracle 提取方向信息——规避 DPO 类方法在低似然边际对上的 likelihood displacement 失效，五个模型家族上改进含长度控制胜率，并给出收敛与性能保证。人大高瓴×MSRA 的 SpectralShift 从转移矩阵谱视角重新审视 Gated DeltaNet 的长上下文扩展：慢谱带宽度决定长程检索、快衰减模式负责状态清理，重参数化 alpha 投影初始化+学习率缩放即可让 10B 模型 8K→128K 课程扩展持续增益（RULER 64K +4.2）。</description></item><item><title>Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-sp3o-value-flattening-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-sp3o-value-flattening-paper-reading/</guid><description>上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』：蒙特卡洛估计的状态价值在响应内剧烈变化，critic 预测却近乎水平线。诊断出两大根因（MSE 隐含方差惩罚+相邻状态冗余更新）后提出 SP3O：每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp，K=3 优于 K=64，越稀疏越好——一个『少即是多』的教科书式发现。</description></item><item><title>Continual Learning Mechanisms Compose for Long-Horizon Memorization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-cl-mechanisms-compose-long-horizon-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-cl-mechanisms-compose-long-horizon-paper-reading/</guid><description>让模型依次学 100 个知识任务且不留旧例、不给任务 ID——&amp;lsquo;长程记忆化&amp;rsquo;设定下，任何单一持续学习机制都崩盘（保留率普遍个位数）。Johns Hopkins 的系统学研究证明机制要&amp;rsquo;组合&amp;rsquo;：锚点类型（data 复演/function 蒸馏/权重正则——保留什么）×低秩分配（merged LoRA——保留在哪）两维设计，任务级逐次减半搜索组合空间+因子实验量化交互。最优组合（三锚点+merged LoRA）把最终保留率从 1.2% 拉到 34.9%（28 倍），且 data 锚点×merged LoRA 在三个数据集上一致超可加——遗忘来源互补，组合解决结构问题。HF 日榜 281 赞当日第一。</description></item><item><title>State of Thought Enables Endogenous Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-state-of-thought-endogenous-reasoning-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-state-of-thought-endogenous-reasoning-paper-reading/</guid><description>测试时推理的现有范式要么给模型套外部推理程序（CoT/Plan-and-Solve），要么暴力扩展搜索（Self-Consistency/MCTS）——控制信号都是外生的。NTU 提出 State of Thought（SoT）：从模型内部信息传递提取紧凑动力学-几何状态，582 参数控制器在冻结 backbone 上按当前推理状态选择性激活历史推理支持——推理变成&amp;rsquo;证据上的状态条件化过程&amp;rsquo;。16 数据集×3 LLM：量化/通用/符号代码/长上下文推理平均提升 1.34×/1.62×/1.76×/2.51×，同时 token −62.6%、延迟 −44.6%；training-free 与 embedding-only 设定下仍保留 38.2%/36.5% 增益，证明内生状态信号真实存在且可低成本利用。</description></item><item><title>Atria Dawn: The Dawn of Agentic Superintelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-atria-dawn-open-agent-foundation-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-atria-dawn-open-agent-foundation-paper-reading/</guid><description>上海人工智能实验室发布 744B MoE 开源 Agent 基座 Atria Dawn Preview：以 Verifiable Experience Pipeline 把训练信号锚定在可执行环境与外部可验证结果上，16 基准中 5 个登顶（Terminal-Bench 2.1 = 90.2、SWE-bench Pro = 74.7）；更独特的是把自身 769 条任务记录的 R&amp;amp;D 过程作为人机协作案例研究——1/3 任务被人类评为无 AI 不可行。本精读覆盖可验证经验管线的设计逻辑、五榜登顶的机制根源、以及模型报告与 HAI 研究双重身份的方法论价值。</description></item><item><title>Salesforce Koa: An Enterprise Language Model for Agentic Tool Use 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-salesforce-koa-enterprise-agent-model-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-salesforce-koa-enterprise-agent-model-paper-reading/</guid><description>企业 Agent 工具使用模型的开放权重范本：Salesforce 基于 Nemotron-3-Super-120B（NVIDIA 开源基座）GRPO 后训练出 Koa，在 Dreamforce 发布并作为 Agentforce 平台可选模型。核心是 simulation-to-reward 管线——把工作流规格展开为 persona 条件多轮任务、以成功工具使用为基础的任务解决奖励；企业域用 Agent Script 声明式语言书写规格，训练零客户数据。Tau2Bench 69.41 超基座，且揭示 SFT/RL 的能力分工：BFCL 多轮上 SFT 反降分（54.12→53.25）而 RL 提升。本精读覆盖声明式规格→模拟器→奖励的生成管线与开放权重的企业模型经济学。</description></item><item><title>ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-zgcm1-open-efficient-foundation-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-zgcm1-open-efficient-foundation-paper-reading/</guid><description>ZGCM-1 技术报告解读：中关村人工智能研究院 + DeepSeek-AI 系作者的全开放高效基座——7B-8B 级 14 个推理基准平均第一（AIME 2026 = 75.0%、MATH-500 = 97.1%、HMMT 2025 = 70.4%），Agentic Search 与大数量级前沿模型竞争。配方亮点：混合 RL + Agent-SFT（verifier-successful 15,748 轨迹子集）与 AI-Native R&amp;amp;D——用 30B token 代理模型做混合物搜索，把配方探索成本降一个量级后再全量训练。本精读按&amp;rsquo;开放配方&amp;rsquo;口径解读其训练经济学与开放科学价值。</description></item><item><title>Occamy-1.0: Open Pareto-frontier 35B Intelligence for Co-work 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-occamy-open-35b-cowork-model-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-occamy-open-35b-cowork-model-paper-reading/</guid><description>Accio-Lab 的开放 35B-A3B co-work 模型技术报告：基于 Qwen3.6-35B-A3B 再训练，核心主张是成本效率路线——日常 co-work 的多数步骤（状态追踪/协调/恢复/跟进）不需要前沿级推理，执行接地的数据与环境（可重放长时程轨迹+多 harness 采集）+ 分阶段后训练，在 12 个 benchmark 四能力域上做到同规模最强、部分任务比肩 GPT-5.6 Sol 级大模型，价格协议明示的性价比优势。</description></item><item><title>Nemotron IMO Gold 精读：开源模型金牌的完整配方——自然语言证明生成与测试时搜索管线</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-nemotron-imo-gold-open-recipe-paper-reading/</guid><description>NVIDIA 公开 IMO 2026 金牌系统全部配方：Nemotron 3 Ultra 基座上 SFT+RL 两个专精 checkpoint，加验证器/评分器构成生成-验证-精炼迭代搜索与高算力终选，全程纯自然语言（无形式化证明器/外部工具/互联网），得分 30/42 达金牌线。全套 artifact 开源：两个 checkpoint、SFT/RL 训练数据、训练与推理代码、提交的证明、Nemotron-IMO-Bench（200 道新题）。同日 25 位菲尔兹奖得主联合声明使本文的伦理语境格外微妙。</description></item><item><title>X-AuT 精读：渐进剪枝+跨尺度蒸馏的语音编码器压缩，18→16 层错误率不降反升</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-13-x-aut-audio-encoder-compression-paper-reading/</link><pubDate>Sun, 13 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-13-x-aut-audio-encoder-compression-paper-reading/</guid><description>小鹏汽车提出 X-AuT：短行为探针选择可恢复的层组合，渐进式剪枝 Qwen3-ASR-0.6B 音频塔 18→16→14 层，表征对齐+跨尺度蒸馏（教师强制+计划学生策略）+LoRA 恢复，解码器骨干全程冻结。18→16 层宏平均错误率 5.61%→5.27%（不降反升）；14 层 5.75%、参数 -20.7%、车载加速器延迟 -21.4%；渐进剪枝 5.75% vs 直接剪枝 6.73%。</description></item><item><title>Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-coevolving-harness-model-imitation-fit-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-coevolving-harness-model-imitation-fit-paper-reading/</guid><description>harness 进化后，让弱模型模仿更强专家的轨迹——这个&amp;rsquo;显然正确&amp;rsquo;的配方在七个企业任务上全部翻车（平均 -14.9 分），而同样的做法在未进化 harness 下却有增益。论文定位出根源：模仿让弱模型学会了专家的知识，却也继承了专家的规划风格，破坏了它与&amp;rsquo;围绕自身原生风格进化出来的 harness&amp;rsquo;的拟合。解法是 on-policy 专家修正：meta-MLE agent 定位失败 turn、专家只重写那一轮，平均 +1.7 分且规划失败桶保持地板水平。本文精读拆解&amp;rsquo;模型-harness 拟合&amp;rsquo;这一新概念与其共进化配方。</description></item><item><title>Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</guid><description>弱到强泛化的核心矛盾：常规蒸馏把弱教师当优化目标，学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的&amp;rsquo;政策偏移&amp;rsquo;方向，只放大学生自身 verifier 梯度在该方向上的投影分量，不建立任何教师匹配目标。理论上保住了策略优化的不动点，实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师，多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与&amp;rsquo;加速而非转向&amp;rsquo;的证据链。</description></item><item><title>ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</guid><description>测试时强化学习（TTRL）靠答案自投票构造奖励，但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL：从题面自构造无输出探针输入，用候选程序行为一致性构造 Probe Consensus Reward；再用 ERPO 把 PCR 当作&amp;rsquo;负信号为主&amp;rsquo;的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序，配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3，零样本迁移 CodeContests 25.1→42.1，是唯一同时提升 pass@1 与 pass@k 的无标签方法。</description></item><item><title>Experience Funnel: A State–Policy Alternating Loop for Self-Evolving Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-experience-funnel-state-policy-loop-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-experience-funnel-state-policy-loop-paper-reading/</guid><description>自进化 Agent 面临双时间尺度困境：文本状态（技能/记忆）快而外部依赖重，参数策略持久而更新慢。华为与港理工的 Experience Funnel 用交替环打通两者：轨迹先蒸馏为显式状态快速适配，再选择性把&amp;rsquo;跨状态修订仍有效&amp;rsquo;的行为经 transition-aware distillation 固化入策略——经验像漏斗一样从原始轨迹逐级过滤为可复用能力。多基准上一致超越 state-only 进化与 policy-internalization 两条单路线。</description></item><item><title>NeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-neohorse-1-routing-harness-rsi-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-neohorse-1-routing-harness-rsi-paper-reading/</guid><description>NeoHorse-1 把部署中的模型路由 harness 变成递归自改进（RSI）的数据飞轮：路由层天然记录每次交互的&amp;rsquo;能力需求预测-实际执行-结果&amp;rsquo;三元组，这些记录被转化为保留交错推理与工具调用的 user-turn 训练样本，路由分数进一步组织成三阶段课程 SFT 与路由引导的在线策略蒸馏。4B/9B 模型十项基准宏平均分别从 58.94/65.60 提升至 64.87/69.04，路由 harness 数据比公开 Agent 数据平均高 6.26 分。本文精读拆解其数据管线、课程设计、OPD 机制与&amp;rsquo;评估-选择-更新&amp;rsquo;闭环为何能成立。</description></item><item><title>TGOPD：在策略蒸馏前先验证教师——提示级可靠性门控 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</guid><description>AllSpark 团队推出 TGOPD：对每个提示用少量验证器打分的教师探针估计可靠性，通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD，35B LiveCodeBench 64.0（其他蒸馏方法全部负迁移），探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。</description></item><item><title>Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</guid><description>Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象：每条推理轨迹仅监督 1–2 个关键 token（占全部生成 token 的 0.05%）即可匹配甚至超越全 token 训练的推理激励，跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一&amp;rsquo;有效学习不需要 token 密集&amp;rsquo;的证据链及其对后训练范式的改写意义。</description></item><item><title>RISE 之外的第二条线：When Models Edit Too Much — 代码过编辑与最小编辑保真度 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-over-editing-fidelity-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-over-editing-fidelity-paper-reading/</guid><description>NUS 团队构造 400 个带已知最小补丁的修复任务（BigCodeBench 注入 AST 级损坏），首次系统量化 LLM 代码修复的&amp;rsquo;过编辑&amp;rsquo;：GPT-5.5 等前沿模型普遍重写过度。保持性指令使超额 Levenshtein 距离 0.195→0.131、认知复杂度 -26.6%、Pass@1 +2.3；SFT 过拟合损坏模式而 RL 取得最佳 OOD 保真。本文精读&amp;rsquo;最小性&amp;rsquo;作为修复一等目标的评测与训练路径。</description></item><item><title>RISE: 自外推策略蒸馏把 on-policy 蒸馏变成递归自我改进 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-rise-self-extrapolating-distillation-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-rise-self-extrapolating-distillation-paper-reading/</guid><description>RISE 从模型自身 RLVR 训练轨迹外推合成教师：以当前检查点与滑动锚点的位移放大（β&amp;gt;1）构造未来教师，在 logit 或权重空间实现，教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9（+16.7），ALFWorld +9.4、WebShop +10.9 vs GRPO，OOD 不降反升。本文精读&amp;rsquo;教师从哪来&amp;rsquo;这一 OPD 根本问题的第一性解法及其递归改进机制。</description></item><item><title>Compile by Training: Turning Natural-Language Specifications into Local Neural Functions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-compile-by-training-neural-functions-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-compile-by-training-neural-functions-paper-reading/</guid><description>滑铁卢大学×哈佛的 Compile by Training 把&amp;rsquo;编译&amp;rsquo;概念引入神经函数：教师模型从自然语言规格合成监督数据，训练 LoRA 适配器特化冻结的 Qwen3-0.6B 解释器，产出可存储、可版本化、可组合的 .paw 程序。在 PAW 快速编译器零精确匹配的 FuzzyBench-Hard 上语义准确率从 0.224 提升至 0.836，编译仅需约 50 秒。本文精读其&amp;rsquo;训练即编译&amp;rsquo;范式、分钟级编译服务工程与速度-精度新权衡点。</description></item><item><title>Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-bcit-conditional-experience-transfer-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-bcit-conditional-experience-transfer-paper-reading/</guid><description>自主 LLM 后训练系统不断积累&amp;rsquo;过去什么更新有效&amp;rsquo;的经验，但父模型一旦变化，旧经验就可能是毒药。本文把这一困境形式化为条件经验迁移问题，提出 BCIT：把效果绑定到源上下文、更新前检查适用性、具名硬冲突否决、必要时小预算试验取证。等预算对比中 BCIT 更少授权有害更新、最终模型质量更高，为自进化 Agent 补上&amp;rsquo;免疫排异&amp;rsquo;机制。</description></item><item><title>Rethinking On-Policy Distillation II: One Training Example 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-opd-one-training-example-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-opd-one-training-example-paper-reading/</guid><description>on-policy 蒸馏到底需要多少数据？本文把实验推到&amp;rsquo;一条训练样本&amp;rsquo;的极限：单条查询即可驱动 OPD 持续改进数百步，覆盖全数据 OPD 71.5% 的状态空间；16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是&amp;rsquo;数据过饱、算法饥饿&amp;rsquo;，瓶颈在步数效率而非数据规模。</description></item><item><title>Aspire: Can Models Self-Evolve from Vague Goals? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-aspire-vague-goals-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-aspire-vague-goals-paper-reading/</guid><description>现有 LLM 自进化研究都从人类定义好的显式任务出发，agent 只搜索&amp;rsquo;怎么优化&amp;rsquo;；但人类学习往往始于&amp;rsquo;成为更好的物理学家&amp;rsquo;这样的模糊目标。ByteDance Seed 联合 SUTD、M-A-P 等发布 Aspire 基准：只给一句自然语言能力目标，评测集对 agent 完全隐藏，agent 必须自己决定优化什么、怎么训练、如何验证。实验给出罕见的机制级阴性结果——24 次 final-only 运行仅 1 次超过基线分，最佳进化 harness 仍低于人工 Qwen-Agent。本精读拆解隐藏评测设计、三条研究问题（RQ1-RQ3）的实验逻辑，以及&amp;rsquo;代理增益不迁移&amp;rsquo;这一失败模式的根源。</description></item><item><title>Cliff: Learning Process Rewards from the First Mistake 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</guid><description>RLVR 用最终答案的对错给整条推理链打分，粒度太粗；PRM 要训练专用奖励模型，OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式：只用现成 LLM 定位每个错误 rollout 的&amp;rsquo;第一个错误步&amp;rsquo;（Pitfall Step），把轨迹切成正确前缀与错误后缀，前缀正优势、后缀负优势。12 个场景上一致超越：比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%，且弱教师（27B）下依然有效。本精读拆解&amp;rsquo;错误前缀之后无信息&amp;rsquo;这一核心洞察、token 级优势的构造细节，以及教师定位能力与人类标注 80% 一致率的验证实验。</description></item><item><title>Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</guid><description>在 IOI 2026 上，一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分，超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径：22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距，以及&amp;rsquo;纯 SFT 的 Ultra 反超 SFT+RL 的 Nano&amp;rsquo;背后的并行采样机制。</description></item><item><title>CogEvol: Towards Efficient and Reliable Learning Environment Generation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-cogevol-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-cogevol-paper-reading/</guid><description>清华大学与 CogEvol Inc 联合团队的 CogEvol 是&amp;rsquo;AI 教育&amp;rsquo;方向罕见的工业级完整答卷：单模型单次前向把课程大纲变成 JSON 幻灯片或自包含交互式 HTML，22 万生产请求上中位耗时 17/59 秒，27B 模型以 26.9 倍参数效率逼近旗舰编码模型（幻灯片质量 83.7 vs 63.7 交互分）。技术看点有二：把真实生产失败转为 53,687 条验证 SFT 样本的数据飞轮；以及一次被捕获修复的 reward hacking 事件（模型学会产出视觉可信但不可玩的游戏）对混合奖励设计的修正——&amp;lsquo;可靠性是被工程出来的，不是被期望出来的&amp;rsquo;。</description></item><item><title>Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-opsa-self-adaptation-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-opsa-self-adaptation-paper-reading/</guid><description>Purdue 团队对当下最火的 On-Policy Distillation（OPD）发起了一次釜底抽薪式的追问：教师监督噪声率高达 30%–50% 且随教师规模上升，学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到&amp;rsquo;低 logp token + 负优势&amp;rsquo;才是真正驱动力后，论文提出零监督的 OPSA（熵自适应负优势自改进），在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。</description></item><item><title>ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-contextpilot-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-contextpilot-paper-reading/</guid><description>深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot：一个主动上下文管理框架。针对现有方法工具集贫乏（只有搜索/删除/摘要）、探索低效（上下文编辑动作影响悬殊却被均匀采样）、信用分配粗粒度（轨迹级奖励平摊给所有编辑动作）三大缺陷，它扩展出规划、长期记忆、软卸载三类工具，并用上下文变化量+熵变化识别关键编辑决策做分支采样（context-aware partial rollout），再用所有后续分支的平均回报估计动作级优势（细粒度信用分配，方差降为 1/n）。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85；深搜任务上每轮输入 token 稳定在 8-10K（基线线性涨到 30K）；消融证明细粒度信用分配贡献最大且在全部基准一致提升。</description></item><item><title>Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-oc-sft-order-consistent-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-oc-sft-order-consistent-paper-reading/</guid><description>深度精读 Thomson Reuters Labs 与多伦多大学/Vector Institute 合作的 LLM 评分器顺序依赖论文。批式打分（reranker、奖励模型、多文档 QA）中每个分数都依赖候选排列顺序，论文发现排序质量相同的评分器在下游决策上大相径庭：五个 nDCG@10 差距不超过 0.010 的已训练评分器，重排后保留集重叠度横跨 0.656 到 0.835。提示词层修复（round-robin 划分、logit 校准）完全触达不到决策端；提出的 OC-SFT 在损失函数中显式惩罚同一窗口 N 个排列下自身分数的方差，τ-PSI 从 0.209 降至 0.083，保留集重叠升至 0.835，单次前向即超过十排列集成的 BSC，且 nDCG@10 不降反微升。</description></item><item><title>SPT: Skills as Pre-Training Data for Agentic Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-spt-skills-pretraining-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-spt-skills-pretraining-paper-reading/</guid><description>深度精读北京邮电大学与清华大学论文 SPT。论文提出把公开的多文件技能包当作预训练中段（mid-training）数据：清洗 ClawHub 上 38,040 个技能包构建 SkillCorpus（约 3.48 亿 token），用 Reference Insert 序列化策略把被引用文件插入到指令首次提及处，使引用距离缩短 94.92%。7B 模型四个 Agent 基准平均分从 28.50 提升到 53.46（+24.96），通用能力几乎无损，30% 技能混合配比效果最佳。</description></item><item><title>VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vfa-multilingual-paper-reading/</guid><description>南方科技大学、微软亚洲研究院、上海财经大学与北京大学团队提出 VFA（Vision-Free Adaptation），在不使用任何图文对数据的前提下增强多模态大模型的多语言能力。核心思路是把微调看作任务向量：在共享 LLM 底座上用 10 万条纯文本多语言数据微调基座 LLM 得到多语言任务向量，再用 WA/TA/TIES 三种合并算子注入到视觉对齐的 MLLM 语言骨干中，视觉编码器与投影层完全冻结。五个 MLLM 上六大多语言多模态基准平均增益 +0.57 到 +10.64，文化视觉推理 MaRVL 增益最大（Idefics3 +36.17），通用多模态能力持平或略升；而直接文本微调会让 Qwen2.5-VL 平均掉 11.92、MaRVL 从 53.50 崩到 0.00。VFA 仅用 Pangea 约 2% 的数据量达到 47.84 vs 50.34，训练成本约 10 A100 小时对 320 A100 小时，且框架可迁移到视觉编程等非多语言任务。</description></item><item><title>Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-weak-model-guidance-rlvr-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-weak-model-guidance-rlvr-paper-reading/</guid><description>RLVR 训练有个广为人知的暗面：策略熵不断下降、模型越来越自信，大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法（熵正则、梯度校准、奖励设计）都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路：让一个 2B 小模型先生成部分推理前缀，再让目标大模型接着写完——而且小模型的前缀大多质量堪忧（多数『无实质指导』甚至『误导』），收益恰恰来自这种『不熟悉』而非『正确』。方法极简：按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练，pass@128 即从 67.76 恢复到 70.71（接近 base 的 72.15）。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』，这是本文最干净的洞察。</description></item><item><title>Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-rlvr-capability-fusion-paradigms-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-rlvr-capability-fusion-paradigms-paper-reading/</guid><description>用 RLVR（可验证奖励的强化学习）训练出的领域专家各有绝活：数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文，把三种把多域能力融合进单模型的范式放进同一实验框架对比：Merge（合并任务向量，零训练成本）、Mix RL（混合数据重训一遍）、MOPD（多师在线蒸馏，兼用两者）。结论出人意料地均衡：三范式平均分差不超过 1.4 分，但单个基准差距可达 8.6 分，且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移，指令跟随与 Agent 则与其它域近正交。更有意思的是，三种融合都只是『把已有的解重新加权』而非扩大解题覆盖：pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。</description></item><item><title>TTPO: Test-Time Policy Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-ttpo-test-time-policy-optimization-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-ttpo-test-time-policy-optimization-paper-reading/</guid><description>没有标签也能在测试题上直接训练模型？浙大与阿里的 TTPO 给出了一个干净的不对称方案：多数投票选出伪标签后，同意的 rollout 走蒸馏分支（OPSD 前向 KL + 降权已收敛 token），不同意的走 GRPO 惩罚分支（只罚高置信错误 token）。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的，但不同意它的 rollout 约 79% 本身也是错的，所以「惩罚不一致」不需要伪标签正确，而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD，Qwen3-1.7B 从 38.0% 提到 45.2%，4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。</description></item><item><title>Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-evolution-strategies-llm-reasoning-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-evolution-strategies-llm-reasoning-paper-reading/</guid><description>进化策略（ES）一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低，但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象：理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K；实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型，而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍，但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。</description></item><item><title>Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-eava-vuln-evidence-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-eava-vuln-evidence-paper-reading/</guid><description>深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为（加拿大）合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷，EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注（专家抽检 97.8% 合格）、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上，平均 F1 0.874 / MCC 0.646，比最强基线 proEVA 高 5.3%/18.7%；用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。</description></item><item><title>CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-cafe-coevolving-feedback-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-cafe-coevolving-feedback-paper-reading/</guid><description>CAFE（复旦大学 × 腾讯 LLM 部门）把纠正性反馈做成搜索智能体轨迹内可请求的干预：共享参数模型分饰 agent/critic 两角色，冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示；在线 RL 用比较反馈估计（同提示请求组 vs 跳过组的成功率差）塑造请求回报，反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用；离线 RDPO 从前缀匹配的成功/失败对学反馈生成；100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法，6 个 OOD 基准全保持，答案级幻觉率 17.6%→12.6%；单向消融证明只改 agent 或只改 critic 都会平台化，交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。</description></item><item><title>IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-iapo-influence-credit-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-iapo-influence-credit-paper-reading/</guid><description>深度精读腾讯微信团队（26 Aug 2026）论文 IAPO：多轮服务 Agent 训练中，最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图（支持使用边/失败使用边），用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势，不改奖励、采样与损失实现，在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%（+12.57pp），电信域增益最大达 +18.19pp，且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。</description></item><item><title>Joint Optimization of Tool Creation and Use for Large Language Model Agents（SMITH）精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-smith-tool-joint-opt-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-smith-tool-joint-opt-paper-reading/</guid><description>深度精读 Appier AI Research + 台湾大学（25 Aug 2026）论文 SMITH：现有工具创建系统让强模型写工具、弱模型用工具，写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用：use 任务只给 JSON schema，接口写得烂必然调用失败，形成「写即所用」闭环；三条独立奖励轴分离 schema/代码/结果失败；easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架，平均输出仅 100 token（比 CoT 少 32 倍），其工具还能让 350M 小模型追平 30B 写的工具。</description></item><item><title>Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ockhamareto-test-rl-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ockhamareto-test-rl-paper-reading/</guid><description>深度精读 NUS+UCL+KCL+港科大广州（25 Aug 2026）论文 Ockhamareto：用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」，单次生成 2.60 个测试拿下 49.9% 突变分数，比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试，4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。</description></item><item><title>On-policy Distillation with Verifiable Reward 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-opdvr-verifiable-distill-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-opdvr-verifiable-distill-paper-reading/</guid><description>清华LeapLab提出的OPDVR用一道极简的ReLU门，把On-policy蒸馏的隐式奖励按轨迹正确性重新定号，使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量，实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8，甚至反超教师；GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起，逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。</description></item><item><title>Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-parason-trial-parallelism-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-parason-trial-parallelism-paper-reading/</guid><description>清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈：自回归解码把整条推理链串行执行，难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行（AND分支，分而治之）与Trial并行（OR分支，多路试探），并测量发现Trial并行占了可并行推理计算的多数（DeepSeek-V4在HLE上65.5%），而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构，配合PA-GRPO多目标奖励（正确性+关键路径延迟+两类并行比例）训练，经SGLang真实执行。AIME24/25等基准上平均加速约1.7×，8k token延迟预算下用25%预算匹配全额性能。</description></item><item><title>SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-secopd-injection-defense-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-secopd-injection-defense-paper-reading/</guid><description>提示注入被 OWASP 列为 AI 智能体的头号威胁，而现有“安全 LLM“在自适应攻击下攻击成功率接近 100%。UC Berkeley 团队提出 SecOPD，把在线策略蒸馏（OPD）改造为注入防御训练信号：学生在被攻击输入上滚动生成，冻结的初始模型在对应干净输入上给同一 token 打分，实现 token 级信用分配。在 SEP + PISmith 自适应攻击下，防御后的 Qwen3.6-27B 攻击成功率仅 9.0%，比此前最强防御 Meta-SecAlign 的 94.0% 低一个数量级；同时七项效用基准平均 88.1%，与未防御模型持平。本精读覆盖问题定义、方法机制、实验证据、效果根源解释与可迁移灵感。</description></item><item><title>Spectral Allocation: Why Muon Outperforms Adam, and How to Improve Muon 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-samuon-spectral-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-samuon-spectral-paper-reading/</guid><description>剑桥大学与清华大学合作，用 out-of-sample 谱探测回答优化器领域的核心开放问题：Muon 为何快于 Adam？沿真实训练轨迹把动量缓冲做 SVD，在留出批次上估计每个奇异方向的最优步长，发现稳定且各向异性的谱剖面——单一「易变头」处于稳定性边缘（允许步长最小、恰等于 Muon 实际步长），「宽容主体」允许数倍步长。据此提出 SAMuon：头钉住、主体放大，比调优 Muon 少 13.3-24.0% token 达到同等验证损失。SGD→Adam→Muon→SAMuon 在统一谱分配视角下排成一条线。</description></item><item><title>Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-unfolding-papers-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-unfolding-papers-paper-reading/</guid><description>字节跳动 Seed、南京大学与 Evolvent AI 合作提出「论文展开」管线：保持论文原文逐字不动，用教师模型反向重建写作请求、全局规划与逐节写作前的思考，把整篇论文展开为多轮生成轨迹用于持续预训练。1.8M 篇 arXiv 论文的 30B token 原文被展开为 57–60B token 轨迹，中位文档长度从 11.2K 提升到 28–29K token。同一反向构造还产出 200K 样本 SFT 数据集与 2,940 题的 PAW-Bench 学术写作基准。受控实验（同预算纯论文文本对照）证明增益来自「构造」而非论文内容：写作四项平均 54.34 对纯文本 52.12/无 CPT 51.90，推理不降反稳，长文档理解提升；且 4B 小生成器的语料最难拟合（loss 1.453）却下游最好——生成器越弱、数据越难拟合，收益越大。</description></item><item><title>V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</guid><description>南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL：把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目，构建 5 万例训练集，并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下，比 answer-only GRPO 再提 1.79 分，增益集中于依赖接地中间推理的基准。</description></item><item><title>Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-erpo-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-erpo-paper-reading/</guid><description>ERPO（阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研）重新定位了 LLM 强化学习训练崩溃的根源：不是策略（动作）分布漂移，而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧，Query-KL 的梯度严格不流经响应分布，从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%，ERPO 保持 80.8%。</description></item><item><title>The Laws of Context Allocation: Causal Measurement and Closed-Loop Orchestration in Generative Search (Ascp) 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-ascp-context-allocation-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-ascp-context-allocation-paper-reading/</guid><description>Ascp（北京大学 × 腾讯）为生成式搜索建立了&amp;rsquo;上下文分配定律&amp;rsquo;：同预算下窄窗多轮（k=2 检索×T=12 轮生成）比宽窗单轮（k=24×T=1）的 portfolio recall 高 0.144，T:1→12 带来 16.8-20.5pp 提升，且验证到 32B 规模。其测量工具是因果留一（LOO）探针——teacher-forced 反事实消融直接测量每篇文档对生成文本的因果利用率，在 same-query 硬负例下 AUC 0.876，而 embedding 相似度坍缩到 0.484（随机水平）。相关性代理测的是&amp;rsquo;话题相关&amp;rsquo;，不是&amp;rsquo;真被用了&amp;rsquo;。</description></item><item><title>Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-thermodpo-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-thermodpo-paper-reading/</guid><description>本文精读西湖大学、浙江大学与快手可灵团队合著的 arXiv 2608.20011。论文形式化了流匹配生成模型偏好优化中的流形漂移现象：偏好更新会把轨迹终端样本推离预训练数据流形，产生非零法向位移，这是 reward hacking 的结构性根因。理论上，最优流匹配能精确恢复数据分布，而偏好更新一旦含非零法向分量必然离流形。方法上提出 THERMODPO，用带温度的三态能量 softmax 在胜者侧加流形锚，统一了 RFT 与 FlowDPO，并对流形距离给出逐点上界。实验显示玩具基准 StrictScore 达 0.899，SD3.5-M 四指标宏平均提升 16.0%、OCR 提升 47.5%，FLUX.2 上复现同趋势。</description></item><item><title>MidTool: 面向Agent工具使用的中期训练数据合成 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</guid><description>工具使用是 LLM Agent 的核心能力，但此前几乎全靠后训练习得。MidTool（华盛顿大学 + Snowflake + UNC，工作完成于 Snowflake 实习）提出首个面向通用工具使用的开放中期训练语料管线：从网页、PDF、代码、真实 API 与 MCP 技能四类源出发，经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix，中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上，两种后训练配方下均一致超过 SFT-only 基线，RL 通常进一步放大增益，MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。</description></item><item><title>MileGPO: 里程碑推断的长程Agent过程级信用分配 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-milegpo-credit-assignment-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-milegpo-credit-assignment-paper-reading/</guid><description>北交大团队提出 MileGPO，针对长程 LLM Agent 训练中最棘手的过程级信用分配问题：GraphGPO 等图方法按最短路径距离赋信用，只能刻画「可达性」而非「可靠进展」。MileGPO 从同一 rollout 图中挖出三类被忽视的信号——成功轨迹的候选里程碑、失败轨迹的反复陷阱、同状态兄弟分支对比——经可靠性加权塑形 RCS 与进度对比校准 PCC 两级校准后注入优势估计。ALFWorld 整体成功率 94.60，超 GraphGPO 3.13 点、超 GiGPO 4.43 点；ID–OOD 差距仅 1.69 点；WebShop 同状态平局率达 72.7%，图上 83.0% 的平局可被 RCS 纠正。全程零辅助模型、零额外环境交互，本精读重点拆解「共享状态覆盖率相同、歧义结构决定增益」的机制因果链。</description></item><item><title>FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-facet-terminal-task-synthesis-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-facet-terminal-task-synthesis-paper-reading/</guid><description>深度精读 USTC+上海AI Lab+复旦合作的 FACET 论文——面向终端 agent 训练的任务合成框架。论文指出多阶段任务合成的两大失败根源：源信息逐步丢失与任务制品间漂移，提出三阶段方案：71K 技能库构建、五维情景重构、以及以&amp;rsquo;共享可执行状态&amp;rsquo;为核心的环境先行接地，按 I→S→V 顺序让指令/解法/验证器共享同一真实容器状态。基于 6078 个任务（每任务 22.77 项可执行检查）、仅 1.2K SFT 轨迹，即让 Qwen3.5-27B 在 Terminal-Bench 2.1 上提升 6.75 分，距 397B 巨兽仅差 1.49 分而参数少约 15 倍。</description></item><item><title>Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-phantom-gains-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-phantom-gains-paper-reading/</guid><description>深度精读 Phantom Gains——一篇审计 LLM 自训练&amp;rsquo;自我改进&amp;rsquo;证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时，转移统计本质上是两个噪声估计的差分，极易产生&amp;rsquo;幻影增益&amp;rsquo;。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线，识别出七类测量失效——每一类在缺少控制时都会反转结论：单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案（逐问题精确检验 + 合并基线池 + FDR 控制）在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示：外部蒸馏能改善 base 模型未触及的问题而三种自训练不能，回归分析以 p&amp;lt;10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩：每个报告的统计量都需要单独测量的 null。</description></item><item><title>Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-low-resource-thinking-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-low-resource-thinking-paper-reading/</guid><description>当低资源语言推理微调只被一个准确率数字评判时，我们到底在测什么？Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验，发现最佳微调 arm 76.5 分竟低于基线 77.2 分，而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导，几乎不携带信息。改用六维行为度量后结论完全翻转：SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍；RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零，且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。</description></item><item><title>Agent Lightning v1.0: Towards Harnessed Agentic RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agent-lightning-v1-harnessed-rl-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agent-lightning-v1-harnessed-rl-paper-reading/</guid><description>微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0，首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时，训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战，以约3500行代码给出参考实现，仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%（+14.6个百分点），并公开完整数据清洗管线与防reward hacking脚手架。</description></item><item><title>Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agentic-esopt-evolution-strategies-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agentic-esopt-evolution-strategies-paper-reading/</guid><description>新加坡国立大学、南方科技大学与牛津大学团队论证：在长程agent微调场景中，进化策略（ES）不只是更便宜的RL替代品，而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化，GPU显存与推理持平（8.41GB，比GRPO低85.7%），在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点；WebArena-Lite上完成27B模型全参适配（29.47%→36.16%），并支持prompt-参数协同进化。</description></item><item><title>Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-co-rl-unsupervised-reasoning-cohort-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-co-rl-unsupervised-reasoning-cohort-paper-reading/</guid><description>当推理能力超越人类可靠评估的范围，真值标签反而成为最稀缺的资源。Co-RL 给出的答案是：让多个不共享参数、来自不同家族的模型组成『学习共同体』，彼此用多数票伪标签互为奖励源。理论上，论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化；而交叉监督把正确收敛盆从『每题各自 p&amp;gt;1/2』扩大到『pA+pB&amp;gt;1』，互补性可以直接兑换正确性。实验上，4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%，5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%，Gemma-3-12B 甚至反超有真值监督的 GT-Reward。</description></item><item><title>SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-sa-mrpo-saturation-advantage-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-sa-mrpo-saturation-advantage-paper-reading/</guid><description>UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权：针对固定标量化+组标准化的两大缺陷（奖励轮廓不同的rollout获得相同优势；已饱和目标仍按固定权重占用梯度预算），按每个奖励维度的实时饱和度自适应重加权，使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO（AIME24 +5.0pp、MATH500 +3.5pp）；自适应推理设置平均准确率+3.8且响应更短；代码基准Codeforces从10.6%升至12.9%。机制本质：把优化预算从“维持已会技能”重新分配到“攻克未会技能”。</description></item><item><title>VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-vibeworlding-3d-agent-rl-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-vibeworlding-3d-agent-rl-paper-reading/</guid><description>港科大广州与腾讯TEG AIPD联合发布VibeWorlding——首个面向vibe worlding agent（从用户查询端到端构建可交互3D开放世界）的开源基准+训练统一框架：VWE-Bench提供2616个高质量3D资产、323个人标种子世界、6828条逆向合成多模态查询与双约束验证器（物理可行性+意图满足）；VibeWorlding-Gym把资产检索/编辑/渲染统一为MCP工具沙盒并以rubric奖励驱动GRPO多模态RL后训练。实验揭示GPT-5.5（57.3%）与Qwen3.8-Max（56.9%）均远未解决该任务、瓶颈定位在精确3D世界编辑；RL后训练使开源Qwen3-VL-30B-A3B从13.6%升至59.3%全场第一，8B版41.4%比肩Gemini 3.1-pro。验证器与人类判断系统级排序相关ρ=0.88，为agentic RL提供了可靠奖励服务。</description></item><item><title>Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-intern-s2-mobius-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-intern-s2-mobius-paper-reading/</guid><description>Transformer的知识（FFN）与推理（Self-Attention）逐层绑定，模型只能靠冗长CoT弥补深层知识无法回传浅层的缺陷。上海AI Lab提出Mobius架构：全局共享的Memory（FFN知识向量库）+多个Reasoner（Self-Attention）以隐状态为载体反复查询知识库，原生获得反向残差连接与动态隐推理两大能力。7B从零训练以62.6%数据达到Transformer同等MMLU（1.6倍数据效率），Intern-S2-Mobius-35B持续预训练后MMLU Pro 89.05超Qwen3.5的85.31，端到端推理加速近4倍、输出token缩短1.2–5倍。本文拆解其知识-推理解耦机制、两大原生能力的因果链，并展望自进化、世界模型与软硬件协同四个延伸方向。</description></item><item><title>Latent On-Policy Self-Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-lopd-latent-self-distillation-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-lopd-latent-self-distillation-paper-reading/</guid><description>在线策略自蒸馏（OPSD）用特权上下文让自教师比学生更知情，但特权格式由设计师手工规定——答案、反馈、技能或轨迹，各有盲区。NPS与上交团队提出LOPD：让特权上下文本身从经验中端到端学习——检索相关经验经作曲器压缩为96个连续隐token条件化自教师，特权间隔约束防止教师向学生坍缩，训练后只留学生。全部10个骨干-基准组合获最佳聚合结果：Qwen3-8B EnvScaler 66.4 vs 最强基线60.2；以不到GRPO/Skill-SD 30%的rollout预算超越两者。消融直接证明：隐上下文联合学习是全部增益的必要条件。</description></item><item><title>Self-Supervised Visual On-Policy Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-s2vopd-self-supervised-opd-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-s2vopd-self-supervised-opd-paper-reading/</guid><description>在线策略蒸馏（OPD）依赖教师-学生间的信息不对称，通常来自更强教师或特权监督。UCSD、牛津等五校团队提出反转思路：不给教师加信息，而是给学生减信息——学生看强增广视图、EMA教师看原图，免费构造出等效特权不对称。S2VOPD用0.3–0.6倍降采样+50%概率高斯噪声的最优配方，将Qwen3.5-4B在六个细粒度感知基准上从70.7%提升至77.4%，超越Qwen3-VL-235B与GPT-5.4，追平397B模型；对称自蒸馏反而退化。三定律浮现：不对称必须存在、强度适中、差距须保持任务一致。</description></item><item><title>SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-18-simpleopd-tokenizer-distillation-paper-reading/</link><pubDate>Tue, 18 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-18-simpleopd-tokenizer-distillation-paper-reading/</guid><description>把长上下文推理教师的能力蒸馏给异分词器短上下文学生，会遭遇token错位、长度爆炸与训练崩溃三重障碍。上海AI Lab SU-01团队提出SimpleOPD：在共享文本空间对齐——学生用自己分词器生成、教师用自家分词器评估同一文本，仅对占据完全相同文本跨度的token配对监督；配合终止token优势屏蔽+学生参考KL损失，截断率降至近零。Intern-S2-Preview在ProofBench从34.0提升至55.2（+21.2分），超越Gemini-2.5-Pro，跨Qwen/Intern/GLM/Gemma四大家族全部正向增益。本文拆解其对齐机制、稳定性因果链与长度爆炸的根因解释。</description></item><item><title>AQuA: Recursively Self-Improving Quantitative Trading Research Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-17-aqua-trading-agent-paper-reading/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-17-aqua-trading-agent-paper-reading/</guid><description>深度精读普林斯顿、蚂蚁集团与斯坦福联合论文 AQuA：用两个互不共享记忆的语言模型研究系统分别做因子发现与模型开发，靠“密封沙盒+非对称自由”把防泄漏做成构造性质——agent 只能写受限 DSL、搜索只看验证集分数、测试窗口冻结后只评一次。加密货币 5 分钟数据组合信号 IC 约 0.190，美股 30 分钟 held-out 每股 IC +0.0843、Sharpe@2bp 最高 +2.50，2021–2025 逐年为正。</description></item><item><title>Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-17-crest-credit-assignment-paper-reading/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-17-crest-credit-assignment-paper-reading/</guid><description>深度精读 2026 年 8 月 arXiv 论文 CREST：面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」，让自教师只调幅值、不碰方向，从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%（较基座 +29.88），13/14 项最佳，长上下文与 Session 级指标增益最大。</description></item><item><title>Full-bandwidth transformer 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-16-full-bandwidth-transformer-paper-reading/</link><pubDate>Sun, 16 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-16-full-bandwidth-transformer-paper-reading/</guid><description>Full-bandwidth transformer（微软+JHU+普林斯顿，含 John Langford）指出自回归 Transformer 的垂直反馈通道极窄：步间只回传一个采样 token（至多 log2|V| 比特），顶层隐状态被直接丢弃。论文提出潜反馈解码（latent feedback decoding），用门控线性单元把上一步顶层隐状态与 token 嵌入融合后回灌输入端，配合多 pass 训练目标、渐进调度与 prefix mixin，在 1B 模型 400B token 预训练中验证：Math500 超越 1T token 标准基线、GSM8K 指令调优后 71.8 逼近 1T 基线、约 2 倍数据效率、base 模型推理链显著变短且精度不降，每 token 推理开销不到 1%。本精读覆盖带宽视角的动机、可达集理论、训练配方、实验因果链与可推广灵感。</description></item><item><title>Massive Activations in Hybrid Linear Attention Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-15-massive-activations-hla-paper-reading/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-15-massive-activations-hla-paper-reading/</guid><description>混合线性注意力（HLA）LLM 用少量全注意力层搭配大量线性注意力层来兼顾长上下文与效率，但巨量激活（Massive Activations）在其中如何表现此前几乎无人研究。本精读覆盖首个系统性分析工作：论文发现两种与架构严格对齐的激活形态——注意力前尖峰（PAS）与尖峰间平台（ISP），在 5 种线性架构、6 种混合配置、5 个数据域、1.2B–397B 的 12 个开源检查点上高度复现，Sink-spike 对齐率高达 99.4%–100%；并提出统一的「写入-汇聚-抵消」生命周期机制：MA 的抵消时机决定形态——快速抵消形成 PAS，延迟抵消形成 ISP，全注意力极限下恢复传统 LLM 的稳定 MA。门控实验的不对称效应进一步印证全注意力层是组织 MA 动力学的核心节点。</description></item><item><title>DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-didpo-coding-credit-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-didpo-coding-credit-paper-reading/</guid><description>编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改，谁贡献了通过、谁制造了失败，传统方法无法区分。DiDPO 从代码 diff 的结构出发，用「可分组性分数」动态选择锚点，把完整 diff 切成可比较的子 diff 组，把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%，并附带开源 verl-code 代码库。本精读按九部分结构拆解：从背景、定位、问题抽象、解法、实验证据到优势根源的因果链，再到必要知识反推与通用性灵感。</description></item><item><title>SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-sft-rl-multitask-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-sft-rl-multitask-paper-reading/</guid><description>当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时，SFT（监督微调）和 RL（强化学习）会表现出截然相反的行为：SFT 在多阶段训练中因梯度方向冲突而性能崩溃，RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式，首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异，并提出 Parallel-RL 范式——各任务独立 RL 后合并参数，在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异，建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。</description></item><item><title>AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</guid><description>AgentOPSD 把 Agent 强化学习中长期被回避的&amp;rsquo;信用分配&amp;rsquo;难题重新拉回中心：在多轮交互、稀疏奖励的 Agent 任务里，GRPO 这类方法只能把最终成败均摊到每个动作上，导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师（注入了成功技能 c+）与学生之间的 token 级对数概率差聚合为 turn 级证据，再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k，最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把&amp;rsquo;稀疏结果监督&amp;rsquo;转化为&amp;rsquo;每一步的密集信用&amp;rsquo;，在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%（+7.9pp），长程任务每轮交互衰减仅 0.54 点（GRPO 衰减 2.91 点）。消融实验进一步证明：先验锚定贡献 -10.2pp 是最关键设计，贝叶斯方向（符号保持）次之 -8.6pp。</description></item><item><title>CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-calibforge-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-calibforge-paper-reading/</guid><description>CalibForge 提出了一个自主终端任务合成系统，把求解器行为当作&amp;rsquo;构建时反馈&amp;rsquo;，通过多求解器校准和对比求解器校准两种对抗式策略，将候选任务反复修订到&amp;rsquo;可证明可解但又不被统一求解&amp;rsquo;的求解器相对可学习区间。基于 5,431 个校准任务蒸馏 SFT 后，Qwen3-30B-A3B 在 Terminal-Bench 2.0 从 7.87% 跃升到 32.58%，并在 SWE-bench Pro、Doc2Repo 两个分布外基准上同步取得 +27.68、+30.04 个百分点的迁移提升。本文从终端任务与可学习区间讲起，逐层拆解对抗式作者-求解器循环、轨迹反馈的三类修订模式，并从第一性原理分析&amp;rsquo;为何校准优于单求解器反馈&amp;rsquo;。</description></item><item><title>EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</guid><description>蚂蚁集团与上海交通大学联合提出 EnvACE，让一个策略同时扮演「行动者」和「环境」两个角色：Acting 角色生成工具调用，Rehearsal 角色生成对应的环境响应，两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互，却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline，综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是，模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling，在提交执行前先在内部排练验证，把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」，并提炼出三条可迁移到其他领域的通用灵感。</description></item><item><title>ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-abseeker-paper-reading/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-abseeker-paper-reading/</guid><description>上海交通大学提出ABSeeker，通过答案回溯线索恢复（ABCR）和线索锚定步级评分（CASS），将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本，ABSeeker在BrowseComp上达55.3%，匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。</description></item><item><title>OPD-V: Visual On-Policy Self-Distillation with Modality Balance 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-opd-v-paper-reading/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-opd-v-paper-reading/</guid><description>本文揭示了多模态LLM推理中&amp;rsquo;模态不平衡&amp;rsquo;对自蒸馏（OPSD）效果的隐性破坏。通过构建Positive Teacher（放大图像）和Negative Teacher（遮蔽图像），发现模态平衡本身可作为特权信息。提出模态平衡信任域选择on-policy token进行蒸馏，跨6个基准、4个MLLM基座、5种后训练方法一致提升推理性能并降低训练成本。</description></item><item><title>Privileged, but Biased: How PI-Conditioned Teachers Break Self-Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-pi-biased-distillation-paper-reading/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-pi-biased-distillation-paper-reading/</guid><description>微软研究院系统性诊断自蒸馏（SD）作为RLVR替代方案的根本缺陷。通过单一因果链揭示：特权信息（PI）偏见使教师的per-token目标偏向特定参考解而非通用正确性，学生损失集中于低信息token，最终训练信号与任务成功解耦。在QA、数学、编码和Agent工具使用四个领域跨模型规模和PI形式验证，为OPSD/SDPO研究方向提供根本性警示。</description></item><item><title>【论文精读】Any-OPD：通过表示空间桥接实现异构流匹配模型的在策略蒸馏</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-any-opd-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-any-opd-paper-reading/</guid><description>京东Any-OPD首次解决跨家族流匹配模型的在策略蒸馏难题：用冻结DINOv2表示空间桥接不兼容的潜在空间，仅训练LoRA适配器，将12B FLUX.1-dev教师的能力蒸馏到2.5B SD3.5-Medium学生，在多项指标上实现&amp;rsquo;学生超越教师&amp;rsquo;的奇迹。ImageReward提升是教师自身优势的近4倍。</description></item><item><title>DAPD: Dual-Anchored Policy Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-05-dapd-paper-reading/</link><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-05-dapd-paper-reading/</guid><description>On-policy 自蒸馏（OPSD）本该是 LLM 后训练的稳妥方法，但它会让模型越练越差——DAPD 首次诊断出根因是&amp;rsquo;特权幻觉&amp;rsquo;：训练时教师能看到参考答案，推理时学生看不到，学生却表现得像参考答案还在一样。DAPD 用双路径锚定（DPA）和双源锚定（DSA）在匹配信息可用性下对齐，让 Qwen3-4B 平均 +2.00，且关键的是——OPSD 增益在 8B 以上几乎消失，DAPD 在 32B 仍稳定 +2.78。本文从&amp;rsquo;信息不对称&amp;rsquo;的第一性原理出发，解释为什么改信号不如改结构。</description></item><item><title>From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-spyrl-rlsvr-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-spyrl-rlsvr-paper-reading/</guid><description>RLVR（带可验证奖励的强化学习）让 LLM 在数学、代码等可确定性判对的领域突飞猛进，却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL：借鉴自监督学习「构造前置任务」的思路，把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的，投票结果天然可验证，从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero，甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案，且成本为 0。</description></item><item><title>Perception-Correction Distillation：多模态推理器感知蒸馏信用分配精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-02-pcd-paper-reading/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-02-pcd-paper-reading/</guid><description>中科院自动化所Hongyu Lin团队提出PCD（Perception-Correction Distillation），用下游失败和师生分歧作为互补见证的贝叶斯证据组合，形成软AND门精准识别&amp;rsquo;可纠正的感知失败&amp;rsquo;。乘法是唯一在任一见证缺失时归零的归一化双线性门。8B→2B从OPD的44.50提升至47.28，32B→8B从56.94提升至61.22。</description></item><item><title>β-OPSD: Deriving with Policy Optimization, Training with Self-Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-02-beta-opsd-paper-reading/</link><pubDate>Sun, 02 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-02-beta-opsd-paper-reading/</guid><description>β-OPSD揭示在线策略自蒸馏（OPSD）是KL正则化策略优化家族中β=1的特例，将β从隐式固定值变为可控参数后，最优策略变为参考策略与特权教师之间的几何插值。通过将RL推导的闭式解转化为蒸馏目标，用廉价的蒸馏近似昂贵的策略优化。Return-to-go信用分配纠正token级更新的短视性。在Qwen3-1.7B上数学推理平均提升5.74分，持续超越vanilla OPSD、SFT和GRPO。</description></item><item><title>RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-rsibench-data-paper-reading/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-rsibench-data-paper-reading/</guid><description>RSIBench-Data 是首个专门评估「LLM Agent 能否自动化数据中心化后训练研究」的受控基准。它固定训练/服务/评估基础设施，隔离 Agent 的研究决策能力。实验揭示了「发现-���靠性差距」：Agent 在 58.33% 的设置中能通过反馈迭代改进首次尝试，但在达到峰值后继续搜索时，78.26% 反而退化。强运行轨迹有四种模式：准确假设、验证信号、行为对齐数据、保留最佳检查点。</description></item><item><title>Why Supervised Fine-Tuning Fails to Learn: A Systematic Study of Incomplete Learning in Large Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-13-incomplete-learning-sft-paper-reading/</link><pubDate>Mon, 13 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-13-incomplete-learning-sft-paper-reading/</guid><description>这篇 ACL 2026 Main 论文首次系统性地揭示了「不完全学习现象」（ILP）：即使训练损失收敛，LLM 仍有约15%的训练样本无法被正确复现。论文将这一现象归因为五个可诊断的来源，并提出了一个「先诊断、再对症下药」的框架，证明了SFT失败的异质性——不同原因需要不同解法。</description></item><item><title>Verbalizable Representations Form a Global Workspace in Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-07-global-workspace-paper-reading/</link><pubDate>Tue, 07 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-07-global-workspace-paper-reading/</guid><description>Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的&amp;rsquo;未说出的词语&amp;rsquo;组成，仅占激活方差不到10%，却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。</description></item><item><title>Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-06-10-sft-interaction-paper-reading/</link><pubDate>Wed, 10 Jun 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-06-10-sft-interaction-paper-reading/</guid><description>深度精读上海交通大学张拳石团队 arXiv 2026 论文，从交互视角揭示 SFT 在 LLM 中的真实作用机制——主要是在极短窗口内去除噪声交互，而非学习新的可靠表征。这一发现为早停策略提供了可解释的理论依据，有望节省 30%-50% 以上的训练算力。</description></item></channel></rss>