<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>强化学习 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/</link><description>Recent content in 强化学习 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/%E5%BC%BA%E5%8C%96%E5%AD%A6%E4%B9%A0/index.xml" rel="self" type="application/rss+xml"/><item><title>信用分配四重奏：给每一步发对奖励——FAULT、SHARPO、T2SPO、DARS 合读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-03-credit-assignment-quartet-paper-reading/</guid><description>2026 年 10 月初，四篇论文从四条路线围攻 agentic RL 的同一个软肋：终端奖励只给轨迹级 0/1 分，步级信号从哪里来。阿里的 FAULT 用结构化自诊断加结果定价加守恒再分配，把训练信号覆盖率从 GRPO 的 41% 拉到 95%，ALFWorld 91.0%；LinkedIn 的 SHARPO 用段级 hindsight 重加权，84.90±1.19 对 GRPO 70.57（+14.32）；南大+字节的 T2SPO 用冻结 TabPFN 当免训练进度估计器，WebShop score +12.7；UIUC 等的 DARS 用谓词依赖图势函数塑形，ALFWorld 1.5B 96.9% vs GiGPO 86.9%。四篇的共同主题是「过程信号可信化」：不是要不要过程奖励，而是如何让过程奖励锚定在唯一可信的终端结果上、可验证、不被策略钻空子。本文合读四条路线的机制设计、证据链与边界，并提炼可迁移的通用做法。</description></item><item><title>Harness 的三种缩放轴：Mid-Harness × STITCH × Turbo Harness 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-harness-scaling-duet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-harness-scaling-duet-paper-reading/</guid><description>同日三篇论文从三个互补粒度回答同一问题：固定模型后 Harness 侧还有哪些缩放轴可挖。NVIDIA+KAIST 的 Mid-Harness 下沉「动作级」——在模型与 Harness 边界采样 N 个候选、执行前由验证器选一，发现采样收益完全由验证支配（前沿验证器把 TerminalBench-Lite 从 50.00% 拉到 68.03%），且与轨迹级缩放正交可组合（+Best-of-T 达 66.33%、成本减半）。UIUC+UMich 的 STITCH 沿「原语级」轴测试时组装——带 scope/contract 的原语库+确定性编译器，SWE-V 80.5%、组装开销仅 2.7%，配 mismatch gap 与指数衰减两命题。Rutgers+Red Hat AI+MIT-IBM 的 Turbo Harness 沿「实例级」轴打补丁——回收外层搜索副产物蒸馏 playbook、GRPO 训 9B 编辑器逐实例补丁，SWE-V 38.4→54.4%、步数 23.1→8.7。三轴正交可叠加，构成 Harness 工程学的完整缩放谱系。</description></item><item><title>编码 Agent 训练三条线：token 效率、自验证与安全 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-coding-agent-training-trio-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-coding-agent-training-trio-paper-reading/</guid><description>本篇合读 2026 年 9 月底同期发布的三篇编码 Agent 后训练论文：HERO 用分层强化学习在不牺牲解题率的前提下把 token 开销降下来（SWE-bench Verified 上 4B 模型 32.8→40.0% 且相对 GRPO 省 39.8% token）；SCVD 先用候选态重放诊断出终端 agent 自验证「报错可靠但通过不可信、检出错误仅半数能修」，再用学生条件化蒸馏修复（PASS@1 +9.7~16.9pp 且 OOD 不掉点）；SecureVibe 先归因不安全 agent 缺的是安全规划与测试行为，再用 Security Suite SFT + rl/hg 双路后训练补齐（unseen CWE SecPass 7.69→19.23 且 SWE-bench +4.1）。三篇论文共享同一方法论：先归因行为缺口，再设计监督信号——共同回答「编码 Agent 的后训练到底该优化什么」。</description></item><item><title>训练前沿四重奏：蒸馏外推、规模解除、奖励治理与具身评测 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</link><pubDate>Fri, 02 Oct 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-10-02-training-frontier-quartet-paper-reading/</guid><description>本篇合读 2026 年 9 月底集中出现的四篇训练侧前沿论文：RIDE 把「教师是方向不是终点」操作化为表示空间的 RL 残差外推，四组基座全部追平或超越教师；OASIS 诊断出在线自蒸馏的规模瓶颈源于「在教师不可模仿处监督」，用验证脚手架解除；ProRubric 把 Rubric-RL 奖励攻击的根因从准则文本转移到聚合方式，合取式协议级评分回收三分之一损失；GPT-6 Astra 具身评测则以六域系统实验界定前沿模型「任务决策强、物理控制弱」的能力边界。四篇合起来构成一条主线：监督信号放对了空间、放对了状态、用对了聚合、并诚实面对能力边界。</description></item><item><title>CAMG × Comet-9B：文件即记忆与程序状态推理的 Agent 训练新范式 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-training-paradigm-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-training-paradigm-duet-paper-reading/</guid><description>本篇精读两篇 2026 年 9 月的代码 Agent 训练论文：京东的 CAMG/CAMG-RL 发现专用记忆工具落在预训练分布之外（surprisal 6.371 vs 0.252 nats/token），转而用纯任务奖励让 shell 文件操作自发生长为记忆，4B 模型追平 35B；UCSB 与微软合作的 Comet-9B 不直接训练写补丁，而是训练「程序状态推理」（bug 何时触发、错误如何传播），反而把 SWE-bench Pro 从 24.35 推到 30.51。两篇论文共同指向一个反直觉结论：不直接优化目标行为，而是优化能迁移的中间能力。文章按背景、定位、问题、解法、证据、根源、知识反推、通用灵感九部分展开，并用外部文献交叉验证两大机制。</description></item><item><title>CoDeL × ReproBench：智能体安全的攻防共进化与漏洞复现评估 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-security-training-eval-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-security-training-eval-duet-paper-reading/</guid><description>本精读合读两篇智能体安全新工作：北航 CoDeL 将间接提示注入防御形式化为攻防共进化训练，首创「攻击潜伏期」可度量信号，在 AgentDojo 上将攻击成功率从 0.364 压到 0.042（−88.5%）同时受攻效用提升 38%；中科院软件所 ReproBench 则把 LLM 漏洞复现评估推入 pre-environment 设定，用真目标门控暴露出 45.3% 的「仿真替代」失败模式。一篇教智能体抵御攻击、一篇测智能体发起攻击的能力，恰构成安全能力的攻守双向标尺。</description></item><item><title>CodeSkill × NanoHarness：技能抽象与 Harness 效应——被低估的智能体性能杠杆 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-skill-harness-duet-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-skill-harness-duet-paper-reading/</guid><description>本精读合并解读两篇从「模型权重之外」挖掘编码智能体性能的论文：清华+华为诺亚+上交的 CodeSkill 把长程 RL 从 token 级提升到技能级——teacher 蒸馏三级文本技能（目标/执行/控制），分层 VAE + Gumbel-Softmax 执行反馈门控边界把离散技能映射为连续隐变量 zH/zM/zL，以软提示前缀注入冻结 LLM（LoRA），PPO 在隐空间优化；SWE-bench Verified 76.2、EvalPlus 99.2 开源第一，交互步数 12.3→6.8（−45%），去掉 VAE 直接用文本技能+RL 则 BigCodeBench 从 94.8 掉到 88.4。南京理工+TUM+南京大学的 NanoHarness 首次把 harness（模型外基础设施）作为一等研究对象做组件级受控分解：固定模型下 harness 差 19.4pp vs 模型差 22.8pp；在 mini-SWE-agent 上增量加五组件，工具注册表 +4.57pp、任务特定子代理 +5.91pp，而上下文压缩 −4.86pp——机制是结构化工具把无序 shell 探索变针对性调用（jqlang 案例 133 次探测→43 次、通过率 24.68%→68.17%）。二者共同指向：技能结构与 harness 设计是被系统低估的性能杠杆。</description></item><item><title>EAPO × DN-MOPD × d-OPD：大模型训练信号的三个盲区与最小修正 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-training-signal-trio-paper-reading/</guid><description>同日三篇论文各自修复了 LLM 训练信号的一处失真：KAIST+DeepAuto.ai 的 EAPO 发现正负反馈下 token 熵的信息量不对称——正优势应强化高熵的「惊人成功」、负优势应纠正低熵的「重复失败」，符号-熵耦合重分配使 Qwen3-4B 六基准平均 31.0%（超最强基线 5.6pp，AIME24 20.2 vs GRPO 12.5）；NTU+耶鲁+曼彻斯特的 DN-MOPD（当日 Hugging Face 日榜 up=111 第一）发现等权多教师蒸馏中 IF 域反馈离散度是池化信号 2.3–4.4 倍、占联合梯度 94% 而淹没数学信号，批内测离散度+有界乘子重缩放即恢复各域均衡（8K 下 +2.47~+3.08）；清华+MIT+NVIDIA 的 d-OPD 识别出 AR→块扩散蒸馏的目标条件失配——教师只看因果前缀而学生看得见未来，Bayes 未来重加权把 token 级 KL 从 0.4444 降到 0.1249，8B 平均 59.8 vs 55.9。三者共同示范了「先诊断信号失真、再做最小修正」的方法论。</description></item><item><title>Gagar × SWE-MILE × CRR：代码智能体强化学习的细粒度信用分配三重奏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-credit-assignment-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-credit-assignment-trio-paper-reading/</guid><description>本文合并精读 2026 年 9 月底三篇聚焦「代码智能体 RL 细粒度信用分配」的论文：小米+人大+北大+港大的 Gagar 用组内 agentic 评审排出补丁质量层级，再以保和重分配把质量偏好注入 GRPO 优势，DeepSWE 从 50.2% 提到 62.2%；中科院自动化所+国科大+腾讯的 SWE-MILE 定义导航势与验证势两个运行时势函数，以势差做过程奖励塑形，SWE-bench Verified 63.8 全面超越五条过程奖励基线；北邮+卢森堡大学的 NeurIPS 2026 论文 CRR 利用沙箱可 fork 的物理性质真实执行反事实动作，把「续走终局的回报差」作为免费过程奖励，Verified 41.7% vs GRPO 36.4%。三篇论文回答同一个问题——终态二值奖励下如何区分好坏决策——却给出质量对比、运行时信号、反事实执行三条机制迥异的路线。每篇覆盖背景、关联工作、问题、解法、证据、根源（含外部交叉验证）、知识反推与通用灵感。</description></item><item><title>Skill2Env × QwenGyre × AgentPerfBench：智能体强化学习的数据、系统与推理三层基建 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-rl-infra-trio-paper-reading/</link><pubDate>Wed, 30 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-30-agent-rl-infra-trio-paper-reading/</guid><description>同日挂出的三篇 arXiv 论文恰好拼出 Agent 强化学习的三层基础设施：数据层（AllSpark 的 Skill2Env 把「环境合成」从扩展覆盖升级为能力参数化——100 个带控制旋钮的难度模式+基于 solver 执行证据的迭代加难，1.5K 轨迹 SFT 换 7 基准 +8.4pt）；系统层（阿里 Token Hub 牵头的 QwenGyre 用 cell 级弹性调度+轨迹树处理让 2.4T 旗舰模型的百万 token rollout 在线 RL 提速 1.78×，pass rate 52.48%→58.54%）；推理层（帝国理工+剑桥+牛津的 AgentPerfBench 用 22 个负载画像+饱和扫描+NCU roofline 证明 chat→coding 的 TTFT 差 4.8×、操作强度差 46×，agentic 负载在并发爬升时吞吐崩塌 43–76% 而 chat 仍在扩张）。本文按九部分结构合并精读，并给出「Agent RL 全栈工程」的公共图景。</description></item><item><title>Up and Down the Abstraction Ladder: Code-Based Skills for Language Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-abstraction-ladder-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-abstraction-ladder-paper-reading/</guid><description>华沙大学与 Princeton 等九机构团队在 NetHack 上系统量化了「代码技能 vs 原始动作 vs 混合」三种动作抽象层级对语言智能体的影响：跨 14 个模型，技能让游戏进度近 3 倍、推理成本降 86%；RL 设定下学习增益达 7.2 倍；混合接口保留 95% 收益的同时保留原语回退能力。本精读覆盖 CodeHack 的 78 个 Python 技能与统一运行时设计、zero-shot/SFT/RL 三设定受控实验全表、优势根源因果链与外部文献交叉验证，并附面向 Agent 工程的通用灵感。</description></item><item><title>WeEnv: The Environment for Agentic Reinforcement Learning at WeChat 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-weenv-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-weenv-paper-reading/</guid><description>腾讯微信 AI 提出 agentic RL 的「环境税」：环境初始化独占迭代时间 53.4%，比训练本身还慢。WeEnv 对环境做打包-初始化-供给的全生命周期管理——layer group 活页夹式组合把 39,471 个镜像缩到 133 个、按需拉取让环境 10.6 秒启动（E2B 要 150.6 秒）、弹性配额化解秒级 47 倍的资源突发。本精读覆盖动机量化、三大设计的机制因果链、与 E2B/AgentENV/SkyRL 的外部交叉验证，以及企业生产部署视角的通用启发。</description></item><item><title>训练机制三重奏精读：对数线性稀疏注意力、置信度停止与跨段信用分配</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</link><pubDate>Tue, 29 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-29-training-mechanisms-trio-paper-reading/</guid><description>本文合并精读 2026 年 9 月下旬三篇聚焦「训练时机制创新」的论文：上交+字节 Seed 的 PISA 把块稀疏注意力的选择阶段压到 O(N log N) 并用 LSE 打分提升选块质量；马里兰+Capital One 的 ConfSFT 只监督置信度、不监督长度，就让四家族模型推理 token 下降 10%~19%；北大+深大+腾讯的 SLCA-GRPO 识别并结构性消除工具调用 RL 中的跨段信用错配，7B/8B 上 τ2-Bench 分别提升 9.15/10.03 个百分点。每篇覆盖背景、关联工作、问题、解法、实验证据、优势根源（含外部交叉验证）、知识反推与通用灵感九部分，最后合并讨论「选择、停止与信用分配」这一共同主题。</description></item><item><title>Just-in-Time Memory: Learning to Curate Task-Adaptive Memory for LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-27-jit-memory-paper-reading/</link><pubDate>Sun, 27 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-27-jit-memory-paper-reading/</guid><description>Salesforce AI Research 提出 JITMEM，把智能体记忆的「塑形」时机从写时推迟到读时：写时零损耗保存原始轨迹，读时由 curator LLM 联合当前任务与检索轨迹合成任务自适应 payload，用后即焚。因为 payload 在当前任务上被立即消费，curator 可用 GRPO 直接以任务原生得分训练，信用分配零步延迟。在 ALFWorld、WebShop、τ²-bench 上分别领先最强基线 16.2、16.3、3.9 个成功率点，输入 token 省约一半。本精读覆盖其问题定义、方法拆解、实验证据、根因分析与可迁移灵感。</description></item><item><title>Agent-Editing World Model 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-26-agent-editing-world-model-paper-reading/</link><pubDate>Sat, 26 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-26-agent-editing-world-model-paper-reading/</guid><description>人大高瓴学院 AEWM 论文精读。论文把语言世界模型的预测目标从「重建环境观测」重构为「预测决策效果并直接编辑 agent 状态」，用 Action Judge 三分类（CRITICAL/EXPLORATORY/NOISY）+ State Revision 推理动作联合编辑组成推理时闭环 EditAct，再用 AEWM-RFT 把编辑能力内化回 agent。Action Judge 基准 macro-F1 70.5% 超最强基线 10.6pp；六基准三骨干平均提升 3.2–6.7 分；9B+EditAct 反超 35B+ReAct。本精读覆盖动机、方法、证据链、外部交叉验证与可迁移灵感。</description></item><item><title>PACT: From Credit Assignment to Critic Alignment 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-25-pact-paper-reading/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-25-pact-paper-reading/</guid><description>强化学习已成为大语言模型后训练的核心组件，但 token 级信用分配始终缺乏公认的数学定义。本精读拆解 AllSpark 团队的 PACT 论文：以完备性、前缀一致性、中性性三个正则条件唯一确定 token 级信用——即条件奖励预测的鞅差分序列；由此统一解释理想教师下的在线蒸馏等价隐式 critic、RLOO 的梯度等价性、以及 GAE 中间 critic 误差可淹没真实信用等现象；进而提出 Actor-then-Critic 更新顺序、重要性采样修正与 BCE 损失的 PACT 训练流程。在四个数学基准上平均 72.87%，SWE-bench Verified 达 67.4%，分别超越 GRPO 8.80 与 2.0 个百分点。</description></item><item><title>SkillGym×VHD-Play：技能与环境从「外挂」到「内化」的两条路线 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-25-skill-environment-duet-paper-reading/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-25-skill-environment-duet-paper-reading/</guid><description>本篇合并精读两篇同期论文：ECNU 与上海AI Lab 的 SkillGym 把人类撰写的 Agent 技能文档转化为可执行、可验证的训练环境，通过对比式技能依赖性测试筛出真技能任务，用 8364 条验证轨迹微调出的 35B 模型在 GDPval 上提升 199 Elo；Georgia Tech 与阿里 Token Foundry 的 VHD-Play 反转环境合成顺序，先解出数学模型再让同一个解同时供出环境动力学与奖励函数，把 Qwen3.6-35B 的智能体得分从 0.204 拉到 0.815。两篇论文共同指向一个趋势：把知识变成环境的因果反馈而非文本的表面模仿，让技能与环境从推理时的外挂变成训练中的内化。</description></item><item><title>WhatWorkedBench: Benchmarking Experimental Understanding in AI Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-25-whatworkedbench-paper-reading/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-25-whatworkedbench-paper-reading/</guid><description>深度精读 CMU 与清华大学合作的 WhatWorkedBench——首个将实验理解力量化为可执行评测的基准：智能体在测量预算内选择实验、提交覆盖全部配置组合的响应面预测表，与离线 CPU 穷举的 1248 个配置真值逐条比对条件效应误差。本文覆盖实验理解力定义、八族工作流目录、35/36 任务符号反转的发现、共享推断与代码等价编码两大机制，以及与 MLE-bench 等工作的谱系定位、必要知识反推和七条通用性灵感，全面拆解这项把优化成功与干预知识首次分离的评测研究。</description></item><item><title>控制 token 注入×工具缓存逆转：Agent 安全与训练基础设施的两个隐蔽失效面 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-25-agent-safety-duet-paper-reading/</link><pubDate>Fri, 25 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-25-agent-safety-duet-paper-reading/</guid><description>本文合并精读两篇 Agent 安全论文。论文 A 证明：向工具调用上下文追加模型自身的控制 token，可让 gpt-oss-20b 的思维链从 52.5 个 token 降为 0，CoT 监督器拿不到任何可判信号，39.6% 原本被拒的恶意请求转化为成功执行——因为 CoT 是采样行为的产物而非义务。论文 B 证明：边缘正确的工具缓存会在组内共享随机结果时系统性偏移 GRPO 的 baseline，共享更新方向由胜率差而非均值差决定，符号可整体翻转，540 组配置穷举验证。两者共同指向：Agent 系统的失效面在结构层（解码 harness、缓存、归一化器）而非模型层。</description></item><item><title>当智能体替人跑一整天：PAI 分论坛上，AI 基础设施的三次换轨</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-pai-agentic-ai-infra/</link><pubDate>Thu, 24 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-24-yunqi2026-pai-agentic-ai-infra/</guid><description>2026 云栖大会「人工智能平台 PAI」分论坛全程复盘。PAI 负责人周文超用负载、范式、边界三个词定义 Agentic AI 对基础设施的重塑：推理调用次数增长数百倍使 KV cache 命中率成为第一指标，RL 算力消耗逼近预训练把「稳」变成生产化门槛，具身智能则把战场拉回数据质量。文中串联小米广告 +8 个点收入、大众故障归因数天级压缩、SciMaster 六小时顶博士三个月、圆桌「一千小时低质数据不如一小时高质量」等关键证据，提炼出从压榨算力到压榨数据、从模型精度到迭代周期的观察坐标。</description></item><item><title>Critical-State RL：为多轮工具调用诊断「可训练的模型调用」 —— 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-critical-state-rl-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-critical-state-rl-paper-reading/</guid><description>深度精读 Salesforce AI Research 的 Critical-State RL。它指出多轮工具调用失败往往卡在单个模型调用上，但「奖励有差异」并不等于「该调用值得训练」。方法先用训练前三闸门诊断（动作充分性 / 提升空间 / 可训练性），再用嵌套同前缀采样分离「动作依赖奖励方差」与「后续噪声」，最后只对选中的关键调用做 occurrence-local RL（上下文赌博机式训练）。BFCL 上对缺失函数任务 miss_func 恢复率 0.14→0.283（+14.3pp），错位训练反而 −4.5pp；记忆子任务 34.54%→50.54%；Nemotron 重复调用一致性 37%→75%。</description></item><item><title>DSec（DeepSeek Elastic Compute）: 面向规模化 Agentic 训练的可扩展沙盒基础设施 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-dsec-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-dsec-paper-reading/</guid><description>DSec（DeepSeek-AI + 清华大学）提出一套面向规模化 Agentic RL 训练的可扩展沙盒基础设施。它用三大支柱解决「海量环境、高密度资源、按需镜像」的难题：可组合环境层（overlayfs + EROFS，把 O(mN) 镜像数降到 O(m)）、高密度资源管理（virtio-pmem+DAX+DAMON+核调度，microVM 峰值内存降 40.2%）、3FS 按需镜像加载，并把 Agent 循环与可抢占 GPU 解耦以支持弹性训练。实测 8192 容器突发比 eager Docker 快 1.71×、磁盘写少 57%，规模达 300 万沙盒/日、峰值 38 万并发、&amp;gt;5000 个/秒创建。本文按九部分结构精读其架构、关键技术与实验，并通过外部检索交叉验证 serverless 沙盒（SAND/RunD）与 RL 训练基础设施（AgentGym/AgentScale）等相关工作。</description></item><item><title>FLARE：用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-flare-grm-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-flare-grm-paper-reading/</guid><description>深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型（GRM），输出结构化的步级风险诊断（风险等级+错误类+修复建议），在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励，首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%，token 省 5×；ROC-AUC 75.74%；SFT 相对提升 19.13%，RL 平均提升 9.19%。</description></item><item><title>IER-OPD: 1% 的 Token 就够——论同策略蒸馏中的梯度估计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-ier-opd-paper-reading/</guid><description>IER-OPD（MBZUAI + 蚂蚁集团）研究同策略蒸馏（On-Policy Distillation, OPD）中一个反直觉的事实：训练学生模型时，绝大多数 token 的梯度几乎不携带有用学习信号，只有极少数 token 真正驱动学习。论文在 Fisher 信息几何下对 reverse-KL 梯度做「信号-噪声」分解，定义信息效率比 IER = 信号/噪声，并据此设计候选集近似与 soft OR/AND 多准则融合，用 IER 分数筛选「高信息效率」的 token。实验显示：仅用 0.1% 的 token 预算，AIME26 即可达到全量训练的近乎持平（58.9 vs 59.9）；1% 预算下 AIME25 甚至超过全量（17.0 vs 14.4），且单步开销仅增加 2.2%。本文按九部分结构精读其动机、几何理论、稀疏选择机制与实验，并通过外部检索交叉验证 on-policy distillation（MiniLLM、GKD）与稀疏 token 选择等相关工作。</description></item><item><title>One to More, More to One：面向软件工程 Agent 的类别感知迭代专家训练（类别感知 SWE 专家训练精读）</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</link><pubDate>Wed, 23 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-23-swe-category-experts-paper-reading/</guid><description>阿里巴巴提出类别感知的 SWE 专家训练与策略整合框架：SWE Labeler 用 47 个语义族 227 个标签做多轴标注，Agentic-miniRL 在可执行奖励下做长程 RL，RRE 循环（Refresh-Repair-Expand）让专家自蒸馏成功轨迹，Label-routed MOPD 用 ReLU 门控奖励外推把同起源多教师整合为单一可部署学生。最终在 Pro-618 上达 58.04%（较基座 +5.39），多语言 59.00%（+2.78），且每个类别都优于 Pooled/Balanced RL。本文按九部分拆解背景、类别跷跷板、标注体系、RL 配方、自改进循环、多教师蒸馏、实验、外部交叉验证与局限。</description></item><item><title>CodeMidas: Scaling Agentic Coding RL Environments from Code Itself 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-22-codemidas-paper-reading/</link><pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-22-codemidas-paper-reading/</guid><description>CodeMidas（小米 LLM Core 联合北大、港大、人大）提出用源代码作为唯一输入，把开源库中「已实现功能」自动转化为带可靠验证器的编码强化学习（RL）环境。相比此前依赖 issue/PR/commit/测试/文档的环境合成路线，CodeMidas 首次做到五项开发记录全免，覆盖 3,185 个代码库、23 种语言、15 个领域，经四模块漏斗从 22,575 候选筛得 5,545 个高质量任务。用 GRPO 训练 MiMo-V2.5，在 SWE-bench Pro、DeepSWE、ProgramBench、RepoZero、Terminal-Bench 五个异构基准上全面提升（DeepSWE +11.7pp、ProgramBench +17pp）。消融证明「质量&amp;gt;数量」：清洗过滤后的 3k 子集即可击败 8k 未清洗样本。本文从根因上解释其优势来自可靠的二值奖励与任务供给的去绑定化。</description></item><item><title>信号质量二重奏：CoVer 验证器协同训练与 DENSE 轨迹蒸馏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-22-cover-dense-duet-paper-reading/</link><pubDate>Tue, 22 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-22-cover-dense-duet-paper-reading/</guid><description>本文合并精读两篇同主题论文：CoVer（UT San Antonio）与 DENSE（复旦+美团）。二者共同回答 RL 与智能体自改进中「信号从哪来、可不可信」这一核心问题。CoVer 在单策略 GRPO 内协同训练 coder 与 verifier，用协方差门控的互信息奖励挤出退化测试、用三级去重降低估计方差，把「自生成测试的信息价值」变成可证明的训练信号；DENSE 在完全结果盲视（无奖励、无验证器、无标签）下，把一条执行轨迹蒸馏成证据接地的嵌套 shortcut 树，用 REFIT 协议隔离出反馈这一唯一信息通道。文章从背景、定位、问题定义、解法、评估、根源、知识反推到通用灵感和交叉验证表，系统梳理两条「信号质量」路线如何从不同方向逼近同一结论：高质量信号胜过信号特权。</description></item><item><title>RetireOPD × EOS 终止符失配：在线策略蒸馏动力学二重奏 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</link><pubDate>Sat, 19 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-19-retireopd-eos-paper-reading/</guid><description>两篇同日论文从训练动力学层面解剖在线策略蒸馏（OPD）。浙大+阿里的 RetireOPD 发现教师监督的收益是阶段性的——师生梯度早期对齐、后期冲突，于是让学生在分歧停止收缩且达到教师成功率阈值时自动&amp;rsquo;退休&amp;rsquo;教师，ALFWorld 较 RL +14.1~18.8 点且每个设置反超自己的教师。UNC+BYU+微软的 EOS 研究则把 OPD 长度膨胀的根因追到词表级：基座学生与后训练教师可能把停止概率放在不同 EOS token 上（即使声明停止集相同），把功能等价 EOS 合并为共享语义停止动作即可大幅缓解。两篇合读，构成&amp;rsquo;OPD 何时该用、何时会坏&amp;rsquo;的完整图景。</description></item><item><title>Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-18-sp3o-value-flattening-paper-reading/</link><pubDate>Fri, 18 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-18-sp3o-value-flattening-paper-reading/</guid><description>上海AI Lab 联合上海交大、西湖大学等七校发现 PPO 在 LLM 强化学习中的系统性失效——『价值平坦化』：蒙特卡洛估计的状态价值在响应内剧烈变化，critic 预测却近乎水平线。诊断出两大根因（MSE 隐含方差惩罚+相邻状态冗余更新）后提出 SP3O：每条响应只监督 3 个位置分离的锚点。数学推理 +7.97pp、OOD +7.33pp，K=3 优于 K=64，越稀疏越好——一个『少即是多』的教科书式发现。</description></item><item><title>ExecuCritic × AgentGuard × RepoAtlas × Protocol Trimming 精读：编码智能体可靠性四重奏</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-coding-agent-reliability-quartet-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-coding-agent-reliability-quartet-paper-reading/</guid><description>四篇互补的 coding agent 可靠性研究合读：Intel×北大的 ExecuCritic 给 RLVR 加&amp;rsquo;校准 critic 塑形&amp;rsquo;——ρK 秩相关门控让 critic 失准自动坍缩，SWE-bench Lite +3.7pp 且 sandbox 执行省 42%；York 的 AgentGuard 从 642 条异常轨迹自动学条件激活护栏，异常执行率 69.0%→26.7%（代价：过度拒绝 19.3%）；北航 RepoAtlas 用 select-project-refresh 演化多模态仓库视图，三 VLM 一致 +2.4pp 且 token -5.8%；Intuit 工程报告量化协议保持裁剪——常规裁剪成功率 66.6-77.3% vs 协议感知 92.2%/自适应护栏 96.0%，临界阈值随复杂度上移。合读视角：可靠 coding agent 的四层防线——训练时（奖励塑形）、执行时（护栏）、探索时（上下文视图）、压缩时（协议保持）。</description></item><item><title>Mo' Models, Mo' Problems × Co-Skill 精读：多智能体选型与边云技能演化双视角</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-mo-models-coskill-mas-pool-evolution-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-mo-models-coskill-mas-pool-evolution-paper-reading/</guid><description>两篇互补的 multi-agent 工程研究：NVIDIA×哥本哈根的 Mo&amp;rsquo; Models 用 23 模型×3 科学基准证明 MAS 模型池&amp;rsquo;加模型常降性能&amp;rsquo;——oracle 潜力与实际达成存在鸿沟、同族池是唯一稳定正收益、准确模型解集高度嵌套（rM=0.931）；哈工大的 Co-Skill 诊断边云 skill 演化的&amp;rsquo;盲通信&amp;rsquo;根因（上传 token 25-42% 是重复前缀），用前缀合并轨迹 trie+渐进 skill 树双向解盲，token 省 15.6-41.9%、成功率提升 25.8-76.4%。合读视角：多 agent 系统的两个新瓶颈——选谁进队（异构组合的聚合噪声）与怎么通信（协作双方的信息结构）。</description></item><item><title>ScienceBuddy: Recursive-in-Recursive Self-Improvement for Interactive Scientific Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-sciencebuddy-recursive-self-improvement-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-sciencebuddy-recursive-self-improvement-paper-reading/</guid><description>ScienceBuddy 把&amp;rsquo;与研究者聊天&amp;rsquo;变成模型-线束双改进的燃料：研究者交互免费产出任务定义与评估 rubric，内层递归固定模型演化 harness（有界编辑+成对回归检查），外层递归固定 harness 做 rubric 奖励 GRPO——三周期后科学任务准确率 42.2%→73.3%，纯 harness 演化即可 +20pp（权重冻结），纯模型 RL 覆盖率 +19.5pp。Recursive-in-Recursive 范式为 RSI 提供了&amp;rsquo;两条改进通道各自可评估、互为条件&amp;rsquo;的工程化路径，并作为可下载的科研产品发布。</description></item><item><title>Spurious Tool Use: When RL Agents Learn the Wrong Reason to Act 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-17-spurious-tool-use-rl-agents-paper-reading/</link><pubDate>Thu, 17 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-17-spurious-tool-use-rl-agents-paper-reading/</guid><description>RL 训练的 agent 调用工具的理由可能是错的：UW+UCSD+Stanford 团队构造受控环境注入与工具强相关但因果无关的线索，发现反事实评估下伪工具调用率最高暴涨 +39.2%——而且捷径只在 agent 已可靠掌握该工具时形成（任务能力是捷径的前提）、语义对齐线索放大效应（对齐 +39.2% vs 交换 ≤3.5%）。反直觉结论：提升能力的 RL 同时放大捷径易感性，标准任务奖励不足以产生鲁棒工具策略；LLM 裁判的&amp;rsquo;工具必要性&amp;rsquo;密集奖励可有效压制且不损准确率。</description></item><item><title>Dream-RSI: Recursive Self-Improvement through Evolving Worlds 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-dream-rsi-replay-simulator-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-dream-rsi-replay-simulator-paper-reading/</guid><description>RSI（递归自我改进）的核心瓶颈是探索策略管理：固定策略无法适应搜索空间扩张，在线策略优化又受困于长程 rollout 的延迟昂贵反馈。Dream-RSI 的关键洞察是——积累的发现历史本身就是已实现搜索空间上的重放模拟器，把探索策略的改进从昂贵的真实环境 rollout 搬到廉价的历史重放（做梦即训练）。Lasso 求解器发现任务上 agent 调用较 SimpleTES 削减 162×，held-out 运行时 3587→2931ms。本精读覆盖三环循环机制、重放模拟器的信息学根基与发现求解器的算法细节。</description></item><item><title>HarnessBandit: Joint Learnability-Transferability Scheduling for Multi-Harness Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-16-harnessbandit-multi-harness-scheduling-paper-reading/</link><pubDate>Wed, 16 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-16-harnessbandit-multi-harness-scheduling-paper-reading/</guid><description>同一模型在不同 harness（系统提示/工具 schema/控制循环/轨迹格式）下表现不均——多 harness 共同训练时每个优化步选哪个 harness 是被忽视的调度问题。HarnessBandit 用双信号在线调度：learnability（批平均绝对优势，还有多少可学）× transferability（梯度 sketch 余弦，学了是否白学），bandit 采样决策。6 harness 在 ClawGym 训练，held-out 任务与 held-out harness 双评测均优于混合批次训练。本精读覆盖双信号的互补性设计与 DeepSeek 产学研背景下的调度理论落地。</description></item><item><title>COBRA-Skills: Contextual Bandit-Guided Evolution for Agent Skill Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-cobra-skills-bandit-skill-optimization-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-cobra-skills-bandit-skill-optimization-paper-reading/</guid><description>港中文深圳团队把 agent 技能优化重构为&amp;rsquo;动态候选空间上的预算受限序贯优化&amp;rsquo;：contextual bandit 优先级评分决定评估哪个候选（exploit 历史得分 + explore 不确定性），证据驱动的进化只做有界精炼不做全局重写。结果：6 个 benchmark × 3 模型平均提升 13.1/26.9/22.5pp，相对 SkillOpt 总成本砍 55-58%，每 benchmark 只用 50 个优化样本，且对 harness 更换鲁棒。</description></item><item><title>DataFlex-RL: An Evaluation Platform for RLVR Data Policies 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-dataflex-rl-data-policies-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-dataflex-rl-data-policies-paper-reading/</guid><description>北大×UCAS 等机构的 RLVR 数据政策评测平台：13 配置 × 12 匹配种子 × Qwen2.5-7B 在 12 个数学/逻辑/科学 benchmark 上的受控对比发现——均匀 GRPO 已提升 7.76 分后，&lt;strong&gt;无任何&lt;/strong&gt;选择/重加权方法的配对 95% CI 排除零；三种自适应混合均不优于固定等权。更警醒的是评测敏感性：math-heavy 摘要与均衡摘要的排名&lt;strong&gt;负相关&lt;/strong&gt;（ρ=−0.33）。&amp;lsquo;数据工程很重要&amp;rsquo;的流行叙事在受控条件下未被支持。</description></item><item><title>EvoRS: On-Policy Self-Evolution of Reward Systems for Open-Ended Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-15-evors-self-evolving-reward-systems-paper-reading/</link><pubDate>Tue, 15 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-15-evors-self-evolving-reward-systems-paper-reading/</guid><description>复旦大学针对开放 RL 的奖励系统自进化框架 EvoRS：rubric 奖励与 policy 构成动态反馈回路——policy 优化当前奖励时，初始有用的奖励系统会因 reward hacking 或区分度退化而失效。EvoRS 把奖励系统表示为可执行 Reward-DAG，agentic designer 从 on-policy rollout 与奖励轨迹更新它。写作/角色扮演任务上三种 judge 下质量最佳，超固定奖励 policy 2.107/4.767 分，reward hacking 与覆盖失败双降。</description></item><item><title>Eliciting Weak-to-Strong Generalization with On-Policy Reverse Distillation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-oprd-weak-to-strong-reverse-distillation-paper-reading/</guid><description>弱到强泛化的核心矛盾：常规蒸馏把弱教师当优化目标，学生的上限被教师的容量天花板钳死。OPRD 的解法优雅而克制——在学生 rollout 上提取弱教师相对其参考策略的&amp;rsquo;政策偏移&amp;rsquo;方向，只放大学生自身 verifier 梯度在该方向上的投影分量，不建立任何教师匹配目标。理论上保住了策略优化的不动点，实践上比 GRPO 少 33–67% 更新达到教师水平、最终超越教师，多教师场景比 Mix-RL 省 55% 更新。本文精读拆解其梯度投影机制、不对称缩放调度与&amp;rsquo;加速而非转向&amp;rsquo;的证据链。</description></item><item><title>ERPO: Entropy-Regularized Rank-Masked Policy Optimization for Test-Time RL in Code Generation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-erpo-probe-ttrl-code-paper-reading/</guid><description>测试时强化学习（TTRL）靠答案自投票构造奖励，但代码程序没有规范答案可比对——TTRL 由此与代码生成绝缘。本文提出 probe-driven TTRL：从题面自构造无输出探针输入，用候选程序行为一致性构造 Probe Consensus Reward；再用 ERPO 把 PCR 当作&amp;rsquo;负信号为主&amp;rsquo;的奖励——rank masking 屏蔽高共识半区、只抑制低共识程序，配合熵上限防止多样性坍缩。Qwen3-4B 在 LiveCodeBench 域内 pass@1 26.0→36.7、pass@16 34.4→46.3，零样本迁移 CodeContests 25.1→42.1，是唯一同时提升 pass@1 与 pass@k 的无标签方法。</description></item><item><title>ExecCritic: Learn to Test, Test to Improve for Coding Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-10-execcritic-test-verify-revise-paper-reading/</link><pubDate>Thu, 10 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-10-execcritic-test-verify-revise-paper-reading/</guid><description>同一个 Agent 轨迹既写补丁又写测试时，一个共同的误解会让&amp;rsquo;错误的补丁通过错误的测试&amp;rsquo;——执行反馈不但没用反而有害。ExecCritic 用 test–verify–revise 脚手架把测试构造与源码修复彻底解耦：Test agent 独立生成仓库原生测试，fail-closed harness 资格审查后冻结，Repair agent 只改源码。SWE-bench Verified 上，Qwen 自产测试把解决率从 61.2% 拖到 57.3%，GPT-5.6 测试提到 65.3%——测试质量决定反馈价值；角色专用 RL 把 Base-to-Gold 判别成功率从 22.2% 拉到 62.2%，两角色组合达 72.6%（+11.4）。本文精读拆解其解耦机制、fail-closed 语义与反馈可靠性的因果链。</description></item><item><title>FlowBalance：验证器锚定的自改进——把符号门控装进轨迹平衡 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-flowbalance-verifier-grounded-self-improvement-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-flowbalance-verifier-grounded-self-improvement-paper-reading/</guid><description>腾讯 HY LLM Frontier×UPenn 推出 FlowBalance：冻结的特权后见视角对已采样轨迹打密集分，验证器组相对优势用符号门控决定引导方向（正保留/负反转/零关闭），profiled trajectory balance 拟合归一化目标分布。Qwen3-8B 五基准平均 67.61 超 GRPO/OPSD/RLSD/FlowRL，AIME24 达标 100 步 vs GRPO 143 步，四条目标级定理精确刻画反自确认机制。</description></item><item><title>TGOPD：在策略蒸馏前先验证教师——提示级可靠性门控 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</link><pubDate>Wed, 09 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-09-tgopd-teacher-gating-opd-paper-reading/</guid><description>AllSpark 团队推出 TGOPD：对每个提示用少量验证器打分的教师探针估计可靠性，通过门控路由密集 OPD 信号或验证器锚定的 GRPO。4B/35B 两尺度三域 6/6 设置全部超过 Vanilla OPD，35B LiveCodeBench 64.0（其他蒸馏方法全部负迁移），探针填充教师空闲算力使 GPU 利用率 9.8%→78.9%。</description></item><item><title>Bilevel Coordinated Reflection: 多智能体 LLM 系统的博弈论统一理论 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-bcr-bilevel-coordinated-reflection-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-bcr-bilevel-coordinated-reflection-paper-reading/</guid><description>UCL×利物浦×华为的 BCR 把 orchestrator–worker 多智能体系统建模为双层协调博弈，证明 follower 子游戏是近似势博弈，并首次给出&amp;rsquo;只看文本的门控不可能可靠&amp;rsquo;的信息论不可能性定理。据此提出的 SRMA 仅在环境验证风险严格下降时接受候选记忆，SWE-bench 500 实例解决率 72.2%（免费反思仅 58.4%）。本文精读其双层博弈建模、漂移分析、不可能性定理与 SWE-bench 端到端验证的完整因果链。</description></item><item><title>CoSkill: 把元技能变成可学习智能体 — 分层技能库的联合强化学习 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-coskill-meta-skill-agents-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-coskill-meta-skill-agents-paper-reading/</guid><description>中科院自动化所×人大的 CoSkill 把静态元技能工作流重构为可学习的 Meta-Skill Agent，与 Reasoning Agent 共享单骨干联合 RL：推理智能体条件于检索到的任务技能与子技能，任务表现反向指导元技能精炼。ALFWorld 98.4%（+3.5pp）、WebShop 90.6%（+6.2pp），样本效率与墙钟效率全面占优。本文精读&amp;rsquo;技能从被动对象到主动协作者&amp;rsquo;的范式转变。</description></item><item><title>Extremely Sparse Supervision: 0.05% 的 token 监督就能激励推理 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-extremely-sparse-supervision-paper-reading/</guid><description>Amazon×Duke 在 on-policy 蒸馏设定下发现反直觉现象：每条推理轨迹仅监督 1–2 个关键 token（占全部生成 token 的 0.05%）即可匹配甚至超越全 token 训练的推理激励，跨 9 组师生配置、PPO-RLVR 与 Llama 模型一致成立。本文精读这一&amp;rsquo;有效学习不需要 token 密集&amp;rsquo;的证据链及其对后训练范式的改写意义。</description></item><item><title>Iris: Climbing to the Search Frontier — 开源搜索智能体的数据反构造与 SFT-RL 攀爬配方 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-iris-search-agent-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-iris-search-agent-paper-reading/</guid><description>AllSpark 团队发布 Iris-mini/pro 两个开源搜索智能体（35B-A3B 与 397B-A17B）：从网页超链接实体图反向构造多跳任务，把非答案实体改写为描述性引用以杜绝字符串匹配作弊；提出 SFT-RL climbing 交替训练——每轮 RL 把最难与最高效轨迹回流进下一轮 SFT。BrowseComp 88.6 / HLE 56.4，同参数段开源最强。本文精读其&amp;rsquo;不可作弊任务合成&amp;rsquo;与&amp;rsquo;爬坡式两阶段循环&amp;rsquo;的完整配方。</description></item><item><title>RISE: 自外推策略蒸馏把 on-policy 蒸馏变成递归自我改进 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-rise-self-extrapolating-distillation-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-rise-self-extrapolating-distillation-paper-reading/</guid><description>RISE 从模型自身 RLVR 训练轨迹外推合成教师：以当前检查点与滑动锚点的位移放大（β&amp;gt;1）构造未来教师，在 logit 或权重空间实现，教师随学生每轮刷新。OLMo3-7B AIME'24 从 30.2 提至 46.9（+16.7），ALFWorld +9.4、WebShop +10.9 vs GRPO，OOD 不降反升。本文精读&amp;rsquo;教师从哪来&amp;rsquo;这一 OPD 根本问题的第一性解法及其递归改进机制。</description></item><item><title>What Does Multi-Harness RL Learn? — 评测 Harness 是 Agent RL 的主导变量 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-08-multi-harness-rl-credit-assignment-paper-reading/</link><pubDate>Tue, 08 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-08-multi-harness-rl-credit-assignment-paper-reading/</guid><description>本论文在同一 Qwen3-8B 热启动上回放相同任务-harness 记录（Aider/OpenHands/Qwen Code/SWE-agent），对比 GRPO 的 Within/Cross 两种分组规则，用 24,000 次密封 SWE-bench Verified 评估发现：评测 harness 使解决率从 2.14% 摆到 9.27%（4.3 倍），训练配方仅移动 1.16，分组规则不显著（+0.25pp，CI 含 0）。harness 工程对 Agent RL 的影响碾压算法选择。</description></item><item><title>Rethinking On-Policy Distillation II: One Training Example 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-07-opd-one-training-example-paper-reading/</link><pubDate>Mon, 07 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-07-opd-one-training-example-paper-reading/</guid><description>on-policy 蒸馏到底需要多少数据？本文把实验推到&amp;rsquo;一条训练样本&amp;rsquo;的极限：单条查询即可驱动 OPD 持续改进数百步，覆盖全数据 OPD 71.5% 的状态空间；16 个语义多样查询覆盖 98.9% 并匹配全数据训练。提出状态覆盖率度量解释现象——OPD 是&amp;rsquo;数据过饱、算法饥饿&amp;rsquo;，瓶颈在步数效率而非数据规模。</description></item><item><title>DRACO 精读：没有验证器时，如何给长程 Agent 训练信号分步定责</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-draco-outcome-blind-credit-assignment-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-draco-outcome-blind-credit-assignment-paper-reading/</guid><description>DRACO（IBM×CMU）形式化&amp;rsquo;outcome-blind&amp;rsquo;训练设定——长程 Agent 任务往往没有程序化验证器可依赖。方法用训练中动态生成的 rubric 逐轨迹打一次分，再按&amp;rsquo;步骤涉及哪些标准&amp;rsquo;闭式分摊到每步 GRPO advantage，不引入任何可学习归因模块。AppWorld TN 上 Qwen3.6-27B TGC/SGC 69.4/41.1→85.3/70.6，反超偷看真值奖励的 GRPO +5.3/+11.3，τ-bench 零样本迁移 SR 15.8→20.4。</description></item><item><title>Locked at the Entrance 精读：RLVR 的多样性坍缩发生在推理的门口</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-locked-at-the-entrance-rlvr-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-locked-at-the-entrance-rlvr-paper-reading/</guid><description>RLVR 提升 pass@1 却坍缩解空间已是共识，但坍缩发生在哪一步始终未知。上海大学×伯明翰大学在 Countdown 任务上穷举解空间、按首操作数+算子划分入口族，把求解分解为 access×execution：PPO 覆盖 0.337→0.111，首算术操作前的似然偏移是下游的 11–16 倍，塞一个入口前缀就能让低覆盖族完成率 0.018→0.212——能力还在，只是不再进门。后层参数插值恢复 37% 覆盖且 pass@1 零损失。</description></item><item><title>When Models Edit Too Much 精读：编码 Agent 的过度编辑病与保真度评测轴</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-06-over-editing-minimal-code-edits-paper-reading/</link><pubDate>Sun, 06 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-06-over-editing-minimal-code-edits-paper-reading/</guid><description>NUS 团队在 400 个 BigCodeBench 任务上注入受控 AST 损坏、构造已知最小补丁的评测框架，系统刻画 over-editing：GPT-5.5 高 Pass@1 与大改动并存，一行 bug 修出 60 行代码；一条保存指令把超额编辑距离 0.195→0.131、认知复杂度降 26.6%、Pass@1 反升 2.3；SFT 过拟合已见损坏模式，RL 达 0.782 OOD Pass@1 + 0.050 超额距离且不伤通用编码能力。</description></item><item><title>Environment Evolution 精读：让训练环境的难度离线进化</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-05-environment-evolution-paper-reading/</link><pubDate>Sat, 05 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-05-environment-evolution-paper-reading/</guid><description>腾讯混元×港科大（广州）的 Environment Evolution 把环境难度演化从 on-policy 共进化中解耦：从多轮学习目标推导三个演化方向，用多 Agent harness 离线逐代提升环境难度，再由谱系调度器持续供给学习信号。Qwen3.6-27B/35B-A3B 经简单长程 RL 在 Terminal-Bench 2.1 分别提升 14.4/18.0 个百分点。本文基于全文阅读拆解演化方向推导与调度器设计。</description></item><item><title>Cliff: Learning Process Rewards from the First Mistake 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-cliff-first-mistake-paper-reading/</guid><description>RLVR 用最终答案的对错给整条推理链打分，粒度太粗；PRM 要训练专用奖励模型，OPD 要求师生推理同构。Amazon Web Services 联合 UIUC 的 Cliff 给出过程监督的最小充分形式：只用现成 LLM 定位每个错误 rollout 的&amp;rsquo;第一个错误步&amp;rsquo;（Pitfall Step），把轨迹切成正确前缀与错误后缀，前缀正优势、后缀负优势。12 个场景上一致超越：比 On-Policy Distillation 高约 15%、比标准 GRPO 高约 7%，且弱教师（27B）下依然有效。本精读拆解&amp;rsquo;错误前缀之后无信息&amp;rsquo;这一核心洞察、token 级优势的构造细节，以及教师定位能力与人类标注 80% 一致率的验证实验。</description></item><item><title>Post-Training Language Models for Gold-Medal Performance in Coding Competitions 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-nemotron-ioi-gold-paper-reading/</guid><description>在 IOI 2026 上，一个 AI 系统在与人类选手完全相同的比赛时间、提交限制和网络封锁下拿到 535.4/600 分，超过金牌线 174.3 分、超过人类最高分选手 37.1 分——据作者所知这是 AI 首次在 IOI 题集上超越人类冠军。NVIDIA 的这份技术报告完整拆解了达成路径：22000 道竞赛题策展、120 万条合成推理轨迹、SFT+RL 的分工实证、以及 GenCorrect 迭代修正策略。本精读重点解析该论文罕见的组件归因实验——SFT 贡献大头、RL 只打磨边界、测试时计算放大差距，以及&amp;rsquo;纯 SFT 的 Ultra 反超 SFT+RL 的 Nano&amp;rsquo;背后的并行采样机制。</description></item><item><title>S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement? 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-04-s3gym-self-improvement-paper-reading/</link><pubDate>Fri, 04 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-04-s3gym-self-improvement-paper-reading/</guid><description>Agent 每天与环境交互积累海量轨迹，但经验真的变成了能力吗？ByteDance Seed 姊篇基准 S3Gym 把&amp;rsquo;自改进&amp;rsquo;拆成自测试、自判断、自改进三个可测环节，在 7 个可执行验证的文本游戏上比较三种经验注入通路：原始历史 ICL、摘要记忆、参数训练。7 个前沿模型的核心发现：自改进既不自动也不均匀——GPT-5.5 在 PvZ 上 History ICL 的 AUC⁺ 高达 548.5，换摘要记忆暴跌到 33.2；同一模型同一环境换个通路结果天差地别。本精读拆解宽松探索/严格评测的分离设计、自评分与环境真值的对照记录，以及&amp;rsquo;经验压缩可行性决定通路优劣&amp;rsquo;的机制规律。</description></item><item><title>DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-03-diagevo-paper-reading/</link><pubDate>Thu, 03 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-03-diagevo-paper-reading/</guid><description>港中深联合美团 LongCat 团队提出 DiagEvo：自进化自博弈中 solver 常平台化甚至衰退，现有方法靠难度/多样性信号出题却不指明&amp;rsquo;该修哪个弱点&amp;rsquo;。DiagEvo 的答案是分层错误记忆——4B 诊断器分析失败轨迹、按&amp;rsquo;错误原因→主题→实体&amp;rsquo;三层组织、定向采样未解决错误因生成新题，辅以双置信度过滤与自由探索。三个 solver（Qwen3-4B/8B、OctoThinker-8B）在九个基准上全胜 R-Zero/DARC 等基线；消融显示去掉分层错误记忆数学均值掉 3.8 分（最大组件贡献）。与 HarnessEvolve 同日揭示同一趋势：显式诊断信号优于隐式统计信号。</description></item><item><title>WHALE: A Simple Recipe for Joint Harness–Weight Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-03-whale-harness-weight-optimization-paper-reading/</link><pubDate>Thu, 03 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-03-whale-harness-weight-optimization-paper-reading/</guid><description>KRAFTON 联合 KAIST/Stanford 提出 WHALE（Weight-Harness Alternating LEarning）：把 agent 性能看作模型权重 θ 与可执行 harness 代码 h 的联合函数 J(θ,h)，交替执行&amp;rsquo;当前 harness 下在线拒绝采样微调&amp;rsquo;与&amp;rsquo;更新后模型上 Meta-Harness 搜索&amp;rsquo;两阶段，用固定时长或自适应 patience 规则切换。在 Qwen3.5-2B/4B × 搜索问答/数学/国际象棋三域上，比 weight-only、harness-only 与 Fast-Slow Training 高 4.15–24.38 个百分点，且揭示 harness-limited 与 weight-limited 两种机制不同的瓶颈域。这是首个把优化空间从&amp;rsquo;权重+文本提示&amp;rsquo;扩展到&amp;rsquo;权重+完整可执行 harness&amp;rsquo;的交替优化配方。</description></item><item><title>CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-cast-critique-agents-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-cast-critique-agents-paper-reading/</guid><description>亚利桑那州立大学与思科研究的 CAST 解决长程工具调用 Agent 的可靠性死穴：在电商退款、医疗分诊这类有状态环境中，一个错误动作（退错订单）就造成不可逆失败。CAST 把稀疏任务结果转化为动作级监督——合成解释&amp;rsquo;该动作在部分可观测下为何有效/无效&amp;rsquo;的结构化批评理由训练批评模型，再用批评模型构造数据优化策略模型。微调后的 Qwen3 系小模型在 Retail 任务可靠性超 GPT-OSS-120B 逾 10 个百分点，域外 Telehealth 再 +9%。</description></item><item><title>Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-opsa-self-adaptation-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-opsa-self-adaptation-paper-reading/</guid><description>Purdue 团队对当下最火的 On-Policy Distillation（OPD）发起了一次釜底抽薪式的追问：教师监督噪声率高达 30%–50% 且随教师规模上升，学生却对噪声无感——这暗示 OPD 的增益根本不来自蒸馏。通过梯度分析定位到&amp;rsquo;低 logp token + 负优势&amp;rsquo;才是真正驱动力后，论文提出零监督的 OPSA（熵自适应负优势自改进），在 AIME24 上实现 263% 相对提升并反超标准 OPD 16.77 分。本精读覆盖其噪声测量实验、机制归因链条、OPSA 方法设计与完整实验证据。</description></item><item><title>PaperGym: Rubric-Centered Evolution for Research-Plan Generation 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-09-02-papergym-paper-reading/</link><pubDate>Wed, 02 Sep 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-09-02-papergym-paper-reading/</guid><description>浙江大学与 Apple 联合团队的 PaperGym 把&amp;rsquo;每篇论文&amp;rsquo;变成一个完整的 RL 训练环境：问题从研究目标+背景合成、评分准则（rubric）从方法+实验部分导出，从源头把准则泄漏率压到 3.7%（现有数据集为 11.9%–34.1%）。用 rubric 先当 OPSD 自教师的特权上下文、再当 GRPO 的奖励，Qwen3-8B 训练后在 ResearchQA 达 73.48 分超越更大的 Kimi K2.6。这项工作解决的是 AI 科学家落地的核心卡点——研究计划这类&amp;rsquo;没有可验证答案&amp;rsquo;的开放任务如何获得可靠的 RL 奖励。</description></item><item><title>AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-adathinking-e-paper-reading/</guid><description>美团联合上海交大、中科院自动化所提出 AdaThinking-E，用一个 token 的熵调节教会文档理解多模态大模型自主决定何时深度思考。该方法把模式切换 token 与回答 token 分开优化，前者用熵奖励驱动从高熵探索到低熵决策的课程式过渡，后者只关心答案质量，从而避免了 GRPO/DAPO 训练中模式坍缩为全不思考的通病。在 8 个文档基准上，7B 模型以 27% 的思考率追平 SOTA 自适应思考模型 82% 思考率的效果，OCR-Reasoning 相对基座提升 10.8 个百分点，实现了该想才想、不该想不想的效率与精度兼得。</description></item><item><title>ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-contextpilot-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-contextpilot-paper-reading/</guid><description>深度精读清华大学、腾讯优图实验室与上海AI Lab 合作的 ContextPilot：一个主动上下文管理框架。针对现有方法工具集贫乏（只有搜索/删除/摘要）、探索低效（上下文编辑动作影响悬殊却被均匀采样）、信用分配粗粒度（轨迹级奖励平摊给所有编辑动作）三大缺陷，它扩展出规划、长期记忆、软卸载三类工具，并用上下文变化量+熵变化识别关键编辑决策做分支采样（context-aware partial rollout），再用所有后续分支的平均回报估计动作级优势（细粒度信用分配，方差降为 1/n）。8B-RL 在四基准平均 69.40 超 StateLM-8B-RL 的 65.85；深搜任务上每轮输入 token 稳定在 8-10K（基线线性涨到 30K）；消融证明细粒度信用分配贡献最大且在全部基准一致提升。</description></item><item><title>HARTS: Efficient Agentic Reinforcement Learning for Hybrid-Attention Models over Arbitrary Rollout Trees 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-harts-agentic-rl-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-harts-agentic-rl-paper-reading/</guid><description>深度精读蚂蚁集团的 HARTS 训练系统。Agentic RL 的 rollout 呈不规则树状、轨迹共享长前缀，逐轨迹独立训练重复计算共享前缀（实测冗余约 5.63 倍）；而现有树结构训练系统只支持全注意力模型。HARTS 首次在真实混合注意力模型（MLA+KDA 的 Ling-3.0-tiny）上实现任意 rollout 树的前缀共享：联合微批规划、线性时间的最少调用执行规划、可微状态交接与语义多重性恢复 RL/MoE 目标。实测前向/反向/梯度加速 4.81–4.87 倍，logit 余弦相似度大于 0.9997，在线训练奖励趋势与基线一致。</description></item><item><title>Neuro-symbolic PRM: Enhancing Scientific Reasoning via Structured Traces and Symbolic Verification 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-ns-prm-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-ns-prm-paper-reading/</guid><description>工具增强 LLM 已经能消灭绝大多数计算与语法错误，但一个隐蔽的失败模式仍在：公式用对了变量却用错了——推理步语法完好、数学可执行、量纲一致，却完全脱离题意。本文提出 NS-PRM，把『推理正确』解耦为符号有效性 V 与语义接地性 G 两个维度：确定性符号验证器（JSON Schema 语法检查+数学等价+Pint 量纲分析，覆盖 128 个计算原语与 15 个逻辑原语）作为硬过滤器保证 V；PRM 只在验证器接受的空间上对 G 条件评分。训练侧引入反事实符号扰动 CSP，算法化生成『完美通过验证器但逻辑错误』的硬负例；推理侧采用验证器优先的约束 beam 搜索。最终 ProcessBench 平均 F1 达 74.2、PRMBench 77.3，均超 9 个 PRM 基线；同等算力下 beam 宽度近翻倍，MATH 零额外成本提升 4.5 个百分点。</description></item><item><title>Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vera-rl-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vera-rl-paper-reading/</guid><description>深度精读北邮、北大与腾讯微信AI合作的 VERA-RL。论文研究&amp;rsquo;无预设问题、无预设证据&amp;rsquo;的全文科学错误检测：构建 Reason–Verify–Scan 三阶段课程链数据集 VERA-13K（12,900 样本、6 类错误），用 DAPO 算法与三维奖励（推理完整度+证据对齐+错误精确度）训练 Qwen3-VL-8B，Scan 综合分从 2.0 升至 19.5，超过 235B-Thinking 模型；消融证明单奖励训练会让 Scan 崩溃、纯 Scan 训练反而更差，三维奖励与混合课程缺一不可。</description></item><item><title>REPLICANT: Learning Policies for Evading and Hardening Malware Detectors 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-replicant-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-replicant-paper-reading/</guid><description>伦敦国王学院、Alan Turing研究所、UCL、鲁汶大学等多机构联合提出REPLICANT，把Android恶意软件的问题空间逃逸从『逐样本优化』重构为『策略学习』：在严格label-only黑盒威胁模型下，用分层PPO学习改什么（能力选择）与何时查（查询时机），产出的策略可跨样本、跨检测器架构、跨特征空间迁移——全部1764个代理/目标组合平均ASR 78.8%，比最强基线相对提升20.9%-39.2%；策略迁移（78.8%）远超样本迁移（43.3%，相对+82%）。反哺防御侧，AT-REPLICANT靠随机策略训练全程收集多样对抗样本，使白盒REPLICANT与APG残余ASR压到17%以下，而AT-APG对REPLICANT_WB仍暴露62.4%漏洞；针对时间漂移提出的RAL把主动学习与对抗训练交织，同时保住性能（49.0）与鲁棒性（0.6%）。总计379,680次攻击评估为该领域迄今最大规模。</description></item><item><title>VICT: Verifier-Instrumented Credit Tracing for Long-Horizon LLM Agent Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vict-credit-tracing-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-vict-credit-tracing-paper-reading/</guid><description>长时程智能体 RL 的核心难题是信用分配：稀疏的终端奖励被广播给轨迹里每个动作，成败的原因被抹掉了。现有方法从 rollout 侧构造代理信号（重复状态、轨迹图、语义邻近、事后复盘、分支采样）估计动作重要性，却把判定成败的验证器当成一个标量奖励丢掉了内部结构。清华大学、西安交通大学与嘉兴南湖大学提出 VICT，把程序化验证器拆解为可执行原子，通过写入/揭示/提交/违例四类见证谓词把原子回溯到具体动作，仅沿这些证明边重分配组相对优势。ALFWorld 93.7%、WebShop 严格成功 83.6%，消融排除了稠密原子奖励、仅提交信用、时间邻近等简单解释，且可与 rollout 侧方法叠加。本文按九部分结构精读其机制与证据。</description></item><item><title>WeAgent-MMSearch: Native Text-Vision Interaction for Multimodal Search Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-weagent-mmsearch-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-weagent-mmsearch-paper-reading/</guid><description>多模态搜索智能体常被环境拖后腿：许多搜索环境只把网页转成文本喂给模型，工具返回的图片直接丢弃，号称多模态的轨迹实际退化成纯文本推理；长时程交互中的超时、超长输出、格式错误还会污染 RL 训练信号。腾讯微信 AI 与中山大学提出 WeAgent-Harness，把检索图像注册为可寻址的持久状态并跨轮回灌，配合失败感知的 FA-GSPO 训练算法与可诊断『检索失败还是感知失败』的 VisTarget-Bench，基于 30B 模型在 8 个基准上取得 55.97% 平均分，媲美约 10 倍参数量的前沿模型。本文按九部分结构精读其动机、机制、证据与可迁移灵感。</description></item><item><title>WM-R1: Training GUI Agents to Reason and Leverage World Models with Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-31-wm-r1-gui-paper-reading/</link><pubDate>Mon, 31 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-31-wm-r1-gui-paper-reading/</guid><description>用强化学习训练手机 GUI 智能体，为什么必须忍受昂贵的真实环境交互？华东师范大学提出的 WM-R1 给出了第一个完全相反的答案：把世界模型从推理时的辅助工具升级为训练环境本身。冻结的 Code2World-8B 世界模型生成全部状态转移，Agent 通过 GRPO 在纯模拟环境中学习；更关键的是 &amp;lt;call_wm&amp;gt; 机制把世界模型嵌进思维链，让 Agent 学会『提出候选动作—模拟后果—评估修正—再提交』的推理策略。AndroidWorld 上 WM-R1-7B 达到 39.8 的 SOTA（超 UI-R1 达 9 个百分点），OOD 平均提升 +16.0，训练全程零真实环境交互、单卡 11.2 小时完成。本精读拆解其训练框架、奖励设计与效果根源。</description></item><item><title>J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-29-jzero-judge-coevolution-paper-reading/</link><pubDate>Sat, 29 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-29-jzero-judge-coevolution-paper-reading/</guid><description>自进化大模型在可验证领域已有成熟方案，但在没有标准答案的开放域，学习信号只能来自打分模型，而固定的Judge只能把Solver推到自己内化偏好的上限，饱和后奖励失去区分度。J-Zero让Challenger、Solver、Judge三者零数据共同进化：出题者与解题者通过GRPO对抗博弈，Judge依靠角色不对称与子任务放大两类结构性偏好对做Bradley-Terry更新，标签由构造方式先验决定而非Judge打分，避免自我强化偏差。Qwen3-4B上可验证域提升9.47分、不可验证域提升11.23分，超越R-Zero 4.74分，并持续改进十个迭代而baseline两迭代后退化。本文按九部分结构精读其动机、机制、实验证据与可迁移灵感。</description></item><item><title>SpeechGym: An Audio-Native Gym for Training Voice Agents via Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-29-speechgym-voice-agent-rl-paper-reading/</link><pubDate>Sat, 29 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-29-speechgym-voice-agent-rl-paper-reading/</guid><description>语音 Agent 必须完全通过语音完成工具调用与多轮对话，主流范式却在文本中训练。SpeechGym 在未修改的 τ²-bench 之上构建首个音频原生、多轮工具调用、可端到端 RL 训练的语音 Agent 环境：两个 Qwen3-Omni-30B 全模态模型以原生语音直接对话，工具接口保持文本以分离感知与行为错误。诊断发现文本到语音的落差主要源于感知缺陷——槽值误听率 32%，为文本通道的 16 倍；per-turn 过程奖励把携带梯度的组比例从 16% 提至 99.6%，破解 outcome-only GRPO 的梯度饥饿。训练后零调参迁移到独立实现的 τ-Voice 基准，pass@1 从 24% 升至 53%，开源 30B 模型升至排行榜第二、超过 GPT-Realtime-2，且轮数与 token 同步下降。</description></item><item><title>Boosting LLM Exploration via Weak-Model Guidance in RLVR 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-weak-model-guidance-rlvr-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-weak-model-guidance-rlvr-paper-reading/</guid><description>RLVR 训练有个广为人知的暗面：策略熵不断下降、模型越来越自信，大 K 值的 pass@k 甚至不如训练前的 base 模型。现有解法（熵正则、梯度校准、奖励设计）都在目标模型自身内部做文章。北京大学王选所这篇论文走了一条反直觉的路：让一个 2B 小模型先生成部分推理前缀，再让目标大模型接着写完——而且小模型的前缀大多质量堪忧（多数『无实质指导』甚至『误导』），收益恰恰来自这种『不熟悉』而非『正确』。方法极简：按熵最大落差点截断前缀、以 20% 概率混合进 GRPO 训练，pass@128 即从 67.76 恢复到 70.71（接近 base 的 72.15）。同源的 Qwen 小模型前缀质量更高却毫无增益——因为分布太像自己、扰动不足。『有用的前缀不必是最正确的前缀』，这是本文最干净的洞察。</description></item><item><title>Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-rlvr-capability-fusion-paradigms-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-rlvr-capability-fusion-paradigms-paper-reading/</guid><description>用 RLVR（可验证奖励的强化学习）训练出的领域专家各有绝活：数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文，把三种把多域能力融合进单模型的范式放进同一实验框架对比：Merge（合并任务向量，零训练成本）、Mix RL（混合数据重训一遍）、MOPD（多师在线蒸馏，兼用两者）。结论出人意料地均衡：三范式平均分差不超过 1.4 分，但单个基准差距可达 8.6 分，且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移，指令跟随与 Agent 则与其它域近正交。更有意思的是，三种融合都只是『把已有的解重新加权』而非扩大解题覆盖：pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。</description></item><item><title>TTPO: Test-Time Policy Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-ttpo-test-time-policy-optimization-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-ttpo-test-time-policy-optimization-paper-reading/</guid><description>没有标签也能在测试题上直接训练模型？浙大与阿里的 TTPO 给出了一个干净的不对称方案：多数投票选出伪标签后，同意的 rollout 走蒸馏分支（OPSD 前向 KL + 降权已收敛 token），不同意的走 GRPO 惩罚分支（只罚高置信错误 token）。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的，但不同意它的 rollout 约 79% 本身也是错的，所以「惩罚不一致」不需要伪标签正确，而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD，Qwen3-1.7B 从 38.0% 提到 45.2%，4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。</description></item><item><title>Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-28-evolution-strategies-llm-reasoning-paper-reading/</link><pubDate>Fri, 28 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-28-evolution-strategies-llm-reasoning-paper-reading/</guid><description>进化策略（ES）一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低，但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象：理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K；实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型，而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍，但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。</description></item><item><title>AWM: Answerable Working Memory for Long-Document VQA Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-awm-workmemory-paper-reading/</guid><description>深度精读 AWM 论文——Oslo 大学、Stuttgart 大学、HKUST(广州)、清华与 Bosch AI 中心合作提出的工作记忆质量评估与优化框架。论文发现：即便给了金标证据页，42.5% 答对的长文档 VQA 样本留下的工作记忆依然不足以独立支撑答案——现有评测存在「记忆质量盲区」。AWM-GRPO 用四格奖励把 memory-only answerability 信号注入 GRPO，同源受控对比下比 answer-only GRPO 再涨 2.3-2.7 点。本文拆解「答案对 ≠ 记忆对」的诊断设计、四格奖励的机制推演与蒙特卡洛验证，以及中间产物监督这一通用方法论。</description></item><item><title>CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-cafe-coevolving-feedback-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-cafe-coevolving-feedback-paper-reading/</guid><description>CAFE（复旦大学 × 腾讯 LLM 部门）把纠正性反馈做成搜索智能体轨迹内可请求的干预：共享参数模型分饰 agent/critic 两角色，冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示；在线 RL 用比较反馈估计（同提示请求组 vs 跳过组的成功率差）塑造请求回报，反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用；离线 RDPO 从前缀匹配的成功/失败对学反馈生成；100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法，6 个 OOD 基准全保持，答案级幻觉率 17.6%→12.6%；单向消融证明只改 agent 或只改 critic 都会平台化，交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。</description></item><item><title>IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-iapo-influence-credit-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-iapo-influence-credit-paper-reading/</guid><description>深度精读腾讯微信团队（26 Aug 2026）论文 IAPO：多轮服务 Agent 训练中，最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图（支持使用边/失败使用边），用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势，不改奖励、采样与损失实现，在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%（+12.57pp），电信域增益最大达 +18.19pp，且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。</description></item><item><title>Joint Optimization of Tool Creation and Use for Large Language Model Agents（SMITH）精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-smith-tool-joint-opt-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-smith-tool-joint-opt-paper-reading/</guid><description>深度精读 Appier AI Research + 台湾大学（25 Aug 2026）论文 SMITH：现有工具创建系统让强模型写工具、弱模型用工具，写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用：use 任务只给 JSON schema，接口写得烂必然调用失败，形成「写即所用」闭环；三条独立奖励轴分离 schema/代码/结果失败；easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架，平均输出仅 100 token（比 CoT 少 32 倍），其工具还能让 350M 小模型追平 30B 写的工具。</description></item><item><title>Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ockhamareto-test-rl-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-ockhamareto-test-rl-paper-reading/</guid><description>深度精读 NUS+UCL+KCL+港科大广州（25 Aug 2026）论文 Ockhamareto：用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」，单次生成 2.60 个测试拿下 49.9% 突变分数，比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试，4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。</description></item><item><title>On-policy Distillation with Verifiable Reward 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-opdvr-verifiable-distill-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-opdvr-verifiable-distill-paper-reading/</guid><description>清华LeapLab提出的OPDVR用一道极简的ReLU门，把On-policy蒸馏的隐式奖励按轨迹正确性重新定号，使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量，实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8，甚至反超教师；GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起，逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。</description></item><item><title>Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-parason-trial-parallelism-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-parason-trial-parallelism-paper-reading/</guid><description>清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈：自回归解码把整条推理链串行执行，难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行（AND分支，分而治之）与Trial并行（OR分支，多路试探），并测量发现Trial并行占了可并行推理计算的多数（DeepSeek-V4在HLE上65.5%），而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构，配合PA-GRPO多目标奖励（正确性+关键路径延迟+两类并行比例）训练，经SGLang真实执行。AIME24/25等基准上平均加速约1.7×，8k token延迟预算下用25%预算匹配全额性能。</description></item><item><title>Prefix Sliding for efficient test-time scaling 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-prefix-sliding-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-prefix-sliding-paper-reading/</guid><description>斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding：推理时只保留前缀（系统指令+prompt，充当注意力锚点）+ 最近数千 token 滑动窗口，丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察，免训练即可让现有模型提速 3 倍而性能不降；配合截断反向传播，RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。</description></item><item><title>RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-repolicy-safety-rl-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-repolicy-safety-rl-paper-reading/</guid><description>RePolicy（中科大+NUS+浙大等）把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作：rollout 结构为「策略调用→内容注入→有据推理→安全判断」，冷启动 SFT 后用 GRPO 配三项可验证奖励（格式/策略命中/判断正确）加策略上下文扰动（注入诱饵策略）训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15，超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分；策略命中率从 94.4% 升至 98.5%，诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。</description></item><item><title>SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-skillforge-verifiable-skills-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-skillforge-verifiable-skills-paper-reading/</guid><description>RL 训练的 LLM Agent 大多是&amp;rsquo;健忘&amp;rsquo;的：每个 episode 从零开始，过往经验无法沉淀。阿里高德（AMAP）团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录，agent 用 &amp;lt;skill_call&amp;gt; 标签按需调用，每次调用成为轨迹中可观测、可归因的离散事件，GRPO 因此能同时优化环境动作与技能调用决策；证据驱动的技能验证（EMA 成功率+使用次数计算欠效分数）让低效技能被 reflexion 及时改写，多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL（AppWorld SGC 近 3 倍），且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。</description></item><item><title>Training Alignment Auditors via Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-rl-auditors-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-rl-auditors-paper-reading/</guid><description>深度精读 Anthropic 论文：用 RL 训练 Claude Haiku 4.5 做对齐审计员。奖励设计三轮迭代的故事极具教学价值——生产模型标量奖励被黑化（误报率 96%）、二值奖励学会对抗盘问、最终 reference pairwise 奖励 + 50% 无行为校准 rollout 让小模型匹配 Opus 4.6（48.7 vs 48.4）、误报率压在 1% 以下，并跨脚手架迁移到 AuditBench 对抗性目标（检测率 11.5%→28.1%）。</description></item><item><title>V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-v-rubrics-visual-paper-reading/</guid><description>南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL：把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目，构建 5 万例训练集，并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下，比 answer-only GRPO 再提 1.79 分，增益集中于依赖接地中间推理的基准。</description></item><item><title>Where vs What: Decomposing Structural and Content Failures in LLM Structured Outputs 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-27-scd-where-what-paper-reading/</link><pubDate>Thu, 27 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-27-scd-where-what-paper-reading/</guid><description>深度精读深圳大学 + 中科院深圳先进院论文：把 LLM 结构化输出失败分解为「值放错位置」（structural）与「值本身错误」（content）两种模式独立测量，发现跨 6 个模型一致的「结构先退化」剪刀差——前沿模型在最复杂任务上仍放错 24-35% 的值而小模型达 74%；机制消融指向语义捷径而非拓扑寻址；SA-RLVR 把结构感知奖励用于 GRPO，VPA 从 0.26 提到 0.63 而 SFT 仅 0.28。</description></item><item><title>AgentMercury: Your Agent Can Synthesize Verifiable Environments for Business Scenarios at scale 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-agentmercury-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-agentmercury-paper-reading/</guid><description>深度精读 Meridian Intelligence 与 UMass Amherst 合作的 AgentMercury 论文——从高层业务场景合成 4,783 个可执行业务环境的框架。文章拆解其世界与任务分离设计、PLANET 构造流程与确定性 SQL 验证机制，解读 Qwen3.5-4B 在 EnterpriseOps-Gym 提升 27.6%、AIME26 提升 10.1 分的域外迁移证据，以及构造轨迹微调让环境作者成功率从 3.3% 跃升至 83.3% 的闭环实验，回答一个核心问题：出题人本身能否被训练出题。</description></item><item><title>AUSO: Action-Level Unified Skill Optimization from Internalization to Utilization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-auso-skill-optimization-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-auso-skill-optimization-paper-reading/</guid><description>深度精读 AUSO 论文——中科大 × UNSW × 国科大 × 西交利物浦跨国合作提出的动作级统一技能优化框架。从技能角色随策略演化而变化的洞察出发，拆解任务级路由的噪声困境与轨迹内技能效应异质性问题，详解三阶段渐进优化（师从内化 → 结果探索 → 双上下文动作级利用）、JSD 信息增益信号与不确定性门控的设计逻辑，结合 ALFWorld / WebShop / SearchQA 三基准与五组件消融的证据链，反推出干预粒度下沉、生命周期感知训练、双上下文自对照三条通用性灵感。</description></item><item><title>Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization (ERPO) 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-erpo-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-erpo-paper-reading/</guid><description>ERPO（阿里 AMAP × 西安交大 × 京东 × 北师大 × NUS 五机构产学研）重新定位了 LLM 强化学习训练崩溃的根源：不是策略（动作）分布漂移，而是策略诱导的查询分布漂移改变了有效训练环境。它把 KL 正则化从动作侧移到输入侧，Query-KL 的梯度严格不流经响应分布，从而在不牺牲探索的前提下根治高温解码崩溃——32B 模型在 T=1.5 下 GRPO 只剩 25.2%，ERPO 保持 80.8%。</description></item><item><title>Don't Solve, Just Compare: Tiny Advisors for Runtime Intervention in LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-cota-tiny-advisor-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-cota-tiny-advisor-paper-reading/</guid><description>深度精读新加坡国立大学 COTA 论文——用一个 0.5B 的微型比较器干预 8B 到 284B 的 LLM Agent。核心思想是把干预任务从「评估动作绝对价值」降维成「判断两个动作哪个更好」：配对比较加上建设性建议，九组实验全部提升，Qwen3-8B 在 WebShop 上从 0.3960 涨到 0.5630；而绝对 Q 评分加强制执行的组合只有 2%-9%，两要素缺一不可。</description></item><item><title>EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-25-evoharness-rl-paper-reading/</link><pubDate>Tue, 25 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-25-evoharness-rl-paper-reading/</guid><description>深度精读 UIUC×Meta AI 合作论文 EvoHarness-RL（已被 LLA@COLM 2026 接收）：把长程智能体对外部 harness（记忆、工具、状态跟踪）的访问从提示词硬编码变成可学习的策略决策。通过 BPE 三态抽象（Belief/Progress/Experience）与四个元动作（track/commit/recall/note），配合教师轨迹 SFT 与代价感知 GRPO 两阶段训练，Qwen3-8B 在 ALFWorld 上从 ReAct 的 47.9% 跃升至 96.9%，逼近 Claude Opus 4.5；训练中还揭示“harness 退火”与“harness 演化”两个动力学过程。</description></item><item><title>Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-co-rl-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-co-rl-paper-reading/</guid><description>Co-RL 提出无标签多智能体强化学习框架：多个不共享参数的异构模型对同一道无标签题目各自采样回答，每个 agent 的奖励取决于其回答是否命中指定同伴的多数投票伪标签，从而把监督信号从『自己批改自己』换成『同伴互相批改』。理论证明自奖励是自我确认动态，正确率低于一半必然收敛到零；而跨智能体监督把正确收敛的吸引域扩大到两者正确率之和大于一。实验上文本七基准平均提升 3.0-8.6%，多模态四基准提升 2.3-7.2%，多个设置下甚至超过使用真值标签的 GRPO，也无需 LLM 裁判。</description></item><item><title>EnvHarness: Awakening Static Worlds for Agent Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-envharness-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-envharness-paper-reading/</guid><description>EnvHarness 把 agent harness 的思路搬到环境侧：不改一行底层代码，只在 reset/step 标准接口外包裹可插拔组件（Stage 改初始态、Contract 重写交互、Chain 串联环境），把静态人工环境改造成针对目标策略弱点的定制训练场，且 100% 继承原环境可信 verifier。配套 EnvRigger 自动化闭环从 rollout 诊断策略缺陷、写组件、用新鲜 rollout 验证。五个基准四领域全面超越原始环境与领域专用生成管线：held-out 最高提升 9.0 分、步数省 9.8%，并支撑 RL 共同进化。</description></item><item><title>Q-Learning with World Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-qwm-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-qwm-paper-reading/</guid><description>斯坦福与北大合作的 QWM 提出了一条与世界模型协作的新路线：世界模型完全不参与策略与价值函数的训练，只在测试时（在线采样与评估执行）通过树搜索帮助挑选动作。策略提议 N=8 个候选动作，世界模型为每个动作想象 K=8 个未来状态，递归展开至深度 4，节点值由 Q 函数估计器与奖励加未来值估计器等权聚合。由于训练只发生在真实转移上，模型偏差不会复合进策略；在 Robomimic 与 LIBERO 机器人操作基准上，QWM 在样本效率与最终性能上均显著超越强基线，而传统 model-based 方法几乎无法在同等预算内学出非零成功率。</description></item><item><title>SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-sapo-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-sapo-paper-reading/</guid><description>深度精读厦门大学与南洋理工大学 2026 年 8 月论文 SAPO：面向多轮 Agent 的强化学习后训练，让策略、状态价值与动作价值共享同一个自回归主干，在动作前后的两个因果边界分别读出 V 与 Q，以两个保留词元的 logit 差经裁剪映射为有界标量并从动作分布中剔除；配合单次 rollout 的轨迹级 GAE 与批归一化轮级优势，一次反向传播统一更新。在 ALFWorld 与 WebShop 上以 Qwen2.5-1.5B/7B 训练，平均超越 PPO 与 GRPO 15.1 与 12.1 个百分点，单轮迭代运行时缩短 33.2%，并彻底消除独立 critic 的显存开销。</description></item><item><title>SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-skillgate-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-skillgate-paper-reading/</guid><description>上海交通大学联合小红书提出 SkillGate，解决长程 Agent 在 episode 中途该读哪个技能文件的训练难题。论文先诊断出 outcome-only RL 失效的结构性根源——selector credit starvation：技能命名 token 仅占轨迹损失的中位 0.14%，随轨迹变长稀释约 7 倍，且近五分之二的正确选择因后续执行失败收到错误负号的信用，而该决策本身价值 +11.2 个百分点。SkillGate 将同一 GRPO 更新的 token 支持划分为构造上不相交的双 credit 通道：任务通道只把组归一结果优势广播到执行 token，整段 read call 从损失掩码删除；选择通道把单次读取且为 oracle 才计 1 的 action-local 效用做组中心化后仅落在身份 token，等权归一使选择权重与轨迹长度无关。5 个基准 385-trial 协议下，9B 模型从 SFT 的 40.8% 升至 53.2%，超同预算 outcome-only RL 6.2 个百分点，oracle 读取率 54.3% 升至 83.9%，误导暴露降约三分之二且读得更少。</description></item><item><title>SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-24-spade-paper-reading/</link><pubDate>Mon, 24 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-24-spade-paper-reading/</guid><description>SPADE 由九所高校联合提出，让单一 LLM 在自我对弈中同时扮演 Environment Designer 与 Reasoning Agent 两个角色：前者以 Python 代码生成带 reset/step 接口的完整可执行 MDP 训练环境与特权提示，后者解题学习。Designer 的奖励是提示前后的回报差（hint-based regret），能持续瞄准学习前沿，配合预训练语料接地与环境记忆防止坍缩。30B 模型在 8 个 held-out 基准平均 58.3（较 base +8.1），工具使用基准 ACEBench-Agent +13.9，验证了环境设计本身可学习这一迈向开放式自提升的关键一步。</description></item><item><title>Credit Without Ground Truth: 步级信用分配的执行回放审计 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-credit-audit-replay-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-credit-audit-replay-paper-reading/</guid><description>USC 单作者论文用「执行回放」为 LLM Agent 的步级信用信号建立因果真值：在每个决策点重采样策略自身支持的动作并前滚，度量结局分布的实际改变。审计结论是全面否定——LLM judge 分数、结果条件化 logprob 比、策略自身置信度识别因果关键步骤均不优于随机；implicit 信用实为策略流畅度的回声（秩相关 +0.75），结果条件化不增加任何因果信息（偏相关 -0.004）；七臂预注册训练实验中无一臂可靠超过未训练策略，表面差异全由训练剂量解释。本文精读其仪器设计、否定性证据链、剂量匹配协议与完整性分类学，并讨论它对整个步级信用分配赛道的冲击。</description></item><item><title>MidTool: 面向Agent工具使用的中期训练数据合成 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-midtool-midtraining-paper-reading/</guid><description>工具使用是 LLM Agent 的核心能力，但此前几乎全靠后训练习得。MidTool（华盛顿大学 + Snowflake + UNC，工作完成于 Snowflake 实习）提出首个面向通用工具使用的开放中期训练语料管线：从网页、PDF、代码、真实 API 与 MCP 技能四类源出发，经「上下文接地增广」与「原生 Agent 轨迹合成」两条分支构建 20.3B token 的 MidTool-Mix，中期训练 Qwen3-4B/8B-Base 后再统一 SFT+RL。在 BFCL、τ²-Bench、MCP Universe 三基准上，两种后训练配方下均一致超过 SFT-only 基线，RL 通常进一步放大增益，MCP-Universe 上 4B/8B 全面超过 Qwen3 官方同尺寸模型。本精读覆盖背景、定位、问题抽象、管线解法、实验证据、机制因果链、必要知识反推与可迁移灵感。</description></item><item><title>MileGPO: 里程碑推断的长程Agent过程级信用分配 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-milegpo-credit-assignment-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-milegpo-credit-assignment-paper-reading/</guid><description>北交大团队提出 MileGPO，针对长程 LLM Agent 训练中最棘手的过程级信用分配问题：GraphGPO 等图方法按最短路径距离赋信用，只能刻画「可达性」而非「可靠进展」。MileGPO 从同一 rollout 图中挖出三类被忽视的信号——成功轨迹的候选里程碑、失败轨迹的反复陷阱、同状态兄弟分支对比——经可靠性加权塑形 RCS 与进度对比校准 PCC 两级校准后注入优势估计。ALFWorld 整体成功率 94.60，超 GraphGPO 3.13 点、超 GiGPO 4.43 点；ID–OOD 差距仅 1.69 点；WebShop 同状态平局率达 72.7%，图上 83.0% 的平局可被 RCS 纠正。全程零辅助模型、零额外环境交互，本精读重点拆解「共享状态覆盖率相同、歧义结构决定增益」的机制因果链。</description></item><item><title>One Success Isn't Reliability: Thinkingbox 沙盒与基准 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-23-thinkingbox-paper-reading/</link><pubDate>Sun, 23 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-23-thinkingbox-paper-reading/</guid><description>微软联合匹兹堡大学、西北大学、UC Irvine 发布 THINKINGBOX 沙盒与 THINKINGBOX-BENCH 基准：507 个政策条件化的有状态业务工作流，覆盖零售、酒店、车险、新银行 IT 与咨询 IT/HR 五域，用隔离的 MCP 工具会话、模拟用户与终端后端状态检查评测 Agent。最强模型 GPT-5.4 pass@1 仅 65.36%，pass@20 高达 91.12% 但 20 次全过的 pass^20 仅 25.25%，暴露「偶尔成功」与「可靠完成」之间的巨大鸿沟；79,853 次失败试验中 80.88% 干净终止且含写操作，证明响应级/调用级信号无法代理端到端完成。本精读覆盖其 POMDP 形式化、评测协议、失败归因与可靠性根源分析。</description></item><item><title>Phantom Gains: Auditing Self-Improvement Against a Measured Null 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-phantom-gains-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-phantom-gains-paper-reading/</guid><description>深度精读 Phantom Gains——一篇审计 LLM 自训练&amp;rsquo;自我改进&amp;rsquo;证据的测量学论文。当社区从平均准确率转向逐题增益/损失转移分析时，转移统计本质上是两个噪声估计的差分，极易产生&amp;rsquo;幻影增益&amp;rsquo;。作者让一个冻结控制模型穿过与三轮 LoRA 自训练完全相同的流水线，识别出七类测量失效——每一类在缺少控制时都会反转结论：单次贪心解码的批处理伪影在未训练模型上制造能力变化、expansion 统计给冻结模型分配 0.28 的假获取率、阈值修复后的 null 依然非零。替代方案（逐问题精确检验 + 合并基线池 + FDR 控制）在任何 held-out 副本上检测不到任何真实转移。梯队实验进一步揭示：外部蒸馏能改善 base 模型未触及的问题而三种自训练不能，回归分析以 p&amp;lt;10⁻⁸ 拒绝该不对称性是总体增益差异的副产物。本文为转移级审计立下规矩：每个报告的统计量都需要单独测量的 null。</description></item><item><title>Thinking in a Low-Resource Language: What SFT Builds, What RL Fixes, What Accuracy Cannot See 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-22-low-resource-thinking-paper-reading/</link><pubDate>Sat, 22 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-22-low-resource-thinking-paper-reading/</guid><description>当低资源语言推理微调只被一个准确率数字评判时，我们到底在测什么？Sophea AI 在三家 MoE、四个模型上用 11.8 万行希腊语语料做 SFT 与 RLVR 实验，发现最佳微调 arm 76.5 分竟低于基线 77.2 分，而随机种子的噪声地板高达 7.7 分——翻译基准准确率被训练噪声主导，几乎不携带信息。改用六维行为度量后结论完全翻转：SFT 让 98% 推理轨迹切换为问题语言、token 省 3 倍；RLVR 把格式违规从 24% 修到 2.5%、答案泄漏清零，且希腊语思考习惯 98.2% 保真。一篇把 null 结果写成方法学的罕见论文。</description></item><item><title>Agent Lightning v1.0: Towards Harnessed Agentic RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agent-lightning-v1-harnessed-rl-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agent-lightning-v1-harnessed-rl-paper-reading/</guid><description>微软亚洲研究院联合复旦、浙大、爱丁堡大学发布Agent Lightning v1.0，首次系统定义harnessed agentic RL范式——当部署级agent harness直接参与RL训练时，训练引擎只能看到一串LLM请求-响应对。论文刻画了重分词破坏token前缀连续性、动态样本数下的优势计算、损失归一化与后端调度四大挑战，以约3500行代码给出参考实现，仅用6K训练样本让Qwen3.5-9B在SWE-bench Verified上从41.8%提升到56.4%（+14.6个百分点），并公开完整数据清洗管线与防reward hacking脚手架。</description></item><item><title>Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Memory Requirements 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agentic-esopt-evolution-strategies-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-agentic-esopt-evolution-strategies-paper-reading/</guid><description>新加坡国立大学、南方科技大学与牛津大学团队论证：在长程agent微调场景中，进化策略（ES）不只是更便宜的RL替代品，而是结构性更优的选择。Agentic ESOpt以参数空间扰动+奖励加权更新实现免反传全参优化，GPU显存与推理持平（8.41GB，比GRPO低85.7%），在可控Sudoku实验中呈现horizon-dependent crossover——H*=15时超最强GRPO 12.5个百分点；WebArena-Lite上完成27B模型全参适配（29.47%→36.16%），并支持prompt-参数协同进化。</description></item><item><title>Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-co-rl-unsupervised-reasoning-cohort-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-co-rl-unsupervised-reasoning-cohort-paper-reading/</guid><description>当推理能力超越人类可靠评估的范围，真值标签反而成为最稀缺的资源。Co-RL 给出的答案是：让多个不共享参数、来自不同家族的模型组成『学习共同体』，彼此用多数票伪标签互为奖励源。理论上，论文证明自奖励 RL 受 sign(p-1/2) 自确认动力学支配——错误会被系统性自我强化；而交叉监督把正确收敛盆从『每题各自 p&amp;gt;1/2』扩大到『pA+pB&amp;gt;1』，互补性可以直接兑换正确性。实验上，4 款 LLM 在 7 个纯文本基准平均提升 3.0–8.6%，5 款 VLM 在 4 个多模态基准平均提升 2.3–7.2%，Gemma-3-12B 甚至反超有真值监督的 GT-Reward。</description></item><item><title>LEGO-RL: Harness-Native Reinforcement Learning for Coding Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-lego-rl-harness-native-coding-rl-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-lego-rl-harness-native-coding-rl-paper-reading/</guid><description>华为LegoX团队联合港中文发布LEGO-RL——在不修改原生编码agent harness内部控制流的前提下接入可扩展策略梯度训练。三大支柱：进程内LLM代理捕获原始生成流实现token级对齐与训练端logprob重算（即使harness压缩/重序列化上下文）、Nydus镜像缓存+分级防御抑制reward hacking、插件化校验监控+Live UI轨迹诊断。训练Qwen3.5-35B-A3B（GSPO）在三大harness上全面提升：OpenHands SDK 64.0%→70.4%、Claude Code 62.4%→68.2%、OpenCode 57.2%→66.6%，rollout-训练概率相关性保持0.99以上。</description></item><item><title>PlanPO: Group Planning-Aware Policy Optimization for Multi-Turn Agentic LLMs 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-planpo-planning-aware-policy-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-planpo-planning-aware-policy-paper-reading/</guid><description>厦门大学联合上海交大、南洋理工提出PlanPO——解决组相对优化中的优势坍缩（advantage collapse）问题：成功轨迹获得相同结果奖励，迂回成功与高效成功优势无差，组内梯度信号消失。PlanPO在组相对结构内引入粗到细优势信号——轨迹级长度差异+成功条件下的轮级响应长度差异，无需价值模型与人工启发式，在ALFWorld、WebShop、SciWorld三个多轮基准上平均超GRPO 27.2%，额外训练开销可忽略。</description></item><item><title>SkillGate: Training In-Policy Skill Selection in Long-Horizon Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-skillgate-in-policy-skill-selection-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-skillgate-in-policy-skill-selection-paper-reading/</guid><description>上海交通大学与小红书合作的论文诊断了agent技能选择失败的结构性根因——selector credit starvation：在广播式序列级优势下，命名技能的少数token在损失中份额趋零、继承的信用随轨迹变长而日益错号（选择正确但执行失败时正确选择被惩罚）。SkillGate把token支持划分为两个不相交信用通道：结果信用只达执行token、动作局部优势只达技能命名token（仅当轨迹唯一一次读取是oracle时为正）。5个agent基准、16候选技能档位下，9B策略试验成功率从40.8%提升到53.2%，超同预算outcome-only RL受控对照，误导技能暴露减少三分之二，读取技能更少。</description></item><item><title>SPADE: Self-Play in Adaptive Synthetic Executable Environments 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-spade-self-play-adaptive-envs-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-spade-self-play-adaptive-envs-paper-reading/</guid><description>当高质量人类文本接近耗尽，LLM 训练的瓶颈正转移到『训练环境的供给』上。SPADE 让一个 LLM 同时扮演环境设计者与推理智能体两个角色：设计者把完整的长程可执行环境写成带 reset()/step() 接口的 Python MDP 代码，并用『有提示与无提示奖励差』这一 hint-based regret 信号被 RL 训练，从而持续瞄准学习者能力边界出题。在 30B 规模上，SPADE 在八个 held-out 基准上平均超过最强固定环境基线 +5.3，工具使用场景 BFCL v4 多轮 +5.7、ACEBench-Agent +13.9。这篇精读拆解它的双角色自博弈机制、regret 信号设计、语料接地与环境记忆两大组件，以及为什么『把环境设计变成可学习组件』可能改写 agentic RL 的 scaling 逻辑。</description></item><item><title>Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-wuying-browser-agent-long-horizon-paper-reading/</guid><description>阿里云端云智能计算团队发布Wuying-Browser-Agent——开源长程浏览器agent新SOTA（WebVoyager 80.6%、Online-Mind2Web 66.7%、自建BrowserBench 65.1%）。核心论点是&amp;rsquo;对齐每一层&amp;rsquo;而非单点规模：结构化浏览器harness提供稳定执行原语、RUIC-SFT显式训练错误恢复轨迹（仅用成功数据的SFT只能恢复8.5%的错误步骤）、DAO-GRPO用势函数奖励塑形+发散感知步加权解决长程功劳分配，并发布双语真实网页基准BrowserBench（350任务均37.9步）。</description></item><item><title>Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-20-zetta-closed-loop-embodied-harness-paper-reading/</link><pubDate>Thu, 20 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-20-zetta-closed-loop-embodied-harness-paper-reading/</guid><description>清华大学 AIR 团队提出 Zetta，一个能在部署时自我进化的闭环具身智能框架：冻结 VLA 基座策略不动，用可在线进化的代码级 Runtime Critic 在动作频率上监控物理执行，配合三时间尺度进化循环（动作级治理、批次级失败诊断修复、验证门控技能晋升）与专用推理基建 Z-Infra，在 LIBERO-Pro 上把宏平均成功率从 32.0% 提升到 71.1%，在 RoboCasa 18 任务上从 73.56% 提升到 93.56%，推理延迟较 RPent 降低 91%，并涌现出 15%→95% 式的机器人 Aha 时刻与零样本技能迁移能力。</description></item><item><title>ClawGym II: Exploring Black-Box RL on Agent Harness 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-clawgym2-blackbox-rl-harness-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-clawgym2-blackbox-rl-harness-paper-reading/</guid><description>人大高瓴AI学院与IQuest Research联合提出首个面向复杂agent harness的黑盒RL统一框架：用临时沙盒把任务环境与harness整体隔离包装（对训练侧完全黑盒），以忠实轨迹恢复机制从沙盒遥测中重建树状执行轨迹并回传环境奖励，使PPO/GRPO能稳定优化“harness+模型”整体。在OpenClaw与Claude Code两种结构迥异的harness上验证：30A3B骨干较初始策略分别+9.98/+14.81分，超SFT基线5.80分，PinchBench外部迁移87.32；训练在200-400步内保持稳定，且首创混合harness联合训练——单一模型在两种harness上持平甚至超过各自单独训练版。配套发布ClawGym-Bench（六域）与PinchBench双评测体系。</description></item><item><title>JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-jailbreakskill-redteam-skills-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-jailbreakskill-redteam-skills-paper-reading/</guid><description>上海AI Lab联合上交大、西工大、复旦、浙大提出JailbreakSkill——技能中心的自动化红队框架：把攻击策略沉淀为结构化技能资产（SKILL.md+脚本+引用三件套），两阶段循环中Stage 1用风险条件化UCB规划器在16个初始技能中路由排序（每次攻击选性价比最高的技能先试），Stage 2以失败记忆驱动技能进化（精修/组合/发现新技能，准入标准为救回至少一个未解行为）。在AdvBench/HarmBench上macro-ASR@10达72.0%/68.1%（16个模型-基准设置的13个第一），平均查询成本AQC 4.14/4.63为全场最低；随机路由消融使ASR掉8.1pp验证风险条件化排序的价值。攻击能力随使用单调增长——红队从一次性脚本进化为可复利资产。</description></item><item><title>SA-MRPO: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-19-sa-mrpo-saturation-advantage-paper-reading/</link><pubDate>Wed, 19 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-19-sa-mrpo-saturation-advantage-paper-reading/</guid><description>UCSD联合五机构提出SA-MRPO——多奖励RL后训练的饱和感知优势重加权：针对固定标量化+组标准化的两大缺陷（奖励轮廓不同的rollout获得相同优势；已饱和目标仍按固定权重占用梯度预算），按每个奖励维度的实时饱和度自适应重加权，使梯度流向“还有提升空间的未竟目标”。Qwen2.5-7B三目标设置下15项基准对比12项超GDPO（AIME24 +5.0pp、MATH500 +3.5pp）；自适应推理设置平均准确率+3.8且响应更短；代码基准Codeforces从10.6%升至12.9%。机制本质：把优化预算从“维持已会技能”重新分配到“攻克未会技能”。</description></item><item><title>Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-17-crest-credit-assignment-paper-reading/</link><pubDate>Mon, 17 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-17-crest-credit-assignment-paper-reading/</guid><description>深度精读 2026 年 8 月 arXiv 论文 CREST：面向多轮多步工具调用 Agent 的层级化功劳分配框架。它把每 token 优势分解为「轮级 verifier 优势 × token 级教师调制幅值」，让自教师只调幅值、不碰方向，从而保住 RL 的 verifier 上界。BFCL V3 上 Qwen3-4B 达 52.00%（较基座 +29.88），13/14 项最佳，长上下文与 Session 级指标增益最大。</description></item><item><title>DarwinX: Evolving Agent Harnesses Through Natural Selection 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-15-darwinx-harness-evolution-paper-reading/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-15-darwinx-harness-evolution-paper-reading/</guid><description>LLM Agent 的能力不只取决于模型权重，还取决于包裹模型的 Harness（提示词、工具、技能、控制流）。Salesforce AI Research 的 DarwinX 在完全冻结模型权重的前提下，把 Agent 自进化重构为对 Harness 种群的“自然选择”：preserve-and-extend 契约只接纳“净增益为正且回退有界”的变体，树状 archive 保留多条谱系供跨谱系重组，失败/教师/自采三种证据共用同一编辑接口，适应度完全来自 benchmark 自带 verifier。四个基准平均提升约 17 分：Terminal-Bench 2.1 达 83.2%，WebArena-Infinity 从 43.5% 跃升至 93.0%，且零适应迁移到 SWE-bench Verified 达 84.2%。本精读逐部分拆解其机制，并建立“方法差异→机制变化→指标提升”的因果链。</description></item><item><title>SKILLER: Language-Level Reinforcement Learning for Reusable Skill Extraction in Small Language Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-15-skiller-language-rl-paper-reading/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-15-skiller-language-rl-paper-reading/</guid><description>SKILLER 提出语言级强化学习框架：用强模型（GPT-5.4）兼任 actor 与 critic，把小模型智能体系统当作环境，官方验证器提供标量奖励与文本诊断，全部 RL 信号经由自然语言传播，优化变量是技能文本本身而非模型权重。在五个基准上，9B/4B 小模型配 SKILLER 技能全面超越闭源 Manus 与开源技能生成方法，SWE-Skills-Bench 上超人类技能 30.8 分，且零样本迁移到 GAIA/EarthBench 仍保持领先。本精读覆盖其背景脉络、语言级 RL 形式化、actor-critic 机制、消融因果链与可推广灵感。</description></item><item><title>Thought-Level Beam Search for Reasoning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-15-thought-beam-search-paper-reading/</link><pubDate>Sat, 15 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-15-thought-beam-search-paper-reading/</guid><description>测试时算力扩展是大推理模型性能的主引擎，但并行采样极度浪费、减法剪枝又让GPU挨饿，核心问题已从“花多少算力”变成“把算力花在哪”。本文提出思维级束搜索 Gambit：用轻量评分器探测步骤边界隐状态，周期性剪除劣迹并立即从高分前缀分支，以零和交换维持固定容量活跃池，同时保持硬件满载。在 5 个基准 × 3 个模型上严格支配 SC、Slim-SC、DeepConf、STEP 四大基线：HMMT-24 最高 +6.7%，token 消耗较并行采样最高降 68.5%，吞吐超 2 倍，管理开销仅 0.97%。本精读覆盖其问题形式化、方法细节、实验证据与因果链根源分析。</description></item><item><title>DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-didpo-coding-credit-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-didpo-coding-credit-paper-reading/</guid><description>编码智能体在 RLVR 训练中长期受困于「信用分配粒度不足」——一个动作里同时打包了对代码不同区域的多种修改，谁贡献了通过、谁制造了失败，传统方法无法区分。DiDPO 从代码 diff 的结构出发，用「可分组性分数」动态选择锚点，把完整 diff 切成可比较的子 diff 组，把 episode 级优势投影到 token 级信号。Qwen2.5-7B-Coder 上超越可比方法超 10%，并附带开源 verl-code 代码库。本精读按九部分结构拆解：从背景、定位、问题抽象、解法、实验证据到优势根源的因果链，再到必要知识反推与通用性灵感。</description></item><item><title>RoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility States 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-romerl-reduced-order-memory-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-romerl-reduced-order-memory-paper-reading/</guid><description>深度精读 RoMeRL 论文——首次将自进化 Agent 记忆中的&amp;rsquo;反馈稀疏&amp;rsquo;与&amp;rsquo;记忆-奖励陷阱&amp;rsquo;两大耦合难题统一刻画，并用&amp;rsquo;降阶效用状态&amp;rsquo;把不断增长的轨迹索引效用空间压缩到固定维度的语义坐标上。理论证明降阶参数化提升每个效用坐标的平均反馈量，并刻画错误坐标的稳态占用；ALFWorld 和 LifelongAgentBench 上 Cold-Q 比例降低 80.0%、反馈密度提升约 6.0 倍、维护记忆大小减少 84.4%、LLM 调用减少 21.1%。本精读覆盖问题根源、因子化机制、反馈聚集原理、实验设计与通用性灵感。</description></item><item><title>SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-11-sft-rl-multitask-paper-reading/</link><pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-11-sft-rl-multitask-paper-reading/</guid><description>当大语言模型需要同时掌握数学、代码、科学、逻辑多种推理能力时，SFT（监督微调）和 RL（强化学习）会表现出截然相反的行为：SFT 在多阶段训练中因梯度方向冲突而性能崩溃，RL 却因为「优势归一化 + on-policy 采样」产生的近似正交更新而稳定共存。本文通过参数级几何分析和高维浓度不等式，首次从理论上揭示了「SFT 干扰是范数受限的、RL 干扰是方差受限的」这一本质差异，并提出 Parallel-RL 范式——各任务独立 RL 后合并参数，在 DeepSeek-R1-Distill-Qwen-1.5B 上实现 ΔBase +10.7%、Retention 103.2%。本精读将从零讲清 SFT/RL/GRPO 的机制差异，建立「方法差异→参数更新几何→理论边界→指标提升」的完整因果链。</description></item><item><title>AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-agentopsd-paper-reading/</guid><description>AgentOPSD 把 Agent 强化学习中长期被回避的&amp;rsquo;信用分配&amp;rsquo;难题重新拉回中心：在多轮交互、稀疏奖励的 Agent 任务里，GRPO 这类方法只能把最终成败均摊到每个动作上，导致长程任务里错误信号被稀释、优化方向被噪声淹没。本文提出一种无 critic 的递归自蒸馏方法——把教师（注入了成功技能 c+）与学生之间的 token 级对数概率差聚合为 turn 级证据，再在 log-odds 空间用类似贝叶斯更新的方式递归地累积成 turn 级信念 B_k，最后用 sigmoid 导数加权成有界优势重塑信号 Ã_k。这一过程把&amp;rsquo;稀疏结果监督&amp;rsquo;转化为&amp;rsquo;每一步的密集信用&amp;rsquo;，在 ALFWorld 上把 Qwen2.5-7B 从 81.2% 抬到 89.1%（+7.9pp），长程任务每轮交互衰减仅 0.54 点（GRPO 衰减 2.91 点）。消融实验进一步证明：先验锚定贡献 -10.2pp 是最关键设计，贝叶斯方向（符号保持）次之 -8.6pp。</description></item><item><title>EnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-envace-paper-reading/</guid><description>蚂蚁集团与上海交通大学联合提出 EnvACE，让一个策略同时扮演「行动者」和「环境」两个角色：Acting 角色生成工具调用，Rehearsal 角色生成对应的环境响应，两个角色共享参数端到端联合优化。训练时完全不需要外部环境交互，却能在 BFCL-v4、τ²-Bench、VitaBench 三个 Agent 基准上全面超越依赖真实环境的 baseline，综合得分 32.91% 超过 14B 参数的 AWM。更精彩的是，模型内化出的「世界模型」还能在推理时用于 Test-Time Scaling，在提交执行前先在内部排练验证，把 Overall 推到 40.9%。本文从机制层面解释「世界排练为何比真实环境更高效」，并提炼出三条可迁移到其他领域的通用灵感。</description></item><item><title>OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-osreward-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-osreward-paper-reading/</guid><description>深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent（CUA）轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准，揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」，并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感，九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。</description></item><item><title>When Self-Evolution Backfires: Pre-Commit Gating against Skill Contamination in LLM Agents 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-08-vag-skill-contamination-paper-reading/</link><pubDate>Sat, 08 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-08-vag-skill-contamination-paper-reading/</guid><description>深度精读浙江大学 VaG（Verifier-as-Gatekeeper）论文——首个正面刻画「自进化 Agent 中能力-污染相变」现象的工作。论文首次形式化了「技能池超过临界规模后新增技能反而降低性能」的非单调相变，并从数学上证明污染链具有结构不可逆性：有缺陷技能进入决策上下文后，其后代继承缺陷推理却从不引用原始缺陷源，导致事后回滚恢复率仅17%。VaG 采用「渐进信任层次 + 异构验证器检查不相交属性」的三级前commit门控（SchemaCritic 结构检查 / ExecCritic held-out重放 / AgentCritic 语义审查），配合边际增益贪心子集选择移除组合污染，在 Terminal-Bench 2 上以仅37个技能达到72% pass@1（Ungated崩溃至50%），技能池缩小近5倍，并在跨模型、跨基准迁移上全面领先。本文从背景、关联工作、问题抽象、三级门控解法、实验证据到不可逆性根源解释，完整拆解这一「前commit优于事后修复」的开创性研究，并提炼出可推广的系统安全设计灵感。</description></item><item><title>ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-abseeker-paper-reading/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-abseeker-paper-reading/</guid><description>上海交通大学提出ABSeeker，通过答案回溯线索恢复（ABCR）和线索锚定步级评分（CASS），将搜索Agent训练中稀疏的轨迹级结果监督转化为密集步级奖励。基于Qwen3.5-4B仅用8.5k样本，ABSeeker在BrowseComp上达55.3%，匹配约30B级Agent性能。本文深入解析答案回溯信用分配的机制设计、实验证据与优势根源。</description></item><item><title>WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-worldcycle-paper-reading/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-worldcycle-paper-reading/</guid><description>腾讯提出WorldCycle，利用可逆动作循环的物理对称性作为免标注自验证RL信号。通过空间闭合奖励和时间一致性奖励，将视频世界模型的状态返回漂移降低44%，复合动作准确率提升近4倍。核心突破在于：不需要任何ground-truth未来状态，物理可逆性本身就是密集监督信号。</description></item><item><title>特修斯之船：Kimi K3如何把Transformer的零件全部换掉，还能逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</guid><description>月之暗面K3是首个达到3T级别的开放权重模型，其47页技术报告揭示了一种&amp;quot;特修斯之船&amp;quot;式的架构哲学：注意力改成了线性+全局混合（KDA+MLA），残差变成了深度方向的Attention，FFN变成压缩空间的稀疏专家，甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3：线性注意力在2.8T规模上实现了6.3倍解码加速，Quantile Balancing路由是3T稳定训练的关键之一，MOPD让九个领域专家模型高效合板，而KDA（Kernel Development Agent）证明RSI已在kernel优化领域高速运转。核心判断：权重只是一次训练的产物，环境才是能反复产出下一代权重的护城河。</description></item><item><title>From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-spyrl-rlsvr-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-spyrl-rlsvr-paper-reading/</guid><description>RLVR（带可验证奖励的强化学习）让 LLM 在数学、代码等可确定性判对的领域突飞猛进，却长期被「开放式任务没有标准答案」挡在门外。本文精读 COLM 2026 论文 RLSVR/SpyRL：借鉴自监督学习「构造前置任务」的思路，把摘要、创意写作这类开放任务变换成一个「谁是卧底」的多智能体博弈——因为卧底身份是预设的，投票结果天然可验证，从而第一次让开放域 LLM 自我改进脱离了外部评判器。实验在摘要、写作、数学三大领域全面超越 R-Zero、Absolute Zero，甚至击败 GPT-4o 作评判的 Rubric-as-Reward 方案，且成本为 0。</description></item><item><title>Infra 的浪漫与 AI 平权：盛颖从 SGLang 到 RadixArk</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-shengying-sglang-radixark-infra-romance/</guid><description>SGLang 发起人、前 xAI 推理负责人盛颖在 101 视频播客中讲述了从斯坦福形式化验证到 xAI 推理系统、再到创立 RadixArk（1 亿美元种子轮）的完整路径。她提出 Infra 不应是 support 角色，而应成为产品本身；RadixArk 的使命不止于推理引擎，而是让所有人拥有制造 AI 的能力。文章梳理了推理引擎的竞争格局、开源社区的商业化困境，以及一位女性研究者在技术圈中的真实体验。</description></item><item><title>N₀-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-n0-vtla-tactile-model-paper-reading/</guid><description>N₀-VTLA由NeoteAI Team与复旦TEAI Team联合提出，是首个在大规模触觉数据上预训练的视觉-触觉-语言-动作（VTLA）基础模型。方法核心是三步训练配方：（1）在自建NeoData大规模视-触数据集上做视觉-触觉预训练学习广泛的接触先验；（2）分阶段触觉通路集成，用一个预测性触觉通路将大规模接触先验蒸馏为下游任务所需的精细运动调整；（3）ALTER——一种优势条件离线RL方法，将相对进展与轨迹事件比较转化为二元优势标签用于策略训练。N₀-VTLA赢得全部9个NeoReal真机任务，在20任务仿真套件上平均成功率63.8%（最强baseline π0.5为44.0%），ALTER训练策略在3个长程真机任务上达到75-95%成功率。</description></item><item><title>ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-03-odeworld-continuous-world-model-paper-reading/</link><pubDate>Mon, 03 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-03-odeworld-continuous-world-model-paper-reading/</guid><description>深度精读 arXiv:2607.27924——首个用物理时间 ODE 取代离散下一步预测的连续时间潜在世界模型。PT-Flow 把&amp;rsquo;未来预测&amp;rsquo;重新定义为&amp;rsquo;在紧凑潜在空间里对一个连续速度场做积分&amp;rsquo;，靠动力学解耦 + 直接一阶 JVP 监督，一举绕开 JEPA 长期头疼的表示坍缩难题；还能做离散模型做不到的任意时刻查询和后向预测。在 LIBERO 视频生成上 PSNR 比离散 baseline 高 3 分以上，64 帧长程预测延迟仅 0.072 秒，并在 LIBERO-LONG 和真实双臂 AgileX 机器人上把策略成功率推到 SOTA。</description></item><item><title>GPU其实很闲：AI Infra四层架构与榨干硅极限的效率革命</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</link><pubDate>Fri, 31 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-31-ai-infra-gpu-utilization/</guid><description>当AI行业的重心从训练转向推理，一个被忽视的事实浮出水面：GPU大多数时间其实很&amp;quot;闲&amp;quot;。Azure推理负载高达65%的能耗消耗在空转等待上，OpenAI的Chat类请求也达到52%。本文基于硅谷101播客，系统梳理AI Infra四层架构，拆解SGLang/vLLM等开源推理引擎如何通过KV Cache复用、连续批处理、PD分离、投机采样、强化学习训练框架MegaScale等技术，把GPU利用率从50%推向90%+——软件层的每一次优化都变成直接的商业问题。</description></item><item><title>2026-06 arXiv 智能体/工具智能体领域综述：916 篇分主题精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-17-tool-agent-survey-2026-06/</link><pubDate>Fri, 17 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-17-tool-agent-survey-2026-06/</guid><description>工具智能体领域综述。LLM_Agents 桶 1001 篇扣除记忆子领域后按 13 主题分桶精读，提炼工具量质失衡、agent RL 信用分配、长程可靠性与上下文管理、过程级评测、工具环境不可靠、多智能体幻觉优势、治理权限可审计性等 7 大共识问题，并识别 strained coherence、agentic abstention、world-model collapse 等原创问题。</description></item><item><title>ACL 2026 主会长文研究方向调研：2222 篇论文全量分类与新增领域分析</title><link>https://inkeast.github.io/MessageDaily/posts/2026-07-03-acl2026-accept-papers-survey/</link><pubDate>Fri, 03 Jul 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-07-03-acl2026-accept-papers-survey/</guid><description>基于 ACL Anthology 官方元数据，对 ACL 2026 主会长文 2222 篇全量分类研究方向并对比 ACL 2025（1602 篇）。核心结论：智能体（+6.8pp）与推理（+6.5pp）两大方向最快崛起，LLM 基础研究份额被稀释而非衰退；以 GRPO/RLVR 为代表的「可验证奖励强化学习训练推理模型」成为贯穿推理与智能体的新主线。</description></item><item><title>Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning 精读</title><link>https://inkeast.github.io/MessageDaily/posts/2026-05-27-router-r1-paper-reading/</link><pubDate>Wed, 27 May 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-05-27-router-r1-paper-reading/</guid><description>深度精读 UIUC NeurIPS 2025 论文——首次将 LLM 模型路由从单轮一对一映射升级为多轮序贯决策过程。Router-R1 将路由器本身实例化为 LLM，通过强化学习训练其交替执行&amp;rsquo;思考&amp;rsquo;和&amp;rsquo;路由&amp;rsquo;动作，动态整合多个 LLM 的互补优势。在 7 个 QA 基准上平均 EM 达到 0.416，超越 RouteLLM、GraphRouter、FrugalGPT 等 14 种基线方法，同时通过成本奖励实现性能-成本 Pareto 优化。</description></item></channel></rss>