Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms 精读

用 RLVR(可验证奖励的强化学习)训练出的领域专家各有绝活:数学专家、代码专家、指令跟随专家……但实际部署总不能带上五个模型。这篇复旦大学与腾讯 LLM 部门合作的论文,把三种把多域能力融合进单模型的范式放进同一实验框架对比:Merge(合并任务向量,零训练成本)、Mix RL(混合数据重训一遍)、MOPD(多师在线蒸馏,兼用两者)。结论出人意料地均衡:三范式平均分差不超过 1.4 分,但单个基准差距可达 8.6 分,且域级得失完全由「域之间的关系」决定——数学/科学/代码的任务向量方向相近、互相正迁移,指令跟随与 Agent 则与其它域近正交。更有意思的是,三种融合都只是『把已有的解重新加权』而非扩大解题覆盖:pass@32 时三者与 base 模型已不可区分。本文精读其实验设计、任务向量几何分析与范式选择指南。

August 28, 2026 · 3 min

TTPO: Test-Time Policy Optimization 精读

没有标签也能在测试题上直接训练模型?浙大与阿里的 TTPO 给出了一个干净的不对称方案:多数投票选出伪标签后,同意的 rollout 走蒸馏分支(OPSD 前向 KL + 降权已收敛 token),不同意的走 GRPO 惩罚分支(只罚高置信错误 token)。核心洞察是一个反直觉的数据事实——竞赛题上伪标签约 85% 是错的,但不同意它的 rollout 约 79% 本身也是错的,所以「惩罚不一致」不需要伪标签正确,而蒸馏会逐 token 放大标签错误。无标签 TTPO 在五个竞赛级基准上追平甚至超过用真标签的 OPSD,Qwen3-1.7B 从 38.0% 提到 45.2%,4B 版本达到 8B base 水平。本文精读其不对称目标设计与自进化机制。

August 28, 2026 · 1 min

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO 精读

进化策略(ES)一直被视为 GRPO 的『省显存平替』——不用反向传播、显存开销低,但性能似乎差一截。这篇来自南方科技大学、华为诺亚方舟实验室等机构的论文系统性地推翻了这个刻板印象:理论上证明 ES 种群内 verifier 投影的 Jensen–Shannon 多样性直接利好 Pass@K;实证上发现 GRPO 在 18 组对比中 15 组 Pass@16/32 低于 base 模型,而 ES 全面高于 base。更有趣的是 ES→GRPO 顺序训练同时拿下最高 Pass@1 与最高 Pass@32。论文还发现 ES 参数漂移是 GRPO 的 40 多倍,但抹掉 93% 的小幅更新后性能几乎不变——大漂移不等于灾难性遗忘。本文精读其理论框架、实验证据与 ES 作为独立后训练范式的定位。

August 28, 2026 · 3 min

Answer Is Cheap, Show Me the Evidence! Augmenting Automated Vulnerability Assessment with Evidence 精读

深度精读 ISSTA 2026 的 EAVA 论文——浙江大学与华为(加拿大)合作提出的自动化软件漏洞评估框架。针对现有方法「只给答案不给证据、无法处理截图与长代码、忽略项目上下文」三大缺陷,EAVA 用三个专用 LLM Agent 预处理富文本、用「开卷反推」构造 51,568 个推理轨迹标注(专家抽检 97.8% 合格)、SFT+GRPO 两阶段训练专用 8B 评估模型。在新收集的 6,446 份漏洞报告数据集上,平均 F1 0.874 / MCC 0.646,比最强基线 proEVA 高 5.3%/18.7%;用户研究中 96.8% 的证据被安全专家评为有用。本文拆解「开卷标注→闭卷推理」这一数据构造范式的完整机制。

August 27, 2026 · 5 min

CAFE: Self-Improving Search Agents Need Co-Evolving Feedback 精读

CAFE(复旦大学 × 腾讯 LLM 部门)把纠正性反馈做成搜索智能体轨迹内可请求的干预:共享参数模型分饰 agent/critic 两角色,冷启动 SFT 用『保留自身错误前缀+教师插入反馈+成功续跑』的恢复演示;在线 RL 用比较反馈估计(同提示请求组 vs 跳过组的成功率差)塑造请求回报,反馈感知优势塑形按请求边界分离『跑偏前缀』与『修复续段』的信用;离线 RDPO 从前缀匹配的成功/失败对学反馈生成;100 步在线×1 次 RDPO 交替 5 轮。7 个 SearchQA 基准上 Qwen2.5-7B 平均 EM 52.5/F1 60.7 为最强 RL 搜索方法,6 个 OOD 基准全保持,答案级幻觉率 17.6%→12.6%;单向消融证明只改 agent 或只改 critic 都会平台化,交替优化持续上升——末代 critic 配末代 agent 84.0 vs 配 SFT critic 80.6。

August 27, 2026 · 3 min

IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents 精读

深度精读腾讯微信团队(26 Aug 2026)论文 IAPO:多轮服务 Agent 训练中,最终奖励无法指出哪些中间动作真正立功。IAPO 把每条已完成轨迹表示为带符号的影响依赖图(支持使用边/失败使用边),用「信息被下游实际消费」「错误可观测传播」两路证据重新路由轨迹级优势,不改奖励、采样与损失实现,在 τ²-Bench 上把 Qwen3-8B 从 29.61% 提到 42.18%(+12.57pp),电信域增益最大达 +18.19pp,且不伤函数调用能力。本文解析其「写即所用」的证据三条件、符号条件路由机制与三条数学保证。

August 27, 2026 · 5 min

Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

On-policy Distillation with Verifiable Reward 精读

清华LeapLab提出的OPDVR用一道极简的ReLU门,把On-policy蒸馏的隐式奖励按轨迹正确性重新定号,使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量,实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8,甚至反超教师;GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起,逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。

August 27, 2026 · 2 min

Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min