Joint Optimization of Tool Creation and Use for Large Language Model Agents(SMITH)精读

深度精读 Appier AI Research + 台湾大学(25 Aug 2026)论文 SMITH:现有工具创建系统让强模型写工具、弱模型用工具,写工具的模型从不被激励去设计「自己能可靠调用的接口」。SMITH 用 RL 在单一策略内联合训练工具创建与使用:use 任务只给 JSON schema,接口写得烂必然调用失败,形成「写即所用」闭环;三条独立奖励轴分离 schema/代码/结果失败;easy-to-hard 协议逼出可泛化工具。4B 模型在 RG Unseen 达 79.9 压倒所有同骨干框架,平均输出仅 100 token(比 CoT 少 32 倍),其工具还能让 350M 小模型追平 30B 写的工具。

August 27, 2026 · 6 min

Ockhamareto: Pareto-Gated Segment-Level Credit Assignment for Concise Unit-Test Generation with Reinforcement Learning 精读

深度精读 NUS+UCL+KCL+港科大广州(25 Aug 2026)论文 Ockhamareto:用「帕累托门控奖励 + token 级分段信用」把单元测试生成从「堆数量」转向「讲效率」,单次生成 2.60 个测试拿下 49.9% 突变分数,比最强 RL 基线 MIST-RL 多抓 18.6 个百分点的 bug 且少用 44% 的测试,4B 模型反超未调优 27B。本文解析其双机制因果链、五基准实验证据与「每个函数该维护几个测试」的帕累托前沿分析。

August 27, 2026 · 6 min

On-policy Distillation with Verifiable Reward 精读

清华LeapLab提出的OPDVR用一道极简的ReLU门,把On-policy蒸馏的隐式奖励按轨迹正确性重新定号,使蒸馏信号永远不与验证器方向打架。理论上证明OPDVR恰好等于OPD去掉与验证器冲突的梯度分量,实验上同架构蒸馏6个数学基准平均49.1超过OPD的47.8,甚至反超教师;GRPD变体在AIME25上比GRPO高出10.9分。本文从RLVR与OPD互补困境讲起,逐层拆解门控机制的数学构造、约半数token被门控的动态证据与逆向门控消融的因果链。

August 27, 2026 · 2 min

Parason: Revealing Subtask- and Trial Parallelism in LLM Reasoning 精读

清华、MIT与NVIDIA合作的Parason瞄准推理模型的延迟瓶颈:自回归解码把整条推理链串行执行,难题要等数小时甚至数天。论文首先提出推理并行性的语义分类——Subtask并行(AND分支,分而治之)与Trial并行(OR分支,多路试探),并测量发现Trial并行占了可并行推理计算的多数(DeepSeek-V4在HLE上65.5%),而此前系统几乎只利用了前者。Parason用上下文无关文法把串行推理轨迹改写成引擎可解析的并行结构,配合PA-GRPO多目标奖励(正确性+关键路径延迟+两类并行比例)训练,经SGLang真实执行。AIME24/25等基准上平均加速约1.7×,8k token延迟预算下用25%预算匹配全额性能。

August 27, 2026 · 2 min

Prefix Sliding for efficient test-time scaling 精读

斯坦福、华盛顿大学联合 Prime Intellect 等机构提出 Prefix Sliding:推理时只保留前缀(系统指令+prompt,充当注意力锚点)+ 最近数千 token 滑动窗口,丢弃中间推理 token。基于「中间 token 完成子任务后即失去重要性」的注意力概率观察,免训练即可让现有模型提速 3 倍而性能不降;配合截断反向传播,RL 可训练 10 万 token 级长推理轨迹。方法极简但解决了「无限测试时扩展必须有界每 token 成本」这一根本问题。

August 27, 2026 · 4 min

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards 精读

RePolicy(中科大+NUS+浙大等)把 agent 安全防护的关键一步——从动态策略库中调用适用安全策略——变成可优化的动作:rollout 结构为「策略调用→内容注入→有据推理→安全判断」,冷启动 SFT 后用 GRPO 配三项可验证奖励(格式/策略命中/判断正确)加策略上下文扰动(注入诱饵策略)训练。4B 模型在六个 agent 安全基准上 Overall Unsafe F1 达 88.15,超最强外部通用模型 Claude Sonnet 4.6 达 3.98 分、超最强专用 guard 达 8.46 分;策略命中率从 94.4% 升至 98.5%,诱饵选中率全程低于 1%。本精读拆解其任务形式化、数据构造与「调用-检索-推理」多算力换均衡错误权衡的机制因果链。

August 27, 2026 · 3 min

SkillForge: Evolving Verifiable Skills for Reinforcement Learning Agents 精读

RL 训练的 LLM Agent 大多是’健忘’的:每个 episode 从零开始,过往经验无法沉淀。阿里高德(AMAP)团队提出的 SkillForge 让技能库在训练中持续进化——prompt 只注入紧凑技能目录,agent 用 <skill_call> 标签按需调用,每次调用成为轨迹中可观测、可归因的离散事件,GRPO 因此能同时优化环境动作与技能调用决策;证据驱动的技能验证(EMA 成功率+使用次数计算欠效分数)让低效技能被 reflexion 及时改写,多路径归纳从成功/失败/对比三通道合成新技能。在 ALFWorld/WebShop/AppWorld 三基准上全面超越 SkillRL(AppWorld SGC 近 3 倍),且 4B 小模型进化出的技能库迁移到 30B 模型能反超其自进化库——技能存的是可迁移知识而非模型私有产物。

August 27, 2026 · 4 min

Training Alignment Auditors via Reinforcement Learning 精读

深度精读 Anthropic 论文:用 RL 训练 Claude Haiku 4.5 做对齐审计员。奖励设计三轮迭代的故事极具教学价值——生产模型标量奖励被黑化(误报率 96%)、二值奖励学会对抗盘问、最终 reference pairwise 奖励 + 50% 无行为校准 rollout 让小模型匹配 Opus 4.6(48.7 vs 48.4)、误报率压在 1% 以下,并跨脚手架迁移到 AuditBench 对抗性目标(检测率 11.5%→28.1%)。

August 27, 2026 · 3 min

V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning 精读

南洋理工大学 S-Lab 联合 A*STAR、UIUC 提出 Visual Rubrics-Based RL:把视觉忠实性从「事后评测指标」转变为「细粒度 RL 训练信号」。方法将参考答案分解为视觉忠实性/推理一致性/指令遵循三维原子评分条目,构建 5 万例训练集,并用组件化+前缀局部化的优势分配改造 GRPO。在同 SFT 起点、同 RL 数据、同预算的受控对比下,比 answer-only GRPO 再提 1.79 分,增益集中于依赖接地中间推理的基准。

August 27, 2026 · 3 min

Where vs What: Decomposing Structural and Content Failures in LLM Structured Outputs 精读

深度精读深圳大学 + 中科院深圳先进院论文:把 LLM 结构化输出失败分解为「值放错位置」(structural)与「值本身错误」(content)两种模式独立测量,发现跨 6 个模型一致的「结构先退化」剪刀差——前沿模型在最复杂任务上仍放错 24-35% 的值而小模型达 74%;机制消融指向语义捷径而非拓扑寻址;SA-RLVR 把结构感知奖励用于 GRPO,VPA 从 0.26 提到 0.63 而 SFT 仅 0.28。

August 27, 2026 · 2 min