SMITH:把「造工具」和「用工具」放进同一个 RL 循环 —— 精读

论文链接:https://arxiv.org/abs/2608.24571

发表时间:2026年8月(arXiv:2608.24571v1,25 Aug 2026,cs.AI)

机构:Appier AI Research(沛星互动科技 AI 研究院,企业)+ National Taiwan University 台湾大学(高校)——典型企业-高校合作。作者阵容值得注意:Zhi Rui Tam(Appier+NTU 联合)、Chieh-Yen Lin(Appier)、Yun-Nung Chen 陈蕴侬(NTU,对话系统专家)、Shao-Hua Sun 孙绍华(Appier AI Research 主管,NTU 玉山学者)、Hung-yi Lee 李宏毅(NTU,知名机器学习课程讲师)——产学两端都是重量级人物

领域标签:LLM Agent / 工具学习与工具创建 / 强化学习 / cs.AI


一、论文背景:工具增强的天花板是「人类写好的 API」

1.1 从工具使用到工具创建

LLM 的参数化记忆有三个硬伤:精确计算(大数乘法、位运算)、最新知识、可靠的符号推理。工具增强(tool-augmented LLM)是标准解法——外挂计算器、代码解释器、搜索引擎。但现有系统依赖固定的、人类设计的工具集:API 可能不完备、可能不匹配新任务、甚至压根不存在。这构成了模型能力的天花板:工具增强的边界,就是人类愿意写的 API 的边界。

由此兴起动态工具创建(dynamic tool creation):让模型按需合成可复用的可调用函数。LATM(Large Language Models as Tool Makers,ICLR 2024)开了先河——用 GPT-4 从演示中生成 JSON-schema 工具;后续 CRAFT 加了检索验证、Trove 加了归纳验证流水线、KTCE 加了多阶段分解。但它们共享一个范式:把工具写作当作推理时(inference time)的提示工程问题——冻结的 LLM + 更复杂的脚手架。

1.2 「写工具的」和「用工具的」是两个人

上述范式的结构性缺陷:工具创建与工具使用是分离的。LATM 及后续工作普遍是「强模型写工具、弱模型调工具」,于是:

  • 写工具的模型从不被激励去设计自己能可靠调用的接口——工具质量全靠生成时的「顺手」,没有训练信号修正 schema 的歧义;
  • 工具质量从未在 LLM 训练中被显式优化——prompting 只能「许愿」模型写出好工具,不能「保证」它越写越好。

一句话:没有一个现有系统训练过模型同时成为更好的工具创造者和工具使用者。这是 SMITH 要填的洞。

1.3 用 RL 联合训练的两只拦路虎

把「创建+使用」塞进 RL 说起来自然,论文指出两大挑战:

  • 奖励分解:一个生成的工具包含 schema(函数名、参数、类型——给调用方看的「说明书」)和后端实现(可执行 Python 代码)两部分。schema 歧义和代码写错是两种不同的病,需要不同的纠正信号——混在一个奖励里会互相稀释。
  • 循环评估(circular evaluation):评工具质量需要裁判,但自评不可靠(LLM 评审员偏爱自己生成的内容),固定外部裁判又有可信度问题;而且裁判本身得足够懂工具使用,才能判断一个 schema「实际可调用性」如何。

二、论文定位和关联工作

2.1 工具创建系统谱系:脚手架越来越复杂,模型始终没变

系统工具创建时机核心机制测试时 LLM 调用关键局限
LATM推理时(冻结模型)强模型写 schema 工具、弱模型调用~2工具质量无训练信号
CRAFT离线(GPT-4 造库)+ 在线多视角检索SimCSE 四视图检索 + 代码内联2检索质量上限=解质量上限
Trove在线流式(边测边建)import/create/skip 三模式并行 + 频率遗忘3结果依赖题目顺序
KTCE离线进化(5 轮删改加)LLM 驱动的进化循环 + 回滚3脚手架最重;作者实测发现程序求解器旁路、stub 工具等失败模式
ReTool蒸馏(Qwen-32B 轨迹)多轮代码执行策略,不产生可复用 schema-行为克隆,过拟合示教分布
SAGERL(最接近)技能创建 RL 目标-单题创建单题验证,泛化受限
SMITHRL 训练(离线改权重)build/use 联合训练 + 三奖励轴 + easy-to-hard~3——

SMITH 与整个谱系的本质区别(附录 K 的实现级对比表很扎实):前面所有系统的「优化」都发生在工具库层面(删改工具),SMITH 的优化发生在策略权重层面(让下一次写出的工具必然更好)。测试时它反而最简单——不需要检索、不需要库,模型一次 forward pass 写出自己需要的工具。

2.2 与 ReTool/蒸馏路线的对照

ReTool 与 SMITH 都用执行反馈,但 ReTool 蒸馏自 Qwen-32B 的代码执行轨迹、每题生成即弃的临时代码;SMITH 从可验证奖励端到端训练、产出带 JSON schema 的可复用工具。这对「行为克隆 vs 强化学习」「临时代码 vs 可复用接口」两个轴都构成受控对照。

定位结论:SMITH 站在「工具创建从提示工程转向训练目标」的转折点上,是对 LATM 范式的根本性修正:与其给冻结模型配更聪明的脚手架,不如直接训练那个模型。


三、问题定义

3.1 从具体场景到抽象问题

具体问题:如何训练一个模型,使它写的工具恰好是它能可靠调用的工具?核心洞察是一个类比——工具创建与使用的联合优化 ≈ 「生产者-消费者」闭环经济:

经济概念SMITH 对应
生产者build 任务:从 4 个样例归纳写出 Python 函数 C + OpenAI 兼容 JSON schema S
消费者use 任务:只看 schema(不看代码)调用工具池中的工具答题
市场检验16 道 held-out 题上的执行正确率 r_eval
质检员LLM judge 打分 + 格式校验器
以次充好被市场惩罚schema 歧义 → 调用失败 → r_eval=0

关键设定:use 任务只见 schema 不见代码——这是整个闭环的支点。如果接口写得含糊,模型自己在 use 时就会调用失败,直接惩罚当初写接口的动作。「写即所用」(what you write is what you invoke)不再是许愿,而是训练图的结构性质。

3.2 形式化定义

给定:任务族集合(13 类 Reasoning-Gym 程序化推理任务,答案可精确验证);基座 Qwen3-4B-Instruct;DAPO 优化器。

求:单一策略 π_θ,最大化:① build 任务上由 16 道 held-out 难题测得的工具执行准确率;② use 任务上调用工具答题的效率加权正确率。

约束:① 奖励必须分解——schema 失败、代码失败、结果失败各走各的梯度通道;② 评估器不与训练权重实时共享(防循环评估的不稳定);③ 工具在易任务上归纳、在难任务上评估(逼抽象而非记忆)。

精妙之处:约束③ easy-to-hard 协议是反捷径的机关——如果评估集与归纳集同难度,模型只需模式匹配简单样例就能得分;把评估放到最难档,只记忆不抽象的工具直接零分,可泛化的算法成为唯一得分路径。


四、问题解法

SMITH = 双任务采样 + 三奖励轴 + 评估器同步 + 工具池,全部跑在 DAPO 上。

4.1 双任务交织训练

每个训练 batch 一半 build、一半 use(1:1,梯度贡献平衡)。类比:交替上「造车课」和「驾驶课」,且驾驶课上开的车正是你造车课上亲手造的那辆。

  • build 任务:给 N=4 个 (问题, 答案) 对 → 一次 forward pass 输出「Python 函数 + 匹配的 JSON schema」。生成的工具对 K=16 道隐藏难题(生成时模型永远看不到答案)执行评估。
  • use 任务:给一道题 + 工具池注入的 3 个 schema(1 个域内工具 + 2 个干扰工具)→ 最多 T=5 轮对话调用工具出答案。干扰工具逼模型「读 schema 识别哪个相关」而非「见到工具就调」。

4.2 三条独立奖励轴:让三种失败各自贡献梯度

轴 1:环境奖励 r_env = r_fmt + r_eval

  • r_fmt∈{0, 0.5}:响应恰好含一个 Python 块 + 一个 JSON 块且函数名/参数签名互相一致得 0.5。解析不出合法 (C,S) 对则整条轨迹提前终止、所有奖励轴归零。
  • r_eval∈[0,1]:评估器模型 π_eval 用生成的工具答 16 道难题的正确比例。两个防作弊细节:只统计经成功工具调用得到的答案(文本推理绕过工具 = 不计分,堵死「不走工具路线」的漏洞);答案经 LLM 等价判定(非死板字符串匹配)。

轴 2:judge 奖励 r_judge(独立传给 DAPO,不并入 r_env)

LLM judge 按 code_correctness / code_clarity / schema_quality / schema_code_alignment / overall_quality 五维打分(0–5),外加对齐检查:schema 与代码签名不一致 → 分数减半;代码语法错误 → 固定 −0.5。独立成轴是刻意设计:执行信号与语义质量信号解耦,各自的系数独立可调。

轴 3:use 任务正确性 r_correct = 2c·η(ρ)

c 是最终答案正确性;η(ρ) 是轮数效率乘子——用掉的轮数比例 ρ 越多,奖励衰减(分段设计保证 ρ=0.5 处连续,地板 η_min=0.3 保证「对了但慢」仍优于「错了」)。类比:外卖准时奖——按时送达全额,每迟一分钟扣一点,但准时奖永远不为零。

4.3 评估器同步:温和地解决循环评估

π_eval 从与策略相同的基座初始化,然后定期(每 5 步)从最新策略权重拷贝刷新——既不冻结在起点(评估能力随策略一起进步),也不实时共享权重(避免「自己给自己打分」的不稳定)。这像「评审委员会每季度换届为最新一届毕业生」——评估标准始终与时俱进但相对稳定。

4.4 工具池:准入、末位淘汰与隐性课程

每类任务一个桶(上限 20 个):r_eval>0 才准入;桶满时淘汰 r_eval 最低(平局取最旧)者。妙处在于隐式课程效应:训练推进 → 工具越写越好 → 池子最低质量门槛自然抬升 → 后期 use 任务面对的是更高质量的「市场」,无需显式调度。空池时 use 任务先做一次 build——训练初期 1:1 的任务配比保证池子快速填充。

4.5 easy-to-hard:难度分离协议

附录 F 给出 13 类任务的完整难度映射,几例感受一下「易→难」的跨度:

任务归纳带(易)评估带(难)难度轴
位运算表达式深度 2深度 4–5表达式树嵌套
密码算术≤8 个独特字母≥9 个(如 FORTY+TEN+TEN=SIXTY)字母数(搜索空间指数增长)
汉诺塔3 盘(7 步)5 盘(31 步)盘数(步数 2ⁿ−1)
骑士骗子2 角色/深度 24 角色/深度 4角色数与推理树深度

4.6 附录 B 的血泪史:naming-drift 崩溃与五条修复原则

这是论文最「值回票价」的部分之一。早期配置中训练在 step 5 后突然崩塌(step1 失败率 2.6%→23.9%)。根因:命名漂移——模型生成多个辅助函数,schema 引用的函数名却不在顶层可调用集中;而结构性校验器对此判死刑(r=0 终止),LLM judge 却只打五折(部分分)。于是「judge 给正分 + verifier 给零分」的奖励缝隙形成了梯度泄漏——策略被实际强化去生产「judge 喜欢、verifier 判废」的多函数风格。修复后凝练成五条原则:硬失败必须处处硬失败;judge 提示词必须对齐校验器的硬约束;结构性子指标必须作为一等公民监控(而非折进总奖励);judge 信号应在校验失败时门控归零;能用规则精确强制的结构性约束就别交给软性 judge。


五、评估指标与实验证据

5.1 指标体系

主指标:RG (Unseen) 宏平均准确率——10 个完全留出的 RG 任务类(共 25 个类中训练只见 13 个),测跨任务泛化,这是「学的是工具构建能力还是任务捷径」的试金石。辅助:RG (Seen)(13 训练类最难档——测工具能否从易归纳泛化到同类难题)、TabMWP-Hard(自制强化版表格推理)、GQA(视觉问答,零视觉训练)、BFCL v4(外部函数调用保持度)、I/O token 数(效率)。

基准设计的一个亮点:TabMWP-Hard 是作者自建的——原版 TabMWP 被标准 CoT 打到 96.8% EM(表平均不到 10 行 2 列,实体查找即可得分),作者把表扩到最多 5,000 行、插入近失配行(near-miss,名字只差一两个字符)、加无关列,配两步有效性门——「饱和基准测不出差异」的方法论自觉。

5.2 核心数值证据

Table 1:主结果(Qwen3-4B-Instruct,RG 宏平均%)

方法RG SeenRG Unseen平均 I/O token
Standard CoT58.055.7173 / 3,206
LATM*(同骨干)77.658.3607 / 174
LATM*(30B-A3B 写工具)74.074.1659 / 405
CRAFT74.176.51,226 / 418
Trove52.655.9347 / 575
KTCE61.065.1319 / 404
ReTool(蒸馏 Qwen-32B)92.263.21,707 / 633
LATM(蒸馏 GPT-4.1)81.765.8638 / 207
SMITH85.279.9±2.2664 / 100

三个层次的胜利:① 压倒所有同骨干推理时框架(CRAFT 76.5、KTCE 65.1、Trove 55.9)——RL 训练 > 提示工程;② 胜过 30B 的 LATM 写作器(74.1)——4B 训练过的「会写会用」> 30B 未训练的「只会写」;③ 胜过蒸馏(ReTool 63.2、LATM-distill 65.8)——可验证奖励 > 行为克隆。特别注意 ReTool 的曲线:Seen 92.2 全场最高,Unseen 掉到 63.2(近 30 分跳水)——蒸馏过拟合示教分布的典型画像,SMITH 恰好相反(85.2/79.9 更均衡)。token 效率:平均输出仅 100 token,比 CoT(3,206)少 32 倍、比 ReTool(633)少 6 倍——RL 把推理工作量从解码时思维链搬进了可复用的工具代码。

Table 7:奖励结构消融(4B)

方法RG(S)RG(U)TabMWPGQA
基座61.8547.0119.7020.86
Tool Create(只训创建)73.8868.8017.7035.82
Decoupled Create/Use(30B 建+4B 用,分开训)76.4458.9313.9035.04
SMITH: No LLM Judge82.5767.8118.3042.63
SMITH: K=1(评估只用 1 题)78.6473.9346.7732.30
SMITH: Full86.6178.3340.4042.62

最有信息量的一行是 Decoupled(58.93 < 单模型 Tool Create 的 68.80)——把创建和使用拆给两个模型分开训练,反而不如只训创建的单模型。「联合训练而非分工」是真正的活性成分,直接证伪了「专业化分工更好」的直觉。去 judge 后 RG-U 78.33→67.81(−10.5pp),证明语义质量信号不可省;K=1 时 TabMWP 反而更高(46.77)但 GQA 崩(32.30)——单题评估的信号在不同域间不稳定。

Table 2/3:工具跨模型迁移(「工具是写给谁的」)

消费者无工具+4B 基座写的工具+RL 4B 写的工具(SMITH)
LFM-2.5-350M11.6 (RG-U)23.442.9(≈30B 自写的 41.5)
Qwen3-30B-A3B70.2(总分,LATM 自写自用)—76.6(TabMWP-Hard 0.7→38.8)

双向迁移:往下,4B 写的工具让 350M 小模型在 RG-Unseen 达 42.9,追平 30B 模型自写的 41.5——工具里编码的是真正可泛化的解,不是与写作模型私相授受的暗号;往上,30B 消费者用 SMITH-4B 的工具,总分 70.2→76.6、TabMWP-Hard 0.7→38.8——强模型自己写的工具不如 RL 训练的 4B 写的好,「即插即用工具供应商」成立。

Table 5/6:跨骨干与外溢效应:同配方在 Qwen3-8B 上 RG-U 72.2→81.7、TabMWP 42.4→56.7、GQA 17.3→28.7;Granite-3.3-8B 同趋势。BFCL v4(外部函数调用,训练中从未见过其 schema/多轮轨迹/judge)4B 45.1→48.6、8B 43.3→55.8——学到的是通用工具使用先验而非基准特化。Self-Judge 变体(8B 自己当裁判)RG-U 达 85.9 更高但 GQA 掉到 16.3——小裁判「弱但偏置小」,域内外权衡值得玩味。

Table 4:OOD:TabMWP-Hard 40.4 第一(次优 Trove 36.4);GQA 42.6 第二(输给 GPT-4.1 蒸馏的 56.0——那是视觉 oracle 蒸馏,作者不讳言感知差距是避开 oracle 监督的代价)。GQA 协议:模型零视觉训练,只给三个视觉原语(OWL-ViT 检测、BLIP-VQA、裁剪),build 任务从 10 个纯文本 (Q,A) 对推断如何组合原语成工具——学到的「视觉工具组合策略」让纯文本模型答视觉题。


六、效果优势的根源解释

6.1 基线的根本局限:断开的反馈环

推理时框架(LATM/CRAFT/Trove/KTCE)的共同病根:工具质量的信号链是断的。冻结模型的 prompt 无论多精巧,其梯度都不流向「写工具」这个行为本身——工具写得差,下一题换个 prompt 再试一次,模型本身没有任何长进。更糟的是「写用分离」:写 schema 的强模型不承担调用失败的后果,schema 歧义的代价由(另一个)调用者默默消化。蒸馏路线(ReTool)有训练信号但信号来自模仿——学生学到的是「32B 老师怎么写」,而非「什么样的工具在难题上真的能跑通」;示教分布之外泛化崩掉(Seen 92.2 → Unseen 63.2)是必然而非意外。

6.2 SMITH 的三处机制改变

改变一(use 只见 schema → 约束结构改变):这是全文的因果起点。schema 是调用方唯一的决策依据,schema 的歧义必然兑现为调用失败、r_eval 归零——接口质量第一次有了直接、即时、可执行的训练信号。因果链:schema 歧义 → use 调用失败 → build 奖励塌 → 写出自描述、参数原子化、类型清晰的接口 → 消费者(包括其他模型)也能正确调用 → 工具跨模型迁移(350M 追平 30B)。反事实验证:解耦版(30B 建 + 4B 用,分开训练)RG-U 58.93 < 联合单模型 68.80 < 完整 SMITH 78.33——闭环的每一圈都在增值。

改变二(三奖励轴分离 → 梯度流改变):格式轴管「输出能不能解析」、judge 轴管「代码/schema 语义质量」、eval 轴管「工具真的能解题」——三种失败模式各自贡献梯度,不会互相抵消或稀释。附录 B 的 naming-drift 案例从反面证明该设计的必要性:当 judge 对 verifier 判死的输出仍给部分分时,奖励缝隙产生梯度泄漏,策略被强化去生产「judge 喜欢、verifier 判废」的结构性坏输出。「硬失败必须处处硬失败」原则由此而来。消融中去 judge 掉 10.5pp——语义质量信号与执行信号互补而非冗余。

改变三(easy-to-hard 评估间隙 → 学习目标改变):归纳用最易档、评估用最难档,只记忆易样例模式的工具得零分——策略被逼走向「抽象出底层算法」。这解释了为什么 4B SMITH 能在 Unseen 类上逼近满分档(93.0 Algo 列)、以及为什么零样本迁移到 TabMWP-Hard/GQA 仍领先:学到的不是 13 类任务的解,而是「从样例归纳可复用算法」的元能力。对照:ReTool 蒸馏没有这种间隙压力,Seen 满分 Unseen 崩盘。

6.3 token 效率的根源:工作量搬家

100 vs 3,206 的 32 倍输出差距不是模型变啰嗦/简洁的调参问题,而是计算发生地的转移:CoT 每题重新推理一遍,SMITH 把推理固化进一次写成的工具代码,之后每题只是一次短调用(类似「编译一次、运行多次」)。这也是「工具可复用性」从成本侧的定义。

6.4 诚实的边界

三点:① 规模未知性——全部实验 ≤8B 策略 + 30B judge,70B+ 上增益是否保持/饱和/反转是开放问题;② 工具形态单一——一个工具=一个 Python 函数+一个 schema,SKILL.md 式多文件技能包、MCP 服务器等更丰富的工件未覆盖;③ 训练中从未观察到并行工具调用或多工具一次性生成——作者归因于基座倾向与奖励设计均不鼓励,而真实场景(深度研究类任务)常需并行调用。


七、必要知识反推

7.1 领域知识层(工具生态)

  • OpenAI function-calling 协议与 JSON schema 的接口语义:schema 是调用方唯一信息源这一事实,是「写即所用」闭环的设计依据;不懂其工业标准就无法理解为何选它作为工具表示;
  • 工具创建框架谱系(LATM→CRAFT→Trove→KTCE 的脚手架演进)与其「写用分离」共性——论文的靶子;
  • Reasoning-Gym 的程序化任务与难度课程:可精确验证答案 + 难度可控是 easy-to-hard 协议的可用前提。

7.2 方法论知识层(RL 与奖励设计)

  • DAPO/GRPO 的组相对优化:理解 per-prompt 组内优势如何计算,才能设计「三轴独立传入、不合并标量化」的奖励接口;
  • 奖励分解与梯度泄漏理论:附录 B 的核心教训——加性组合的奖励组件中,任何对硬失败输出给正分的组件都会产生梯度泄漏;这需要对 GRPO 优势 = r−r̄ 的敏感性有精确理解;
  • LLM-as-judge 的偏差文献(评审员偏爱自生成内容):评估器定期同步(而非实时共享)的折中设计直接来自这份知识;
  • 蒸馏 vs RL 的泛化差异:设计 ReTool/LATM-distill 对照组需要知道「行为克隆过拟合示教分布」是可预期的失败模式。

7.3 工程知识层

  • 沙箱执行与结构校验流水线(step1 解析→evaluator 执行→judge 打分的三级管线、失败提前终止);
  • 工具池的并发工程(线程安全字典、准入/淘汰/干扰项选择策略)与隐式课程设计;
  • 评估基建:饱和基准的强化改造(TabMWP-Hard 的近失配行+无关列+两步有效性门)、基线实现的失败模式审计(附录 L 发现 KTCE 程序求解器旁路与 stub 工具、TroVE token 记录缺失——作者逐项修复并如实报告对基线分数的影响);
  • 单卡可复现性(单张 RTX 6000 Pro、36–72 小时/配置)。

7.4 知识融合的关键节点

三个化学反应:① 「schema 是调用方唯一信息源」的接口事实 × RL 奖励设计 → use 任务只给 schema,接口质量自动获得可执行信号——这是整篇论文的支点洞察;② 生产者-消费者经济学 × 多任务学习 → 1:1 交织采样让两种技能在同一权重内互相强化,消融证明这个「互相」字面成立(解耦反而更差);③ 一次真实训练崩溃的取证 × 奖励理论 → naming-drift 事故的根因分析升华为五条可迁移的设计原则——工程失败本身成为方法论贡献。


八、论文中可以提取的通用性灵感

灵感 1:让「生产者」直接面对「消费者」的成败,是接口质量最便宜的监督信号

  • 核心思想:与其定义接口质量的代理指标,不如构造一个「消费者只能看到接口」的使用场景——接口的一切缺陷自动兑现为使用失败,闭环即监督。
  • 论文证据:use 只见 schema;解耦版 RG-U 58.93 < 联合版 78.33;工具可跨模型迁移(350M 用 4B 的工具追平 30B)。
  • 推广场景:① API 文档生成(让只读文档的 Agent 调用该 API);② 提示词/prompt 模板设计(让下游模型仅凭模板完成任务);③ 产品说明书写作(按说明书操作能否复现结果);④ 教学设计(学生仅凭讲义能否解题)。

灵感 2:加性多奖励信号中,「硬失败必须处处硬失败」,否则产生梯度泄漏

  • 核心思想:多个评分器并联时,任何对致命错误给部分分的通道,都会成为策略钻空子的方向——致命约束必须在所有通道一致归零。
  • 论文证据:naming-drift 崩溃(verifier 判 0、judge 打五折 → step1 失败率 2.6%→23.9%);修复后训练稳定,五原则成文。
  • 推广场景:① 多目标 RLHF(安全性硬约束 vs 偏好软打分);② 自动评分系统组合(规则门 + LLM judge);③ CI/CD 门禁(lint 硬失败 vs 评审软意见);④ 多裁判竞技评审(一票否决项的一致性)。

灵感 3:用「易学难考」的评估间隙逼出抽象,逼退记忆

  • 核心思想:当创造物在易条件下归纳、在难条件下检验时,只有真正编码了底层规律的作品才能得分——难度间隙是抽象能力的过滤器。
  • 论文证据:归纳用最易档、评估用最难档(表:汉诺塔 3 盘→5 盘、密码算术 ≤8 字母→≥9 字母);SMITH Seen/Unseen 均衡(85.2/79.9)vs ReTool 的 Seen/Unseen 断崖(92.2/63.2)。
  • 推广场景:① 技能学习课程(简单例题教、难题考);② 代码重构的归纳(从简单用法归纳出的抽象须兼容复杂用法);③ 课程设计(先教特例后考通式);④ 模型蒸馏的训练集构造(易样本教、难样本验)。

灵感 4:把推理成本固化为可复用工件,是 token 效率的结构性来源

  • 核心思想:与其每次从零思考,不如把「思考的结论」物化为可多次调用的工具——一次性编译、无数次运行,成本摊薄。
  • 论文证据:平均输出 100 token vs CoT 3,206(32×)、ReTool 633(6×),且精度更高;工具池准入-淘汰机制使高质量工件持续沉淀。
  • 推广场景:① 企业知识库(FAQ 沉淀为可检索程序);② Agent 技能库(Skill/MCP 工件化);③ 代码生成(常用逻辑抽象为函数库);④ 个人工作流自动化(重复决策固化为脚本)。

灵感 5:结构性子指标是一等公民,总奖励会撒谎

  • 核心思想:聚合指标会掩盖「一维改善掩盖另一维退化」的轨迹——每种约束的违反率必须独立监控、独立告警,在临界点之前干预。
  • 论文证据:step 5 时 env_reward/judge_reward 均健康,崩溃只显形于 fn_mismatch 子指标;若只看聚合奖励,step 6 的崩塌将「猝不及防」。
  • 推广场景:① RLHF 训练监控(各安全维度的独立看板);② 复杂系统 SRE(每类错误的独立告警阈值);③ 模型评测(分项能力雷达图 vs 总分);④ 学生学业诊断(分知识点掌握率 vs 总分)。

附录:本文关键数字速查

项目数值
主结果 RG Unseen(4B)79.9±2.2(第一;CRAFT 76.5、30B-LATM 74.1、ReTool 63.2)
RG Seen85.2(ReTool 92.2 最高但 Unseen 掉近 30 分)
token 效率平均输出 100(vs CoT 3,206 少 32×,vs ReTool 633 少 6×)
解耦消融30B建+4B用 58.93 < 联合单模型 68.80(联合是关键)
去 judge 消融RG-U 78.33→67.81(−10.5pp)
工具往下迁移350M 用 SMITH 工具 RG-U 42.9 ≈ 30B 自写 41.5
工具往上迁移30B 消费者总分 70.2→76.6;TabMWP-Hard 0.7→38.8
OODTabMWP-Hard 40.4(第一);GQA 42.6(第二,输 GPT-4.1 视觉蒸馏 56.0)
跨骨干Qwen3-8B RG-U 72.2→81.7;BFCL 8B 43.3→55.8;Granite-3.3-8B 同趋势
训练配置Qwen3-4B + LoRA(r=64)/DAPO/60 步/13 任务/单卡 RTX 6000 Pro/36–72h
崩溃案例step1 失败率 2.6%→23.9%(naming drift + 奖励缝隙),修复成五原则