Critical-State RL:为多轮工具调用诊断「可训练的模型调用」 —— 精读

深度精读 Salesforce AI Research 的 Critical-State RL。它指出多轮工具调用失败往往卡在单个模型调用上,但「奖励有差异」并不等于「该调用值得训练」。方法先用训练前三闸门诊断(动作充分性 / 提升空间 / 可训练性),再用嵌套同前缀采样分离「动作依赖奖励方差」与「后续噪声」,最后只对选中的关键调用做 occurrence-local RL(上下文赌博机式训练)。BFCL 上对缺失函数任务 miss_func 恢复率 0.14→0.283(+14.3pp),错位训练反而 −4.5pp;记忆子任务 34.54%→50.54%;Nemotron 重复调用一致性 37%→75%。

September 23, 2026 · 4 min

FLARE:用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读

深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型(GRM),输出结构化的步级风险诊断(风险等级+错误类+修复建议),在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励,首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%,token 省 5×;ROC-AUC 75.74%;SFT 相对提升 19.13%,RL 平均提升 9.19%。

September 23, 2026 · 4 min