FLARE:用生成式奖励模型为长程编码智能体提供全生命周期稠密监督 —— 精读
深度精读北京大学、南京大学、北京邮电大学与独立研究者联合提出的 FLARE。它通过 RADAR 双轨数据合成训练一个 4B 生成式奖励模型(GRM),输出结构化的步级风险诊断(风险等级+错误类+修复建议),在推理时做断点再生、训练时做 SFT 筛选与 RL 稠密奖励,首次把测试时干预与训练时对齐闭环到同一套诊断信号。F2P Pass@1 14.10% 近乎翻倍于全局重采样 7.80%,token 省 5×;ROC-AUC 75.74%;SFT 相对提升 19.13%,RL 平均提升 9.19%。