论文链接:arXiv:2608.05102 发表时间:2026年8月 机构:上海交通大学(Shanghai Jiao Tong University) 领域标签:cs.AI — Agent Training, Credit Assignment, Long-Horizon Search


一、论文背景

什么是长程搜索 Agent?

在 AI Agent 的世界里,有一类任务特别困难——长程搜索任务。这类任务要求 Agent 执行一连串顺序动作(搜索→检索→验证→整合),才能最终得到答案。想象一个侦探破案:他需要走访多个地点、询问多名证人、交叉验证证据,每一步都可能走错方向。

浏览式搜索 Agent(Browse Agent) 就是这类任务的典型代表。它需要像人类研究员一样,在互联网上反复搜索、阅读网页、判断信息相关性、跟踪链接,经过几十甚至上百步操作后,才能找到冷门问题的答案。

当前遇到了什么问题?

训练这类 Agent 有两条主要路线:

  1. 监督微调(SFT):让 Agent 模仿成功的搜索轨迹。但成功轨迹中的每一步并非都有价值——有些步骤是关键线索,有些是冗余探索。
  2. 强化学习(RL):给 Agent 一个最终答案是否正确的奖励信号。但这个信号是稀疏的——整个几十步的轨迹只得到一个 0 或 1 的结果。

核心矛盾:现有的 SFT 和 RL 方法对轨迹内所有步骤均匀对待,无法区分哪一步是"关键洞察"、哪一步是"白走弯路"。这就像老师只看学生期末考试总分,不告诉他哪道题做对了为什么对、哪道题做错了为什么错。

为什么这个问题重要?

在可验证奖励的强化学习(RLVR)中,如果奖励信号过于稀疏,Agent 很难从失败中学习——它只知道"最终失败了",但不知道"哪一步开始走偏的"。这导致大量训练信号被浪费,小模型尤其受害。


二、论文定位和关联工作

研究谱系

谱系代表方法核心思想与本论文的关键区别
均匀轨迹级训练标准 SFT + GRPO整条轨迹统一对待无法区分有用/错误步骤
密集奖励分配PRM(过程奖励模型)为每步训练独立奖励模型需要额外标注数据,且领域迁移困难
自蒸馏OPSD, SDPO教师提供 per-token 监督稀疏信号通过教师变密,但PI偏见问题
答案回溯信用分配ABSeeker(本文)从答案逆向恢复线索→步级评分无需额外标注,利用答案本身蕴含的线索结构

定位结论

ABSeeker 处于"密集奖励分配"和"答案导向推理"的交叉点。它的突破在于:不依赖外部奖励模型或人工标注,而是利用问题-答案对本身蕴含的中间线索结构,自动生成步级监督信号。


三、问题定义

从具体场景到抽象本质

具体问题:如何训练一个能执行多步搜索的 Agent,使其在 BrowseComp 等长程搜索基准上达到高准确率?

抽象问题:给定一个模糊查询 $q$ 和其正确答案 $a^*$,以及 Agent 在 $q$ 上执行的一条搜索轨迹 $\tau = (s_1, s_2, ..., s_T)$(每步 $s_t$ 包含搜索查询、检索结果、推理等),如何为每一步 $s_t$ 分配一个分数 $r_t$,使得:

$$r_t \propto P(\text{step } s_t \text{ contributes to reaching } a^* \mid q, a^*)$$

这个抽象的精妙之处:它将"轨迹级正确/错误"的二值信号,转化为"每一步对达成答案的贡献度"的连续信号。关键挑战在于——如何在不依赖外部标注的情况下计算 $r_t$?


四、问题解法

ABSeeker 的核心框架称为 ABC(Answer-Backtracked Credit Assignment),包含两个关键组件:

4.1 答案回溯线索恢复(Answer-Backtracked Clue Recovery, ABCR)

类比:就像刑侦中的"倒推法"——从犯罪结果出发,逆向推导需要哪些中间证据。

具体做法:

  • 输入:模糊查询 $q$ + 正确答案 $a^*$
  • 利用 LLM 自身能力,从 $a^*$ 逆向推导:要得到这个答案,需要知道哪些中间线索?
  • 输出:一组中间线索 $\{c_1, c_2, ..., c_K\}$

例如,查询"2025年哪个国家首次实现了XX技术",答案"巴西"。ABCR 会推导:要知道是巴西,需要知道(1)该技术的定义(2)各国研发时间线(3)巴西的关键里程碑等。

4.2 线索锚定步级评分(Clue-Anchored Step Scoring, CASS)

类比:就像老师批改解题过程——不只看最终答案对不对,而是逐步检查"这一步有没有用到一个必要的中间公式"。

具体做法:

  • 对轨迹中的每一步 $s_t$,检查它是否与某个线索 $c_k$ 相关
  • 如果该步的内容帮助建立了某个线索,得正分
  • 如果该步是冗余或错误信息,得低分或零分
  • 最终将线索匹配度转化为步级奖励 $r_t$

4.3 训练框架

基于步级分数 $r_t$,ABSeeker 构建两种训练信号:

训练方式名称机制
SFT 侧ABC-SFT用 $r_t$ 重加权每步的损失——有用步骤的损失权重高,冗余步骤权重低
RL 侧ABC-GRPO用 $r_t$ 作为 GRPO 中的步级奖励,替代传统的轨迹级 0/1 奖励

全景对比

方法信号粒度是否需要外部标注是否利用答案结构失败轨迹中的有用步骤
标准 SFT轨迹级需要(成功轨迹)否被丢弃
标准 GRPO轨迹级不需要否被丢弃
PRM步级需要(步级标注)否可部分恢复
ABC步级不需要是可恢复

五、评估指标与实验证据

主指标

指标含义ABSeeker (4B)最强同规模 Agent更大规模 Agent (~30B)
BrowseComp英文浏览搜索准确率55.3%(+上下文管理)37.3%(无上下文管理)~55% 级别
BrowseComp-ZH中文浏览搜索准确率52.9%(+上下文管理)39.1%(无上下文管理)~53% 级别

实验设计分析

为什么这些指标能证明核心论点?

  1. 4B 匹配 30B:如果步级信用分配只是均匀训练的增量改进,4B 模型不可能匹配 30B 级别。这直接证明了"密集步级信号"让小模型学到了更多——因为每一步的训练信号都被精确利用了。

  2. 仅用 8.5k 训练样本:传统方法需要大量成功轨迹才能学到有效的搜索策略。ABSeeker 用极少数据即超越,说明答案回溯提供的信号质量远高于简单的成功/失败标签。

  3. 上下文管理增益:从 37.3% → 55.3% 的跳升说明,即使模型搜索能力强,也需要有效的上下文管理来在推理时利用搜索结果。这暗示训练和推理时的能力是互补的。

训练基座

  • 基于 Qwen3.5-4B 微调
  • 训练数据:8.5k 样本(查询-答案对 + 搜索轨迹)

六、效果优势的根源解释

因果链:为什么步级信用分配优于均匀轨迹训练?

Step 1:方法差异

  • 均匀训练:所有步骤获得相同权重/奖励
  • ABC:每步获得基于线索匹配的差异化分数

Step 2:机制变化

  • 均匀训练的瓶颈:在失败轨迹中,所有步骤都被标记为"失败"(RL)或整条轨迹被丢弃(SFT),即使其中包含有价值的关键搜索步骤
  • ABC 的改变:从答案逆向恢复线索后,即使整条轨迹失败了,其中帮助建立了关键线索的步骤仍获得正分

Step 3:指标提升

  • 训练信号密度大幅增加:原来只有轨迹级 1 个信号,现在每步都有信号
  • 有效信号利用率提升:失败轨迹中的有用步骤不再被浪费
  • 小模型受益更大:4B 模型参数容量有限,密集信号使其每个参数都能学到更精确的策略

反事实推理

如果去掉答案回溯(即不恢复中间线索),仅用轨迹级奖励:这就是标准 GRPO,4B 模型无法匹配 30B。如果去掉步级评分但保留线索:模型知道"需要什么"但不知道"哪一步在做什么",信号仍然稀疏。两者缺一不可。


七、必要知识反推

领域知识层

  • 搜索 Agent 的工作机制:多步搜索-检索-验证-整合的完整流程
  • BrowseComp 基准:评测长程浏览搜索能力的标准,查询设计为需要深度多步搜索才能回答
  • RLVR 的稀疏奖励问题:可验证奖励信号天然稀疏,如何密集化是核心挑战

方法论知识层

  • GRPO(Group Relative Policy Optimization):当前主流的 RL 训练方法,通过组内相对优势计算策略梯度
  • 信用分配(Credit Assignment):强化学习中的经典难题——如何将最终奖励分配到中间动作
  • 线索恢复的可行性:LLM 能否从答案逆向推导中间步骤——这依赖于 LLM 的思维链推理能力

知识融合的关键节点

创造性洞察:答案 $a^*$ 不仅是一个验证标签,它本身蕴含了解题过程的"逆映射"。通过让 LLM 扮演"解题者"角色从 $a^*$ 倒推,就把验证信号变成了结构化的中间监督。这是逆向工程思维在 Agent 训练中的首次系统应用。


八、论文中可以提取的通用性灵感

灵感 1:答案蕴含逆映射

核心思想:在监督学习中,标签 $y^*$ 不仅用于验证预测是否正确,它还蕴含了从输入到输出的"逆路径"。

论文证据:ABSeeker 从 $a^*$ 逆向恢复线索 $\{c_k\}$,将验证标签转化为结构化中间监督。

推广场景:

  1. 代码生成:从正确代码逆向推导中间算法步骤,训练代码 Agent 的步级信用
  2. 数学推理:从最终答案逆向推导中间引理,为 CoT 的每一步分配信用
  3. 机器人规划:从目标状态逆向推导必要子目标,为轨迹中的每步动作评分

灵感 2:失败中的成功信号

核心思想:在多步任务中,即使最终失败,中间步骤也可能包含有价值的行为。关键是设计一种机制来"提取"这些价值。

论文证据:ABC 让失败轨迹中的有用搜索步骤获得正分,避免了"一败俱败"的信号浪费。

推广场景:

  1. 多轮对话系统:即使最终未解决用户问题,某些对话轮次可能建立了有用的上下文
  2. 科研实验:即使实验未达预期结果,某些实验步骤可能验证了重要的中间假设
  3. 产品开发:即使产品最终失败,某些技术决策可能值得保留和复用

灵感 3:标签即结构

核心思想:在 AI 训练中,验证标签不应该只是二值信号(对/错),而应该被视为蕴含解题过程结构的富信息源。

论文证据:ABCR 将"对/错"标签转化为"需要哪些中间线索"的结构化信号。

推广场景:

  1. RLHF:人类反馈不只是"好/坏",可逆向推导人类偏好的中间维度
  2. 数据增强:从标签出发逆向生成训练数据中的中间步骤标注
  3. 课程学习:从最终目标逆向构建由易到难的学习序列