GPS: Graph-Guided Proactive Information Seeking in Large Language Models —— 精读

论文链接:https://openreview.net/pdf/4c4dfef02a754b3fc0615f3dd5809fef938b4e8c.pdf

发表会议:ICLR 2026(International Conference on Learning Representations,深度学习领域顶级会议)

发表机构:北京大学计算机学院、北京大学软件工程国家工程研究中心、北京大学高可信软件技术教育部重点实验室、北京大学前沿计算研究中心、北京大学信息技术学院(天津滨海)、南湖实验室大数据技术研究中心

作者:李瑞清、许益峰、江鑫科、杨志邦、马新宇、方悦、赵俊峰*、王亚沙*、褚旭*

备注:三位通讯作者(赵俊峰、王亚沙、褚旭),均来自北京大学计算机学院。本文属北京大学校内团队独立完成,无企业合著。


一、论文背景

1.1 RAG 系统与"不充分查询"问题

在大模型技术蓬勃发展的今天,检索增强生成(Retrieval-Augmented Generation,RAG) 已经成为让大语言模型(LLM)获取外部知识、减少"幻觉"的主流范式。其基本思路是:用户提出问题 → 系统从知识库中检索相关文档 → 将文档和问题一起喂给 LLM → LLM 生成答案。

然而,RAG 系统隐含了一个致命假设——用户的问题包含足够的信息来得到明确答案。但现实远非如此。用户往往因为领域知识不足、或者天然倾向于省略"自以为不重要"的细节(这在语言学中被称为 Zipf 的"最小努力原则"),导致提出的问题缺乏关键信息,即不充分查询(underspecified query)。

举个例子,假设一个英国政府网站上写着关于"残疾津贴"的领取规则:

如果你领取了与收入相关的就业与支持津贴(ESA),则不能领取残疾津贴。 如果你满足以下条件之一,可以领取:

  • 未达到养老金年龄
  • 正在领取残疾生活津贴(DLA)
  • 已经无法工作至少一年

一个用户问:“我没有在工作,能领取残疾津贴吗?”

看起来很简单,但实际上这个问题的答案取决于多个用户自身的信息:是否领取了 ESA?年龄是否达到养老金年龄?是否有 DLA?工作能力状态如何?如果缺少这些信息,LLM 可能给出一个看似合理但实际错误的答案。这就是"不充分查询"的典型场景——问题本身不足以推导出正确答案。

1.2 “主动追问”:一个看似简单的解决方案

面对不充分查询,一个自然的思路是:让 LLM 学会"主动追问"——像人类客服一样,发现信息不足时主动提问以补充必要信息。

这个方向近年来吸引了大量研究,但现有方法存在显著缺陷:

  • 提示词方法(Prompting):通过精心设计的提示词引导 LLM 逐步识别歧义、生成追问问题。但这类方法完全依赖 LLM 自身的推理能力,小模型往往力不从心,而且随着对话轮次增加,容易遭遇"中间遗忘"问题——即 LLM 容易忽略对话历史中间的关键信息。

  • 微调方法(Fine-tuning):使用标注的多轮澄清对话数据来训练模型。但人工标注成本高昂,而自动采样的方法又缺乏对追问空间的约束,导致模型可能提出无关或冗余的问题。

1.3 核心洞察:被忽视的条件推理结构

本文提出了一个关键的洞察:领域文档中的知识通常以"条件规则"(if-then 规则)的形式编码。比如上面的残疾津贴规则,本质上就是一组条件语句的组合。如果能显式提取并建模这些条件推理结构,就能系统地识别所有相关条件,并引导追问对话高效进行。

这个洞察将"追问"从一个开放的对话问题,转化为一个结构化的推理和遍历问题——这正是本文方法 GPS 的核心出发点。


二、论文定位与关联工作

2.1 研究领域定位

GPS 处于两个研究方向的交叉地带:

方向一:LLM 的主动澄清(Proactive Clarification)

这个方向旨在让大模型在遇到不明确信息时,能主动提出澄清问题。代表性工作包括:

方法类型核心思路局限
CLAM (Kuhn et al., 2023)提示词利用 LLM 的推理能力迭代识别歧义依赖模型能力,小模型效果差
ProCoT (Deng et al., 2023)提示词使用思维链引导主动对话对话历史增长后易丢失关键信息
STAR-GATE (Andukuri et al., 2024)微调自采样对话数据 + 精度过滤无追问空间约束,可能冗余
Tell Me More (Qian et al., 2024)微调人工标注多轮对话数据标注成本高
UoT (Hu et al., 2024)树搜索基于不确定性的信息搜索缺乏全局条件结构建模
Clarify-DPO (Chen et al., 2024)偏好优化基于动作的对比自训练仍是对话视角,缺乏结构化推理

方向二:基于图的推理(Graph-based Reasoning)

这个方向探索用结构化图表示来增强推理能力,代表性工作包括:

  • Query2Box (Ren et al., 2020):将多跳逻辑查询嵌入向量空间进行知识图谱推理
  • Graph of Thoughts (Besta et al., 2024):用图结构组织 LLM 的推理过程
  • GNN 知识注入 (Li et al., 2025):通过图神经网络将知识图谱编码注入 LLM

但上述图推理方法主要面向信息充分的多跳推理,不涉及主动追问。GPS 则是首个将图结构推理与主动追问相结合的工作。

2.2 GPS 在研究版图中的位置

GPS 的定位可以概括为:

主动澄清研究 ← GPS → 图结构推理研究
     ↑                    ↑
  现有方法               现有方法
  缺乏对条件           面向充分信息
  规则的结构化建模      不涉及追问

GPS 站在这两个方向的交汇点上,填补了一个重要空白——利用文档中的条件规则结构来引导主动追问。它与 UoT 的"不确定性驱动"追问形成鲜明对比:UoT 是"盲人摸象式"的不确定性估计,而 GPS 是"有地图导航式"的结构化遍历。


三、问题定义

3.1 从具体问题到抽象问题

论文面对的具体问题是:用户在 RAG 系统中提出的问题往往信息不充分,LLM 如何主动追问以获取关键信息?

问题的本质抽象如下:

给定:

  • 用户查询 $q$
  • 检索到的相关文档 $d$
  • 用户隐藏的背景信息 $S$(LLM 不可见)

文档 $d$ 中隐含着一组条件变量 $C_d = \\{c_1, c_2, ..., c_k\\}$,每个条件变量取有限个值。根据用户查询 $q$,这些条件变量被分为:

  • 已知条件 $C_{known}(q)$:查询中已经明确提供的条件值
  • 缺失条件 $C_{miss}(q)$:尚未提供但对确定答案必需的条件值

最终答案 $a$ 由缺失条件 $C_{miss}(q)$ 通过文档中编码的隐含逻辑约束 $R$ 来决定。

核心目标:让 LLM 能主动、高效地获取 $C_{miss}(q)$ 中各条件的值,从而推导出无歧义的答案。

3.2 问题的三个关键挑战

论文将上述抽象目标进一步拆解为三个具体挑战:

  • C1(结构设计):如何设计一个既能捕获所有逻辑依赖、又能保持计算可行性的推理结构?这个结构需要足够表达力来表示任意布尔函数,又需要足够高效以支持实时交互。

  • C2(数据稀缺):如何训练模型来提取上述结构?现有数据集几乎不包含不充分查询及其缺失条件的标注。

  • C3(效率优化):如何优化所提取的结构,使其同时兼顾正确性和效率?即不能无限制地追问,也不能遗漏关键条件。


四、问题解法

GPS(Graph-guided Proactive information Seeking)是一个两阶段框架,分为推理阶段(Reasoning Stage) 和 澄清阶段(Clarification Stage),外加一套训练优化方案。

4.1 推理阶段:条件推理 DAG 构建

4.1.1 什么是条件推理 DAG?

GPS 的核心创新是一种叫做**条件推理有向无环图(Conditional Reasoning DAG)**的结构。

通俗理解:想象一棵决策树,但比决策树更灵活——

  • 非叶节点:代表一个需要向用户确认的"条件"(如"你是否领取了 ESA?")
  • 边:代表用户可能的回答(如"是"或"否")
  • 叶节点:代表最终的结论/答案

与普通决策树不同的是,这个 DAG 允许节点共享——当多条推理路径经过同一个条件判断时,只需一个节点表示,而非重复创建。这使得结构更加紧凑高效。

形式化定义:DAG $G = (N, E)$,其中:

  • 节点集 $N$:包含条件节点 $n_{c_i}$(对应用户条件变量 $c_i$)和结论节点 $n_{a_m}$(对应可能答案 $a_m$)
  • 边集 $E$:每条边 $e_{i,j} = (n_{c_i}, n_{c_j}, \nu)$ 标注了前驱节点的条件值 $\nu$
  • 逻辑关系:单前驱节点之间是 AND 关系(需同时满足),多前驱节点之间是 OR 关系(满足其一即可)

理论保证(命题 1):论文证明了,对于任意有限值域上的布尔函数,都可以构建一个条件推理 DAG,使得每条从根到叶的路径恰好编码了该函数析取范式(DNF)中的一个合取项。这意味着 DAG 能够逻辑完备地表示文档中所有的条件规则。

4.1.2 DAG 如何构建?

构建过程由一个 Reasoner LLM(推理器)完成:

  1. 将用户查询 $q$ 和检索到的文档 $d$ 输入 Reasoner
  2. Reasoner 通过精心设计的 Prompt,从文档中提取所有条件依赖的规则
  3. 输出一个结构化的 DAG 描述(JSON 格式的节点和边列表)

例如,对于前文的残疾津贴问题,Reasoner 会构建如下 DAG:

[Cond1: 你是否领取ESA?] 
    ├── 是 → [结论: 不能领取]
    └── 否 → [Cond2: 是否未达养老金年龄?]
                  ├── 是 → [结论: 可以领取]
                  └── 否 → [Cond3: 是否领取DLA?]
                                ├── 是 → [结论: 可以领取]
                                └── 否 → [Cond4: 是否无法工作超1年?]
                                              ├── 是 → [结论: 可以领取]
                                              └── 否 → [结论: 不能领取]

4.2 澄清阶段:基于遍历的动态澄清

有了 DAG “导航图"后,澄清阶段就像沿着这个图进行一次有策略的旅行。

4.2.1 动态遍历算法

这个算法可以类比为"带剪枝的图遍历”:

  1. 初始化:从 DAG 中识别出哪些条件用户已经在查询中给出了($C_{known}$),并确定还需要追问的候选条件集合
  2. 选择最优追问:在每一步,从剩余候选条件中,选择一个信息增益最大的条件来追问——即选择能让剩余可能结论数量减少最多的那个条件
  3. 获得用户回答:根据用户的回答,沿着 DAG 中对应的边前进,同时剪掉与用户回答不一致的分支
  4. 迭代:重复上述过程,直到只剩下一个可能的结论(即得到了明确答案)

信息增益的计算:论文定义了一个选择函数,优先选择那些能让"叶节点熵减"最大的条件。直观理解就是:优先问最能缩小答案范围的问题。

效率分析:虽然最坏情况下需要追问 $k$ 次($k$ 是条件总数),但由于 DAG 的节点共享和动态剪枝机制,实际平均追问次数约为 $O(r)$,其中 $r$ 是到达某个结论所需的平均条件数,通常 $r \ll k$。

4.2.2 一个完整的运行示例

以残疾津贴问题为例,假设用户问"我没有在工作,能领取残疾津贴吗?",且用户背景为:不领取 ESA、已过养老金年龄、不领取 DLA、无法工作 2 年:

追问轮次问题用户回答剩余可能结论
1是否领取 ESA?否{可以领取, 不能领取}
2是否未达养老金年龄?否{可以领取, 不能领取}
3是否领取 DLA?否{可以领取, 不能领取}
4是否无法工作超 1 年?是{可以领取} ✓

经过 4 轮追问后,只剩一个结论:可以领取。系统据此给出最终答案。

4.3 训练优化:让 Reasoner 更好地构建 DAG

仅有框架还不够——如果 Reasoner 构建的 DAG 质量差(比如遗漏了关键条件、或者包含冗余分支),整个系统都会出错。因此论文提出了两个关键优化:

4.3.1 条件路径引导的数据合成(Conditional Path Guided Data Synthesis)

问题:缺乏训练数据。现有的问答数据集几乎不包含"不充分查询 + 缺失条件标注"。

解决方案:创造一个自动化的数据合成流水线:

  1. 逻辑结构提取:使用 DeepSeek-R1(一个强大的推理模型)从文档中提取多条件决策问题的逻辑结构,包括问题、条件列表、以及不同条件组合对应的答案
  2. 路径采样:基于提取出的逻辑结构,采样不同的条件组合路径
  3. 数据生成:为每条路径生成(问题, 文档, 答案, 缺失条件集)的四元组
  4. 质量验证:使用 Verifier LLM 检查生成数据的准确性

这个方法的核心创新在于**“条件路径引导”**——不是随机生成问答对,而是先提取出逻辑结构,然后沿着不同的条件路径系统地生成数据。这确保了合成数据覆盖了文档中所有的条件组合情况。

4.3.2 面向澄清的强化学习(Clarification-oriented RL)

有了训练数据后,还需要一个有效的训练方法。论文使用强化学习(RL)来优化 Reasoner,核心是一个精心设计的混合奖励函数:

奖励 = 准确性奖励 + 效率奖励 + 结构质量奖励

  • 准确性奖励 $R_{acc}$:最终答案是否正确。用 LLM 判断预测答案与标准答案是否语义一致(1 或 0)。

  • 效率奖励 $R_{eff}$:追问效率如何。使用 SWCT(Success Weighted by Completion Time) 指标,即成功率和追问轮次归一化值的乘积。追问越少、效率越高,奖励越大。

  • 结构质量奖励 $R_\eta$:DAG 本身的结构质量。这是一个创新性指标,定义为:

    $$r_\eta = \frac{H_{leaf}}{H_{graph}}$$

    其中 $H_{leaf}$ 是叶节点的熵(衡量结论空间的大小),$H_{graph}$ 是整个图的分裂熵(衡量中间条件引入的不确定性)。理想情况下,每一步追问都应该有效减少结论空间的不确定性,即 $r_\eta$ 接近 1。

训练过程:采用 GRPO(Group Relative Policy Optimization)算法进行 RL 训练。对于每个输入,Reasoner 生成一组 DAG 候选,每个 DAG 经过模拟澄清后得到混合奖励,然后用相对排名来更新模型参数。

4.4 实验结果

4.4.1 基准测试

论文在三个基准数据集上进行了评估:

数据集描述特点
Synthetic基于 ConditionalQA 文档合成的 515 条测试数据专门针对不充分查询
ConditionalQA包含条件答案的复杂阅读理解数据集域内评估
ShARC基于规则的澄清对话数据集域外泛化评估

4.4.2 主要结果

以 Qwen2.5-7B-Instruct 为基础模型:

方法Synthetic SR↑Synthetic AT↓CQA SR↑CQA AT↓ShARC SR↑ShARC AT↓
Base Method42.91.058.51.060.41.0
ProCoT49.34.855.93.560.63.3
UoT55.54.346.33.766.73.6
Clarify-DPO57.32.857.22.382.72.4
GPS72.02.763.32.573.82.7

SR = Success Rate(成功率,越高越好);AT = Average Turns(平均追问轮次,越低越好)

关键发现:

  • GPS 在成功率上平均超过最强基线 7.5%
  • 追问效率提升 4.2%(更少的追问轮次达到更好的效果)
  • 在域外泛化测试(ShARC)上同样表现优秀

4.4.3 消融实验

论文通过消融实验验证了各组件的贡献:

配置SRAT
GPS(完整)72.02.7
去掉结构质量奖励69.92.8
去掉全部 RL67.02.8
去掉条件路径数据合成65.33.0
使用随机追问策略70.13.5

结论:每个组件都不可或缺,其中数据合成和强化学习贡献最大。


五、必要知识反推

假设让一个完全没有相关知识的人来完成这项工作,他需要掌握哪些知识和信息?以下从"发现问题到解决问题"的角度进行反推分析。

5.1 发现问题所需的知识

1. RAG 系统的工作原理与缺陷认知

必须理解 RAG(检索增强生成)的基本流程,以及"用户查询不充分"这一普遍现象。这需要对实际 RAG 应用的观察和用户行为分析——用户常常提出模糊问题,不是因为他们不关心,而是因为缺乏领域知识或省力倾向。

2. 条件规则在领域文档中的普遍性

必须洞察到:政策文档、法律条文、产品手册等领域的知识,通常以"如果…那么…“的条件规则形式编码。这不是显而易见的——需要有人明确指出这一点,并将其作为解决问题的切入点。

3. 现有追问方法的瓶颈

必须了解现有两类方法(提示词方法和微调方法)的根本局限:提示词方法受限于模型能力,微调方法受限于数据质量和搜索空间约束。

5.2 解决问题所需的知识

4. 有向无环图(DAG)与逻辑完备性

必须掌握图论中的 DAG 概念,以及布尔逻辑中的**析取范式(DNF)**理论。论文证明了 DAG 可以逻辑完备地表示任意布尔函数——这个理论保证是一切后续工作的基石。这需要离散数学和布尔代数的基础知识。

5. 图遍历与剪枝策略

必须了解图遍历算法(如 BFS、DFS)以及动态剪枝的思想。在此基础上,需要能够设计信息论驱动的选择策略(如基于熵的条件选择),这需要信息论的基础知识(熵、信息增益等)。

6. 强化学习与策略优化

必须掌握强化学习在 LLM 训练中的应用,特别是 GRPO(Group Relative Policy Optimization)等策略优化方法。此外需要设计多维度奖励函数的能力——将准确性、效率和结构质量统一到一个奖励框架中。

7. 数据合成与质量验证

必须了解如何利用更强的 LLM(如 DeepSeek-R1)进行逻辑结构提取和数据合成,以及如何设计验证机制确保合成数据的质量。这需要对 LLM 能力边界的理解。

8. 条件路径引导的合成策略

这是一个创新性的知识融合——需要将逻辑结构提取与数据合成结合,形成"先提取逻辑结构,再沿路径采样"的合成策略。

5.3 知识融合链路

发现问题:
  RAG缺陷认知 + 用户行为观察 → "用户查询不充分"问题
  + 领域文档中条件规则的普遍性洞察 → 将"追问"转化为"结构化推理"

解决问题:
  图论(DAG) + 布尔逻辑(DNF) → 条件推理DAG的理论基础
  + 信息论(熵/信息增益) → 最优追问选择策略
  + 图遍历 + 动态剪枝 → 高效澄清算法
  
训练优化:
  强化学习 + 多维度奖励设计 → 面向澄清的RL训练
  + 强推理LLM(R1) + 逻辑结构提取 → 条件路径数据合成
  
最终融合:理论保证(完备性) × 高效算法(剪枝) × 数据驱动(RL训练) = GPS框架

六、论文中可以提取的通用性灵感

灵感 1:将隐含结构显式化

GPS 的核心思想是将文档中隐含的条件规则提取为显式的图结构,然后基于图结构进行推理。

通用性启示:在许多 AI 任务中,信息往往是隐式存在的(如文档中的逻辑关系、代码中的依赖关系、用户行为中的偏好模式)。将这些隐式信息显式化为结构化表示,往往能大幅提升系统的可控性和效果。

可推广领域:代码审查中的隐式规则提取、医疗诊断中的隐式因果链建模、产品推荐中的隐式偏好图构建。

灵感 2:用 DAG 的节点共享提升效率

GPS 中的 DAG 允许多条推理路径共享节点,这意味着同一个条件判断只需执行一次,其结果可以被多条路径复用。

通用性启示:在需要处理多分支决策或多路径推理的场景中,识别和共享公共子结构是一种通用的效率优化策略。这类似于编程中的公共子表达式消除、数据库中的查询优化。

可推广领域:多 Agent 协作中的任务去重、知识图谱推理中的公共路径共享、编译优化中的公共子表达式消除。

灵感 3:结构质量作为学习信号

论文提出的结构质量奖励 $r_\eta = H_{leaf}/H_{graph}$ 是一个精妙的设计——它衡量的是"中间推理步骤是否真正有助于区分最终结论”,而不仅仅是"最终结论是否正确"。

通用性启示:在训练 AI 系统时,不应只关注最终结果的正确性,还应该关注中间过程的质量。一个好的中间过程应该是"高效的"——每一步都在有效地缩小目标空间。这种"过程质量"的思想可以广泛应用于需要多步推理的场景。

可推广领域:Chain-of-Thought 推理中的步骤质量评估、对话系统中的对话策略优化、搜索算法中的剪枝策略学习。

灵感 4:条件路径引导的数据合成

论文不是随机生成训练数据,而是先提取出逻辑结构,再沿着不同的条件路径系统地采样。这确保了数据的结构覆盖性——每一种可能的条件组合都被覆盖到。

通用性启示:在数据增强和合成数据生成中,与其随机采样,不如先理解问题的结构,再基于结构进行系统性采样。这类似于软件测试中的"组合覆盖测试"思想。

可推广领域:代码测试用例的路径覆盖生成、对话系统的场景覆盖数据合成、自动驾驶的边界场景数据生成。

灵感 5:面向任务的混合奖励设计

GPS 的奖励函数将三个不同维度的信号(准确性、效率、结构质量)融合为一个统一的奖励,而且这三个维度分别对应了不同层面的需求——用户需要正确答案(准确性)、不希望被反复追问(效率)、推理过程应该清晰有效(结构质量)。

通用性启示:在用 RL 优化 AI 系统时,多维度混合奖励往往比单一奖励更有效。关键在于:每个维度应该直接对应一个具体的、可衡量的需求,而非笼统的"好"或"坏"。

可推广领域:代码生成(正确性 + 可读性 + 效率)、机器翻译(准确性 + 流畅性 + 术语一致性)、AI Agent 规划(目标达成 + 步骤效率 + 安全性)。

灵感 6:从"不确定性驱动"到"结构驱动"的范式转换

GPS 与之前最强的追问方法 UoT 的根本区别在于:UoT 是基于不确定性估计来决定问什么(“我觉得答案不确定,让我问个问题”),而 GPS 是基于已知的结构来决定问什么(“我知道文档里有这些条件,让我按图索骥地确认”)。

通用性启示:在许多 AI 问题中,当存在可提取的结构化知识时,利用结构比利用统计信号更可靠。不确定性是"被动反应"的——不确定了才问;结构是"主动规划"的——提前知道要问什么。这种从"反应式"到"规划式"的范式转换具有普适价值。

可推广领域:知识图谱问答(从"猜测意图"到"结构化查询")、故障诊断(从"试错排查"到"沿故障树排查")、教育系统(从"随机出题"到"沿知识图谱精准定位薄弱点")。


七、总结

GPS 这篇论文的核心贡献在于:首次将文档中的条件规则结构显式建模为 DAG,并利用图遍历策略引导 LLM 进行高效追问。它不仅在技术上实现了"逻辑完备 + 高效剪枝"的双重目标,还提供了一套完整的从数据合成到强化学习的训练方案。

从更宏观的视角看,GPS 代表了一种重要的研究范式——将隐式的领域知识显式化为可计算的结构,然后基于结构进行系统化推理。这种范式不仅适用于追问场景,在代码智能、知识推理、系统诊断等多个领域都有广阔的应用前景。

作为 ICLR 2026 的录用论文,GPS 在问题定义的清晰性、方法的系统性、理论保证的严谨性和实验的充分性上都达到了很高的水准,是 RAG 系统主动追问方向的重要推进。