GPS: Graph-Guided Proactive Information Seeking in Large Language Models —— 精读
论文链接:https://openreview.net/pdf/4c4dfef02a754b3fc0615f3dd5809fef938b4e8c.pdf
发表会议:ICLR 2026(International Conference on Learning Representations,深度学习领域顶级会议)
发表机构:北京大学计算机学院、北京大学软件工程国家工程研究中心、北京大学高可信软件技术教育部重点实验室、北京大学前沿计算研究中心、北京大学信息技术学院(天津滨海)、南湖实验室大数据技术研究中心
作者:李瑞清、许益峰、江鑫科、杨志邦、马新宇、方悦、赵俊峰*、王亚沙*、褚旭*
备注:三位通讯作者(赵俊峰、王亚沙、褚旭),均来自北京大学计算机学院。本文属北京大学校内团队独立完成,无企业合著。
一、论文背景
1.1 RAG 系统与"不充分查询"问题
在大模型技术蓬勃发展的今天,检索增强生成(Retrieval-Augmented Generation,RAG) 已经成为让大语言模型(LLM)获取外部知识、减少"幻觉"的主流范式。其基本思路是:用户提出问题 → 系统从知识库中检索相关文档 → 将文档和问题一起喂给 LLM → LLM 生成答案。
然而,RAG 系统隐含了一个致命假设——用户的问题包含足够的信息来得到明确答案。但现实远非如此。用户往往因为领域知识不足、或者天然倾向于省略"自以为不重要"的细节(这在语言学中被称为 Zipf 的"最小努力原则"),导致提出的问题缺乏关键信息,即不充分查询(underspecified query)。
举个例子,假设一个英国政府网站上写着关于"残疾津贴"的领取规则:
如果你领取了与收入相关的就业与支持津贴(ESA),则不能领取残疾津贴。 如果你满足以下条件之一,可以领取:
- 未达到养老金年龄
- 正在领取残疾生活津贴(DLA)
- 已经无法工作至少一年
一个用户问:“我没有在工作,能领取残疾津贴吗?”
看起来很简单,但实际上这个问题的答案取决于多个用户自身的信息:是否领取了 ESA?年龄是否达到养老金年龄?是否有 DLA?工作能力状态如何?如果缺少这些信息,LLM 可能给出一个看似合理但实际错误的答案。这就是"不充分查询"的典型场景——问题本身不足以推导出正确答案。
1.2 “主动追问”:一个看似简单的解决方案
面对不充分查询,一个自然的思路是:让 LLM 学会"主动追问"——像人类客服一样,发现信息不足时主动提问以补充必要信息。
这个方向近年来吸引了大量研究,但现有方法存在显著缺陷:
提示词方法(Prompting):通过精心设计的提示词引导 LLM 逐步识别歧义、生成追问问题。但这类方法完全依赖 LLM 自身的推理能力,小模型往往力不从心,而且随着对话轮次增加,容易遭遇"中间遗忘"问题——即 LLM 容易忽略对话历史中间的关键信息。
微调方法(Fine-tuning):使用标注的多轮澄清对话数据来训练模型。但人工标注成本高昂,而自动采样的方法又缺乏对追问空间的约束,导致模型可能提出无关或冗余的问题。
1.3 核心洞察:被忽视的条件推理结构
本文提出了一个关键的洞察:领域文档中的知识通常以"条件规则"(if-then 规则)的形式编码。比如上面的残疾津贴规则,本质上就是一组条件语句的组合。如果能显式提取并建模这些条件推理结构,就能系统地识别所有相关条件,并引导追问对话高效进行。
这个洞察将"追问"从一个开放的对话问题,转化为一个结构化的推理和遍历问题——这正是本文方法 GPS 的核心出发点。
二、论文定位与关联工作
2.1 研究领域定位
GPS 处于两个研究方向的交叉地带:
方向一:LLM 的主动澄清(Proactive Clarification)
这个方向旨在让大模型在遇到不明确信息时,能主动提出澄清问题。代表性工作包括:
| 方法 | 类型 | 核心思路 | 局限 |
|---|---|---|---|
| CLAM (Kuhn et al., 2023) | 提示词 | 利用 LLM 的推理能力迭代识别歧义 | 依赖模型能力,小模型效果差 |
| ProCoT (Deng et al., 2023) | 提示词 | 使用思维链引导主动对话 | 对话历史增长后易丢失关键信息 |
| STAR-GATE (Andukuri et al., 2024) | 微调 | 自采样对话数据 + 精度过滤 | 无追问空间约束,可能冗余 |
| Tell Me More (Qian et al., 2024) | 微调 | 人工标注多轮对话数据 | 标注成本高 |
| UoT (Hu et al., 2024) | 树搜索 | 基于不确定性的信息搜索 | 缺乏全局条件结构建模 |
| Clarify-DPO (Chen et al., 2024) | 偏好优化 | 基于动作的对比自训练 | 仍是对话视角,缺乏结构化推理 |
方向二:基于图的推理(Graph-based Reasoning)
这个方向探索用结构化图表示来增强推理能力,代表性工作包括:
- Query2Box (Ren et al., 2020):将多跳逻辑查询嵌入向量空间进行知识图谱推理
- Graph of Thoughts (Besta et al., 2024):用图结构组织 LLM 的推理过程
- GNN 知识注入 (Li et al., 2025):通过图神经网络将知识图谱编码注入 LLM
但上述图推理方法主要面向信息充分的多跳推理,不涉及主动追问。GPS 则是首个将图结构推理与主动追问相结合的工作。
2.2 GPS 在研究版图中的位置
GPS 的定位可以概括为:
主动澄清研究 ← GPS → 图结构推理研究
↑ ↑
现有方法 现有方法
缺乏对条件 面向充分信息
规则的结构化建模 不涉及追问
GPS 站在这两个方向的交汇点上,填补了一个重要空白——利用文档中的条件规则结构来引导主动追问。它与 UoT 的"不确定性驱动"追问形成鲜明对比:UoT 是"盲人摸象式"的不确定性估计,而 GPS 是"有地图导航式"的结构化遍历。
三、问题定义
3.1 从具体问题到抽象问题
论文面对的具体问题是:用户在 RAG 系统中提出的问题往往信息不充分,LLM 如何主动追问以获取关键信息?
问题的本质抽象如下:
给定:
- 用户查询 $q$
- 检索到的相关文档 $d$
- 用户隐藏的背景信息 $S$(LLM 不可见)
文档 $d$ 中隐含着一组条件变量 $C_d = \\{c_1, c_2, ..., c_k\\}$,每个条件变量取有限个值。根据用户查询 $q$,这些条件变量被分为:
- 已知条件 $C_{known}(q)$:查询中已经明确提供的条件值
- 缺失条件 $C_{miss}(q)$:尚未提供但对确定答案必需的条件值
最终答案 $a$ 由缺失条件 $C_{miss}(q)$ 通过文档中编码的隐含逻辑约束 $R$ 来决定。
核心目标:让 LLM 能主动、高效地获取 $C_{miss}(q)$ 中各条件的值,从而推导出无歧义的答案。
3.2 问题的三个关键挑战
论文将上述抽象目标进一步拆解为三个具体挑战:
C1(结构设计):如何设计一个既能捕获所有逻辑依赖、又能保持计算可行性的推理结构?这个结构需要足够表达力来表示任意布尔函数,又需要足够高效以支持实时交互。
C2(数据稀缺):如何训练模型来提取上述结构?现有数据集几乎不包含不充分查询及其缺失条件的标注。
C3(效率优化):如何优化所提取的结构,使其同时兼顾正确性和效率?即不能无限制地追问,也不能遗漏关键条件。
四、问题解法
GPS(Graph-guided Proactive information Seeking)是一个两阶段框架,分为推理阶段(Reasoning Stage) 和 澄清阶段(Clarification Stage),外加一套训练优化方案。
4.1 推理阶段:条件推理 DAG 构建
4.1.1 什么是条件推理 DAG?
GPS 的核心创新是一种叫做**条件推理有向无环图(Conditional Reasoning DAG)**的结构。
通俗理解:想象一棵决策树,但比决策树更灵活——
- 非叶节点:代表一个需要向用户确认的"条件"(如"你是否领取了 ESA?")
- 边:代表用户可能的回答(如"是"或"否")
- 叶节点:代表最终的结论/答案
与普通决策树不同的是,这个 DAG 允许节点共享——当多条推理路径经过同一个条件判断时,只需一个节点表示,而非重复创建。这使得结构更加紧凑高效。
形式化定义:DAG $G = (N, E)$,其中:
- 节点集 $N$:包含条件节点 $n_{c_i}$(对应用户条件变量 $c_i$)和结论节点 $n_{a_m}$(对应可能答案 $a_m$)
- 边集 $E$:每条边 $e_{i,j} = (n_{c_i}, n_{c_j}, \nu)$ 标注了前驱节点的条件值 $\nu$
- 逻辑关系:单前驱节点之间是 AND 关系(需同时满足),多前驱节点之间是 OR 关系(满足其一即可)
理论保证(命题 1):论文证明了,对于任意有限值域上的布尔函数,都可以构建一个条件推理 DAG,使得每条从根到叶的路径恰好编码了该函数析取范式(DNF)中的一个合取项。这意味着 DAG 能够逻辑完备地表示文档中所有的条件规则。
4.1.2 DAG 如何构建?
构建过程由一个 Reasoner LLM(推理器)完成:
- 将用户查询 $q$ 和检索到的文档 $d$ 输入 Reasoner
- Reasoner 通过精心设计的 Prompt,从文档中提取所有条件依赖的规则
- 输出一个结构化的 DAG 描述(JSON 格式的节点和边列表)
例如,对于前文的残疾津贴问题,Reasoner 会构建如下 DAG:
[Cond1: 你是否领取ESA?]
├── 是 → [结论: 不能领取]
└── 否 → [Cond2: 是否未达养老金年龄?]
├── 是 → [结论: 可以领取]
└── 否 → [Cond3: 是否领取DLA?]
├── 是 → [结论: 可以领取]
└── 否 → [Cond4: 是否无法工作超1年?]
├── 是 → [结论: 可以领取]
└── 否 → [结论: 不能领取]
4.2 澄清阶段:基于遍历的动态澄清
有了 DAG “导航图"后,澄清阶段就像沿着这个图进行一次有策略的旅行。
4.2.1 动态遍历算法
这个算法可以类比为"带剪枝的图遍历”:
- 初始化:从 DAG 中识别出哪些条件用户已经在查询中给出了($C_{known}$),并确定还需要追问的候选条件集合
- 选择最优追问:在每一步,从剩余候选条件中,选择一个信息增益最大的条件来追问——即选择能让剩余可能结论数量减少最多的那个条件
- 获得用户回答:根据用户的回答,沿着 DAG 中对应的边前进,同时剪掉与用户回答不一致的分支
- 迭代:重复上述过程,直到只剩下一个可能的结论(即得到了明确答案)
信息增益的计算:论文定义了一个选择函数,优先选择那些能让"叶节点熵减"最大的条件。直观理解就是:优先问最能缩小答案范围的问题。
效率分析:虽然最坏情况下需要追问 $k$ 次($k$ 是条件总数),但由于 DAG 的节点共享和动态剪枝机制,实际平均追问次数约为 $O(r)$,其中 $r$ 是到达某个结论所需的平均条件数,通常 $r \ll k$。
4.2.2 一个完整的运行示例
以残疾津贴问题为例,假设用户问"我没有在工作,能领取残疾津贴吗?",且用户背景为:不领取 ESA、已过养老金年龄、不领取 DLA、无法工作 2 年:
| 追问轮次 | 问题 | 用户回答 | 剩余可能结论 |
|---|---|---|---|
| 1 | 是否领取 ESA? | 否 | {可以领取, 不能领取} |
| 2 | 是否未达养老金年龄? | 否 | {可以领取, 不能领取} |
| 3 | 是否领取 DLA? | 否 | {可以领取, 不能领取} |
| 4 | 是否无法工作超 1 年? | 是 | {可以领取} ✓ |
经过 4 轮追问后,只剩一个结论:可以领取。系统据此给出最终答案。
4.3 训练优化:让 Reasoner 更好地构建 DAG
仅有框架还不够——如果 Reasoner 构建的 DAG 质量差(比如遗漏了关键条件、或者包含冗余分支),整个系统都会出错。因此论文提出了两个关键优化:
4.3.1 条件路径引导的数据合成(Conditional Path Guided Data Synthesis)
问题:缺乏训练数据。现有的问答数据集几乎不包含"不充分查询 + 缺失条件标注"。
解决方案:创造一个自动化的数据合成流水线:
- 逻辑结构提取:使用 DeepSeek-R1(一个强大的推理模型)从文档中提取多条件决策问题的逻辑结构,包括问题、条件列表、以及不同条件组合对应的答案
- 路径采样:基于提取出的逻辑结构,采样不同的条件组合路径
- 数据生成:为每条路径生成(问题, 文档, 答案, 缺失条件集)的四元组
- 质量验证:使用 Verifier LLM 检查生成数据的准确性
这个方法的核心创新在于**“条件路径引导”**——不是随机生成问答对,而是先提取出逻辑结构,然后沿着不同的条件路径系统地生成数据。这确保了合成数据覆盖了文档中所有的条件组合情况。
4.3.2 面向澄清的强化学习(Clarification-oriented RL)
有了训练数据后,还需要一个有效的训练方法。论文使用强化学习(RL)来优化 Reasoner,核心是一个精心设计的混合奖励函数:
奖励 = 准确性奖励 + 效率奖励 + 结构质量奖励
准确性奖励 $R_{acc}$:最终答案是否正确。用 LLM 判断预测答案与标准答案是否语义一致(1 或 0)。
效率奖励 $R_{eff}$:追问效率如何。使用 SWCT(Success Weighted by Completion Time) 指标,即成功率和追问轮次归一化值的乘积。追问越少、效率越高,奖励越大。
结构质量奖励 $R_\eta$:DAG 本身的结构质量。这是一个创新性指标,定义为:
$$r_\eta = \frac{H_{leaf}}{H_{graph}}$$其中 $H_{leaf}$ 是叶节点的熵(衡量结论空间的大小),$H_{graph}$ 是整个图的分裂熵(衡量中间条件引入的不确定性)。理想情况下,每一步追问都应该有效减少结论空间的不确定性,即 $r_\eta$ 接近 1。
训练过程:采用 GRPO(Group Relative Policy Optimization)算法进行 RL 训练。对于每个输入,Reasoner 生成一组 DAG 候选,每个 DAG 经过模拟澄清后得到混合奖励,然后用相对排名来更新模型参数。
4.4 实验结果
4.4.1 基准测试
论文在三个基准数据集上进行了评估:
| 数据集 | 描述 | 特点 |
|---|---|---|
| Synthetic | 基于 ConditionalQA 文档合成的 515 条测试数据 | 专门针对不充分查询 |
| ConditionalQA | 包含条件答案的复杂阅读理解数据集 | 域内评估 |
| ShARC | 基于规则的澄清对话数据集 | 域外泛化评估 |
4.4.2 主要结果
以 Qwen2.5-7B-Instruct 为基础模型:
| 方法 | Synthetic SR↑ | Synthetic AT↓ | CQA SR↑ | CQA AT↓ | ShARC SR↑ | ShARC AT↓ |
|---|---|---|---|---|---|---|
| Base Method | 42.9 | 1.0 | 58.5 | 1.0 | 60.4 | 1.0 |
| ProCoT | 49.3 | 4.8 | 55.9 | 3.5 | 60.6 | 3.3 |
| UoT | 55.5 | 4.3 | 46.3 | 3.7 | 66.7 | 3.6 |
| Clarify-DPO | 57.3 | 2.8 | 57.2 | 2.3 | 82.7 | 2.4 |
| GPS | 72.0 | 2.7 | 63.3 | 2.5 | 73.8 | 2.7 |
SR = Success Rate(成功率,越高越好);AT = Average Turns(平均追问轮次,越低越好)
关键发现:
- GPS 在成功率上平均超过最强基线 7.5%
- 追问效率提升 4.2%(更少的追问轮次达到更好的效果)
- 在域外泛化测试(ShARC)上同样表现优秀
4.4.3 消融实验
论文通过消融实验验证了各组件的贡献:
| 配置 | SR | AT |
|---|---|---|
| GPS(完整) | 72.0 | 2.7 |
| 去掉结构质量奖励 | 69.9 | 2.8 |
| 去掉全部 RL | 67.0 | 2.8 |
| 去掉条件路径数据合成 | 65.3 | 3.0 |
| 使用随机追问策略 | 70.1 | 3.5 |
结论:每个组件都不可或缺,其中数据合成和强化学习贡献最大。
五、必要知识反推
假设让一个完全没有相关知识的人来完成这项工作,他需要掌握哪些知识和信息?以下从"发现问题到解决问题"的角度进行反推分析。
5.1 发现问题所需的知识
1. RAG 系统的工作原理与缺陷认知
必须理解 RAG(检索增强生成)的基本流程,以及"用户查询不充分"这一普遍现象。这需要对实际 RAG 应用的观察和用户行为分析——用户常常提出模糊问题,不是因为他们不关心,而是因为缺乏领域知识或省力倾向。
2. 条件规则在领域文档中的普遍性
必须洞察到:政策文档、法律条文、产品手册等领域的知识,通常以"如果…那么…“的条件规则形式编码。这不是显而易见的——需要有人明确指出这一点,并将其作为解决问题的切入点。
3. 现有追问方法的瓶颈
必须了解现有两类方法(提示词方法和微调方法)的根本局限:提示词方法受限于模型能力,微调方法受限于数据质量和搜索空间约束。
5.2 解决问题所需的知识
4. 有向无环图(DAG)与逻辑完备性
必须掌握图论中的 DAG 概念,以及布尔逻辑中的**析取范式(DNF)**理论。论文证明了 DAG 可以逻辑完备地表示任意布尔函数——这个理论保证是一切后续工作的基石。这需要离散数学和布尔代数的基础知识。
5. 图遍历与剪枝策略
必须了解图遍历算法(如 BFS、DFS)以及动态剪枝的思想。在此基础上,需要能够设计信息论驱动的选择策略(如基于熵的条件选择),这需要信息论的基础知识(熵、信息增益等)。
6. 强化学习与策略优化
必须掌握强化学习在 LLM 训练中的应用,特别是 GRPO(Group Relative Policy Optimization)等策略优化方法。此外需要设计多维度奖励函数的能力——将准确性、效率和结构质量统一到一个奖励框架中。
7. 数据合成与质量验证
必须了解如何利用更强的 LLM(如 DeepSeek-R1)进行逻辑结构提取和数据合成,以及如何设计验证机制确保合成数据的质量。这需要对 LLM 能力边界的理解。
8. 条件路径引导的合成策略
这是一个创新性的知识融合——需要将逻辑结构提取与数据合成结合,形成"先提取逻辑结构,再沿路径采样"的合成策略。
5.3 知识融合链路
发现问题:
RAG缺陷认知 + 用户行为观察 → "用户查询不充分"问题
+ 领域文档中条件规则的普遍性洞察 → 将"追问"转化为"结构化推理"
解决问题:
图论(DAG) + 布尔逻辑(DNF) → 条件推理DAG的理论基础
+ 信息论(熵/信息增益) → 最优追问选择策略
+ 图遍历 + 动态剪枝 → 高效澄清算法
训练优化:
强化学习 + 多维度奖励设计 → 面向澄清的RL训练
+ 强推理LLM(R1) + 逻辑结构提取 → 条件路径数据合成
最终融合:理论保证(完备性) × 高效算法(剪枝) × 数据驱动(RL训练) = GPS框架
六、论文中可以提取的通用性灵感
灵感 1:将隐含结构显式化
GPS 的核心思想是将文档中隐含的条件规则提取为显式的图结构,然后基于图结构进行推理。
通用性启示:在许多 AI 任务中,信息往往是隐式存在的(如文档中的逻辑关系、代码中的依赖关系、用户行为中的偏好模式)。将这些隐式信息显式化为结构化表示,往往能大幅提升系统的可控性和效果。
可推广领域:代码审查中的隐式规则提取、医疗诊断中的隐式因果链建模、产品推荐中的隐式偏好图构建。
灵感 2:用 DAG 的节点共享提升效率
GPS 中的 DAG 允许多条推理路径共享节点,这意味着同一个条件判断只需执行一次,其结果可以被多条路径复用。
通用性启示:在需要处理多分支决策或多路径推理的场景中,识别和共享公共子结构是一种通用的效率优化策略。这类似于编程中的公共子表达式消除、数据库中的查询优化。
可推广领域:多 Agent 协作中的任务去重、知识图谱推理中的公共路径共享、编译优化中的公共子表达式消除。
灵感 3:结构质量作为学习信号
论文提出的结构质量奖励 $r_\eta = H_{leaf}/H_{graph}$ 是一个精妙的设计——它衡量的是"中间推理步骤是否真正有助于区分最终结论”,而不仅仅是"最终结论是否正确"。
通用性启示:在训练 AI 系统时,不应只关注最终结果的正确性,还应该关注中间过程的质量。一个好的中间过程应该是"高效的"——每一步都在有效地缩小目标空间。这种"过程质量"的思想可以广泛应用于需要多步推理的场景。
可推广领域:Chain-of-Thought 推理中的步骤质量评估、对话系统中的对话策略优化、搜索算法中的剪枝策略学习。
灵感 4:条件路径引导的数据合成
论文不是随机生成训练数据,而是先提取出逻辑结构,再沿着不同的条件路径系统地采样。这确保了数据的结构覆盖性——每一种可能的条件组合都被覆盖到。
通用性启示:在数据增强和合成数据生成中,与其随机采样,不如先理解问题的结构,再基于结构进行系统性采样。这类似于软件测试中的"组合覆盖测试"思想。
可推广领域:代码测试用例的路径覆盖生成、对话系统的场景覆盖数据合成、自动驾驶的边界场景数据生成。
灵感 5:面向任务的混合奖励设计
GPS 的奖励函数将三个不同维度的信号(准确性、效率、结构质量)融合为一个统一的奖励,而且这三个维度分别对应了不同层面的需求——用户需要正确答案(准确性)、不希望被反复追问(效率)、推理过程应该清晰有效(结构质量)。
通用性启示:在用 RL 优化 AI 系统时,多维度混合奖励往往比单一奖励更有效。关键在于:每个维度应该直接对应一个具体的、可衡量的需求,而非笼统的"好"或"坏"。
可推广领域:代码生成(正确性 + 可读性 + 效率)、机器翻译(准确性 + 流畅性 + 术语一致性)、AI Agent 规划(目标达成 + 步骤效率 + 安全性)。
灵感 6:从"不确定性驱动"到"结构驱动"的范式转换
GPS 与之前最强的追问方法 UoT 的根本区别在于:UoT 是基于不确定性估计来决定问什么(“我觉得答案不确定,让我问个问题”),而 GPS 是基于已知的结构来决定问什么(“我知道文档里有这些条件,让我按图索骥地确认”)。
通用性启示:在许多 AI 问题中,当存在可提取的结构化知识时,利用结构比利用统计信号更可靠。不确定性是"被动反应"的——不确定了才问;结构是"主动规划"的——提前知道要问什么。这种从"反应式"到"规划式"的范式转换具有普适价值。
可推广领域:知识图谱问答(从"猜测意图"到"结构化查询")、故障诊断(从"试错排查"到"沿故障树排查")、教育系统(从"随机出题"到"沿知识图谱精准定位薄弱点")。
七、总结
GPS 这篇论文的核心贡献在于:首次将文档中的条件规则结构显式建模为 DAG,并利用图遍历策略引导 LLM 进行高效追问。它不仅在技术上实现了"逻辑完备 + 高效剪枝"的双重目标,还提供了一套完整的从数据合成到强化学习的训练方案。
从更宏观的视角看,GPS 代表了一种重要的研究范式——将隐式的领域知识显式化为可计算的结构,然后基于结构进行系统化推理。这种范式不仅适用于追问场景,在代码智能、知识推理、系统诊断等多个领域都有广阔的应用前景。
作为 ICLR 2026 的录用论文,GPS 在问题定义的清晰性、方法的系统性、理论保证的严谨性和实验的充分性上都达到了很高的水准,是 RAG 系统主动追问方向的重要推进。