论文链接:https://arxiv.org/abs/2511.08798
发表机构:马里兰大学学院公园分校(University of Maryland, College Park)♠ + Adobe Research ⋄
作者:Manan Suri♠, Puneet Mathur⋄, Nedim Lipka⋄, Franck Dernoncourt⋄, Ryan A. Rossi⋄, Dinesh Manocha♠
🏫 产学合作重点:本文由马里兰大学的研究生 Manan Suri(第一作者)和资深教授 Dinesh Manocha 联合 Adobe Research 的五位研究员共同完成。这是典型的"高校学生 + 企业研究院"合著模式——企业提供实际应用场景和工业洞察(Adobe 的文档处理、创意工具等场景),高校提供理论深度和方法论创新。
开源代码:截至撰写时,论文未公开代码仓库和 ClarifyBench 数据集。
一、论文背景
1.1 LLM Agent 与工具调用
在进入这篇论文之前,我们需要先理解一个核心概念:LLM Agent(大型语言模型智能体)。
简单来说,LLM Agent 就是给大语言模型(如 GPT-4、Qwen 等)“装上手脚”——让它们不仅能生成文字,还能调用外部工具来完成实际任务。这些"工具"可以是搜索网页、查询数据库、预订机票、操作文件系统等外部 API(应用程序接口)。
打个比方,大语言模型就像一个博学但只能说话的顾问,而 Agent 则给这个顾问配备了电话、电脑和各种操作工具,让他能真正动手做事。例如,当用户说"帮我查一下明天北京的天气"时,Agent 不是凭借训练数据中的过时信息来猜测,而是调用真实的天气 API 获取最新数据。
工具调用(Tool Calling / Function Calling) 是实现 Agent 的核心技术。主流的做法是为每个工具定义一个"Schema"——相当于一份结构化的说明书,包含工具名称、参数名称、参数类型、取值范围和必需参数等。LLM 根据用户指令和这份说明书,选择合适的工具并填入正确的参数值。
目前,工具调用已被广泛应用于旅行规划、文档处理、金融分析、车辆控制、药物发现等领域。伯克利大学推出的 BFCL(Berkeley Function Calling Leaderboard) 基准测试就是专门评估各大模型工具调用能力的排行榜,可见该能力的重要性。
1.2 模糊指令带来的困境
然而,现实中的用户指令往往不是完美明确的。考虑以下场景:
- 模糊的任务规格:“帮我找一家好餐厅” —— 什么价位?什么菜系?哪个区域?
- 不完整的参数:“预订明天的会议” —— 几点开始?持续多久?哪些人参加?在哪个会议室?
- 隐含的能力假设:“把我昨天的文档整理一下” —— 用户默认 Agent 知道"昨天的文档"是哪个,但 Agent 其实不知道。
面对这些模糊指令,当前 LLM Agent 存在一个致命倾向:幻觉(Hallucination)。由于大语言模型的训练目标是预测下一个 token,当信息不完整时,它会倾向于"脑补"缺失的参数值,而非停下来问用户。例如,面对"预订明天的会议",Agent 可能会自作主张地编造一个时间和会议室,导致预订了一个用户根本不想要的会议。
1.3 现有方法的不足
为了让 Agent 学会"不懂就问",研究者们提出了多种方法,但都存在明显缺陷:
简单提示策略:在系统提示中告诉 Agent “如果有不清楚的地方就问用户”。这种方法缺乏判断标准——Agent 不知道什么时候该问、问什么、问几个问题就够了。实际表现要么不问就做,要么问一堆无关痛痒的问题。
Ask-before-Plan(Zhang et al., 2024):在执行任务之前先收集信息。该方法提出了一个"澄清-执行-规划"(CEP)多 Agent 框架,通过一个专门的澄清 Agent 预测需要澄清的内容。但它的澄清仍然在非结构化的自然语言空间中进行,没有利用工具 Schema 的结构化信息。
Active Task Disambiguation(Kobalczyk et al., 2025):从贝叶斯实验设计的角度,通过最大化信息增益来选择澄清问题。这是一个有理论框架的方法,但它在响应熵(response entropy) 上操作,而非直接在工具参数空间上操作,导致提问效率不高——经常问出对确定工具参数帮助不大的问题。
这些方法的共同缺陷是:它们都在非结构化的自然语言空间中操作,生成任意的文本序列作为澄清问题,而没有利用工具 Schema 中已有的结构化约束(参数名称、类型、取值范围、必需/可选等)。这就像一个维修工不去看设备说明书上的参数表,而是凭感觉问"你觉得哪里有问题"。
1.4 一个直觉性的比喻
想象你是一个餐厅服务员。客人走进来说:“给我来一份那个。”
- 最差的做法(类似 LLM 幻觉):你猜客人要的是招牌菜,直接下厨房做了端上来——大概率猜错。
- 稍微好点的做法(类似简单提示策略):你问"您想要什么?"——虽然问了,但问题太宽泛,客人也不知道从何说起。
- 更好但仍不够好的做法(类似现有澄清方法):你问"您喜欢什么口味?几个人吃?有忌口吗?"——问了一串问题,但有些是多余的,有些关键信息还没问到。
- 理想的做法(本文的思路):你心里有一份菜单的结构——有菜系、口味、价位、分量等维度。你快速判断哪个维度最不确定,就问那个维度的问题。比如客人明显是来吃中餐的(从穿着打扮判断),那菜系就确定了,不需要问;但价位和口味还不确定,而且这两个信息对推荐最关键,所以优先问这两个。
二、论文定位与关联工作
2.1 研究领域的定位
本文处于 LLM Agent 工具调用消歧(Tool-Call Disambiguation)这一研究方向的交叉点上,涉及以下多个领域:
- LLM Agent:如何让大语言模型自主使用工具完成任务
- 人机交互中的主动澄清:如何让 AI 系统主动向用户提问以消除歧义
- 决策理论与信息价值:如何量化"获取信息"的收益
- 强化学习与奖励建模:如何用不确定性信号指导模型训练
2.2 关联工作图谱
本文并非凭空出现,而是站在多个前人工作的肩膀上。我们可以用以下脉络来理解:
第一脉:LLM Agent 框架
- ReAct(Yao et al., 2022):Google Brain 提出的经典 Agent 框架,将"推理(Reasoning)“和"行动(Acting)“交替进行,形成 Reason → Act → Observe 的循环。这是当前大多数 Agent 系统的基础架构。本文的 SAGE-Agent 正是在 ReAct 循环的"推理"阶段插入结构化澄清机制。
- Plan-and-Execute:先做全局规划再逐步执行的范式。与 ReAct 的逐步推理不同,它将规划和执行解耦。
第二脉:澄清与消歧
- Ask-before-Plan(Zhang et al., 2024, EMNLP Findings):在规划之前主动预测澄清需求。提出了 CEP(Clarification-Execution-Planning)三 Agent 框架。本文在此基础上前进了一步:将澄清从"自然语言空间"搬到"工具参数空间”。
- Active Task Disambiguation(Kobalczyk et al., 2025, ICLR 2025):将任务消歧形式化为贝叶斯实验设计问题,通过最大化信息增益选择问题。本文的核心基线之一。关键区别在于:Kobalczyk 等人在响应熵上操作,而本文在工具参数域上操作。
- CollabLLM(Wu et al., 2025, ICML 2025 Outstanding Paper):将 LLM 从被动响应者转变为主动协作者的微调框架,教授模型主动提问和引导对话。本文的奖励建模工作与之相关,但侧重点不同——CollabLLM 关注通用的协作能力训练,本文关注利用结构化不确定性信号进行更高效的训练。
第三脉:信息论与决策理论
- EVPI(Expected Value of Perfect Information):决策理论中的经典概念,量化"如果我能获得某个信息的完美答案,我的决策质量能提升多少”。本文将这一经济学概念创造性地应用于工具调用的澄清问题选择。
- 次模函数优化(Submodular Optimization):次模性保证了贪心算法能获得近似最优解(边际收益递减)。本文证明了 EVPI 在工具参数空间具有次模性,从而保证了贪心问题选择的效率。
第四脉:工具调用评测基准
- BFCL(Berkeley Function Calling Leaderboard):伯克利大学维护的工具调用能力评测排行榜。本文使用了 BFCL-v3 的部分数据构建 ClarifyBench。
- τ-bench、AgentBoard、ToolSandbox、MMAU:现有的 Agent 评测基准,但它们都不支持动态多轮消歧场景。本文发布的 ClarifyBench 填补了这一空白。
2.3 本文的独特定位
本文的独特贡献在于:首次将工具调用的消歧问题从非结构化的自然语言空间搬到结构化的工具参数空间,并引入决策论中的 EVPI 作为问题选择的标准。它不是对某个单一前人工作的简单改进,而是将决策论、信息论和 Agent 系统设计这三个领域的洞见进行了有机整合。
ReAct (基础Agent框架)
│
├── Ask-before-Plan (先问再做)
│ │
├── Active Task Disambiguation (贝叶斯消歧)
│ │
└───────┼─── 本文 ─── 结构化不确定性 + EVPI
│ │
│ ├── SAGE-Agent (推理时应用)
│ ├── 不确定性引导奖励建模 (训练时应用)
│ └── ClarifyBench (评测基准)
│
CollabLLM (主动协作训练)
GRPO (强化学习训练算法)
三、问题定义
3.1 从现实问题到抽象问题
论文面对的现实问题是:用户指令模糊时,LLM Agent 应该问什么问题、问几个问题、什么时候停止提问直接执行?
这个问题看似简单,实则包含多个层次的挑战:
“问什么"涉及信息价值评估:不是所有问题都有同等价值。问"您想要什么菜系"比问"您今天心情怎么样"对餐厅推荐更有帮助。需要一个标准来衡量每个问题的"消歧价值”。
“问几个"涉及效率与充分性的平衡:问少了,信息不够,还是可能做错;问多了,用户体验差,浪费交互轮次。需要自动判断何时信息已足够。
“何时停止"需要一个可计算的停止准则:不能靠人工设定"最多问3个"这种硬编码,而需要一个基于理论的自适应标准。
3.2 论文的核心抽象
论文的关键洞察是:工具调用的消歧本质上是一个在结构化参数空间上的不确定性消除问题。
具体而言,论文做了以下抽象:
第一层抽象:将工具调用表示为结构化元组
每个工具 $T_i$ 被定义为 $(name_i, \Theta_i, \mathcal{D}_i, \mathcal{R}_i)$,其中 $\Theta_i$ 是参数集合,$\mathcal{D}_i$ 是每个参数的取值域,$\mathcal{R}_i$ 是必需参数。一次工具调用就是一个为每个参数赋值(或标记为未知)的"偏函数”。
这一抽象的意义在于:把模糊的用户指令映射到了一个明确的数学空间。不再是"语言上哪里不清晰"这种模糊概念,而是"参数 $\theta_j$ 的值未知"这种可精确操作的对象。
第二层抽象:分离两种不确定性
论文区分了两种本质不同的不确定性:
- 规格不确定性(Specification Uncertainty):用户自己也没说清楚想要什么。比如"帮我订个餐厅”——价位、菜系、位置都没给。这是"用户端的模糊"。
- 模型不确定性(Model Uncertainty):用户其实说了足够的信息,但 LLM 没理解对。比如用户说"意大利菜",但模型理解成了"意大利风格的装修"。这是"模型端的错误"。
分离这两种不确定性至关重要:面对规格不确定性,应该问用户;面对模型不确定性,应该增加推理或提高模型能力,而不是反复骚扰用户。混淆两者会导致"明明用户说了,你还在问"或者"用户没说,你却自作主张"。
第三层抽象:将"问哪个问题"转化为 EVPI 最大化
这是论文最关键的抽象——把"哪个问题最有价值"这个定性判断,转化为一个可计算的定量指标:完美信息期望价值(EVPI)。
EVPI 的直觉含义是:如果我获得了这个问题的完美答案,最优决策的期望质量能提升多少? 问题选得准,EVPI 就高(获得答案后能大幅缩小候选范围);问题选得差,EVPI 就低(答案对决策影响不大)。
同时,论文引入了冗余成本:如果一个问题涉及的方面(某个工具的某个参数)已经被问过了,就施加额外成本,防止重复提问。
最终,问题选择被形式化为:
$$q^*(t) = \arg\max_{q \in \mathcal{Q}} \left[\text{EVPI}(q, \mathcal{B}(t)) - \text{Cost}(q,t)\right]$$即:选择净信息价值最高的问题。
第四层抽象:信念状态的动态更新
论文将 Agent 对"用户到底想要什么"的判断建模为一个信念状态 $\mathcal{B}(t)$,它维护着对所有候选工具调用的概率分布。每当用户回答一个问题,信念状态就根据贝叶斯规则进行更新——符合的候选概率上升,不符合的下降。当概率最高的候选的置信度超过阈值,或者进一步提问的净收益太低时,就停止提问,直接执行。
这种建模方式本质上将工具调用消歧问题转化为一个部分可观测马尔可夫决策过程(POMDP)——Agent 无法直接观测到用户的真实意图(部分可观测),但可以通过交互(提问)逐步缩小不确定性。
四、问题解法
论文提出了两个相互补充的应用来验证其结构化不确定性框架:
4.1 SAGE-Agent:推理时的结构化澄清
SAGE-Agent(Structured Argument uncertainty Guided Elicitation Agent)是将结构化不确定性应用于 Agent 推理阶段的具体系统。
整体流程
SAGE-Agent 在经典的 ReAct 循环(Reason → Act → Observe)基础上进行改造,在"推理"阶段插入结构化的澄清机制。其核心流程如下:
Step 1:候选工具调用生成
当用户发出一条指令后,SAGE-Agent 首先让 LLM 根据用户指令和工具 Schema 生成一组候选工具调用。每个候选调用可能为某些参数指定了具体值,而将不确定的参数标记为 <UNK>(未知)。
例如,用户说"帮我订个晚餐",LLM 可能生成:
- 候选 1:
reserve_restaurant(cuisine="中餐", price_range=<UNK>, location=<UNK>, time="18:00") - 候选 2:
order_food_delivery(cuisine=<UNK>, price_range=<UNK>, location=<UNK>)
Step 2:计算信念状态和不确定性
对每个候选调用,计算其"可行性分数" $\pi_c(t)$。这个分数等于所有参数确定性的乘积:
- 已指定的参数:确定性 = 1.0
- 未指定但取值域有限的参数:确定性 = 1/取值域大小(域越小,越容易消歧)
- 未指定且取值域无限的参数(如自由文本):确定性 ≈ 0.0001(几乎完全不确定)
如果最佳候选的可行性分数已经够高(超过执行阈值 $\tau_{\text{exec}}$),就直接执行,无需提问。
Step 3:问题生成
如果不确定性太高,SAGE-Agent 让 LLM 生成一组候选澄清问题。每个问题都关联到它要澄清的"方面"——即哪个工具的哪个参数。例如:
- 问题"您偏好什么价位?"→ 方面:
(reserve_restaurant, price_range) - 问题"您在哪个区域?"→ 方面:
(reserve_restaurant, location)
Step 4:EVPI 评分与问题选择
这是核心步骤。对每个候选问题,计算其 EVPI:
EVPI = “如果我知道了这个问题的完美答案,最佳候选的期望可行性分数能提升多少”
直觉上说,EVPI 衡量的是"这个问题能帮我们缩小多少不确定性"。一个问题如果涉及的参数取值域很大(比如菜系有几十种选择),而且多个候选在这些参数上分歧很大,那么它的 EVPI 就很高。
同时,减去冗余成本:如果一个方面(参数)已经被问过了,再次提问的代价就增加,防止反复问同一个维度。
最终选择"EVPI - 成本"最大的问题来问用户。
Step 5:信念更新与循环
收到用户回答后,更新信念状态——将每个候选中对应参数的取值域与用户的回答取交集,重新计算可行性分数。然后回到 Step 2,检查是否可以执行或需要继续提问。
终止条件(满足任一即停):
- 最佳候选的可行性分数足够高(信心充足)
- 所有问题中最大的净信息增益低于阈值(继续问也帮助不大了)
- 达到最大交互轮次(安全兜底)
一个完整的运行示例
用户:“帮我处理一下那份报告”
| 步骤 | 动作 | 说明 |
|---|---|---|
| 1 | 生成候选 | 候选1: merge_docs(files=<UNK>); 候选2: summarize_doc(file=<UNK>); 候选3: convert_format(file=<UNK>, format=<UNK>) |
| 2 | 计算信念 | 三个候选都不确定(文件名未知,格式未知),最高分数很低 |
| 3 | 生成问题 | Q1: “您指的是哪份报告?” → (merge_docs, files); Q2: “您想做什么处理?” → (summarize_doc, target) |
| 4 | EVPI 选择 | Q1 的 EVPI 更高(消除了所有三个候选的关键未知参数),选择 Q1 |
| 5 | 用户回答 | “就是昨天那个销售报告” |
| 6 | 信念更新 | 文件名确定,但"处理"的含义仍不明确 |
| 7 | 再次提问 | EVPI 分析显示"处理方式"的参数不确定性最高,问"您想对报告做什么操作?合并、总结还是格式转换?" |
| 8 | 执行 | 用户回答"总结",现在 summarize_doc(file="sales_report_0526.pdf") 参数齐全,执行 |
4.2 不确定性引导的奖励建模
除了推理时的应用,论文还探索了如何将结构化不确定性用于训练时的信号增强——让模型在训练阶段就学会"何时该问、何时该做"。
背景:GRPO 训练
GRPO(Group Relative Policy Optimization,组相对策略优化) 是 DeepSeekMath 论文中提出的强化学习算法,专门为大语言模型设计。与传统 PPO 相比,GRPO 的核心优势是不需要单独训练一个价值网络(Critic),而是通过组内多个响应的相对比较来估计优势函数,大幅降低了训练成本。
在本文的场景中,使用 GRPO 训练模型学习四种动作:
- AskQuestion:信息不足,需要提问
- CallTool(parameters):信息充分,直接调用工具
- Decline:任务不可行,礼貌拒绝
- DirectAnswer:无需工具,直接回答
基线奖励的问题
传统的奖励函数($r_{\text{base}}$)由三部分组成:格式正确性($r_{\text{fmt}}$)、工具调用准确性($r_{\text{tool}}$)和动作分类正确性($r_{\text{cls}}$)。
但这个奖励函数有一个问题:它只看结果对不对,不看模型在决策时的"把握有多大"。举个例子:
- 模型 A 在非常确定的情况下正确调用了工具 → 应该得到高奖励
- 模型 B 在参数基本靠猜的情况下碰巧猜对了 → 也得到了同等的高奖励
这导致模型没有动力去区分"我确定"和"我在猜"。
确定性加权奖励
论文的解决方案是引入确定性权重 $\text{Cert}(a_t)$:
$$R_{\text{category}}(a_t) = \text{Cert}(a_t) \cdot r_{\text{base}}(a_t)$$其中确定性的计算方式取决于动作类型:
| 动作类型 | 确定性计算 | 直觉含义 |
|---|---|---|
| 工具调用 | $\max_c \pi_c(t)$(最佳候选的可行性分数) | 参数越齐全,确定性越高 |
| 提问 | $1 - \max_c \pi_c(t)$ | 信息越不足,提问越合理 |
| 其他 | 1.0 | 拒绝或直接回答不受不确定性影响 |
这个设计的精妙之处在于:
- 工具调用时:参数越确定,奖励越高;参数越模糊(靠猜),奖励越低 → 鼓励"有把握才动手"
- 提问时:不确定性越高,提问的奖励越高;如果已经很确定了还提问,奖励低 → 鼓励"不懂才问"
- 拒绝/直接回答:不涉及工具参数,确定性恒为 1
训练数据与效果
使用 When2Call 数据集的 9K 个示例进行 GRPO 训练,效果显著:
| 模型 | 基线准确率 | 标准 GRPO | 不确定性加权 GRPO |
|---|---|---|---|
| Qwen2.5-3B | 36.5% | ~45% | 65.2% (+28.7pp) |
| Qwen2.5-7B | 36.7% | 45.1% | 62.9% |
一个令人惊喜的发现是:3B 模型 + 不确定性加权训练(65.2%)竟然超越了 7B 模型 + 标准训练(45.1%)。这意味着,通过更聪明的训练信号,一个小模型可以学会大模型都学不好的能力——这正是结构化不确定性作为训练信号的威力。
4.3 ClarifyBench:首个多轮动态工具调用消歧基准
为支撑评测,论文构建了 ClarifyBench——首个多轮动态工具调用消歧基准。其设计有以下特点:
- 五个领域:文档处理、车辆管理、股票交易、旅行规划、文件系统管理
- 三种查询类型:
- 显式查询(34%):信息充分,可直接执行
- 模糊查询(30%):缺少参数,需澄清
- 不可行查询(28%):包含矛盾或不可能的条件,应拒绝或纠正
- 716 个样本,92 个工具,平均每个任务需要 3.8 次工具调用
与现有基准相比,ClarifyBench 是唯一同时具备动态用户模拟、模糊查询、不可行查询和多轮请求的基准,填补了工具调用消歧评测的空白。
五、必要知识反推
假设一个人完全没有相关知识,要从零开始做出这篇论文的工作,他需要掌握哪些知识和信息?以下按照"发现问题→解决问题"的逻辑链条进行分析:
5.1 发现问题所需的知识
| 编号 | 知识领域 | 具体内容 | 为什么需要 |
|---|---|---|---|
| K1 | LLM Agent 与工具调用 | 了解 Agent 是如何通过工具 Schema 调用外部 API 的,知道参数、取值域、必需参数等概念 | 才能观察到"用户指令模糊 → 参数不确定 → 调用出错"这一因果链 |
| K2 | 大语言模型的幻觉机制 | 理解 LLM 的 next-token prediction 训练目标如何导致面对不完整信息时倾向于"脑补" | 才能理解问题的根源不是提示词不好,而是模型训练方式的系统性缺陷 |
| K3 | 现有消歧方法的局限 | 了解 Ask-before-Plan、Active Task Disambiguation 等方法的做法和缺陷 | 才能识别出现有方法"在非结构化语言空间操作"这一核心不足 |
| K4 | 用户交互体验设计 | 理解"问太多问题"和"不问就做"都会导致用户体验差 | 才能确立"既要问得准,又要问得少"的设计目标 |
5.2 解决问题所需的知识
| 编号 | 知识领域 | 具体内容 | 为什么需要 |
|---|---|---|---|
| K5 | 概率论与贝叶斯推理 | 理解概率分布、条件概率、贝叶斯更新、信念状态 | 才能对"用户到底想要什么"进行概率建模,并在获得新信息后更新判断 |
| K6 | 决策理论与信息价值(EVPI) | 理解 EVPI 的定义、计算方式、经济学含义 | 才能将"哪个问题最有价值"转化为可计算的数学指标 |
| K7 | 部分可观测马尔可夫决策过程(POMDP) | 理解信念状态、观测、动作、奖励的框架 | 才能将交互式消歧问题形式化为一个有理论保证的序贯决策问题 |
| K8 | 次模函数与贪心近似 | 理解次模性的定义、边际收益递减、贪心算法的近似保证 | 才能证明 EVPI 在工具参数空间上的次模性,从而保证贪心问题选择的效率 |
| K9 | 强化学习与 GRPO | 理解策略梯度、PPO、GRPO 的原理和实现 | 才能将不确定性信号融入奖励建模,训练模型学习何时行动、何时提问 |
| K10 | Agent 系统工程 | 理解 ReAct 循环、工具 Schema 设计、多轮对话管理 | 才能将理论方法实现为可运行的 SAGE-Agent 系统 |
5.3 知识融合的关键洞察
仅拥有上述知识点还不够,论文成功的关键在于以下几个跨领域融合的洞察:
洞察一(K1 + K5):工具的参数 Schema 本身就是一个天然的概率空间——每个参数的取值域就是该参数上的均匀先验分布。这一洞察将"工具调用的消歧"从自然语言问题转化为了概率推断问题。
洞察二(K6 + K1):EVPI 传统上用于经济学决策(如"是否值得花钱做市场调研"),但论文发现它完美适用于工具参数的消歧——每个澄清问题就像一个"小型的市场调研",其价值可以用 EVPI 量化。
洞察三(K5 + K9):推理时计算出的结构化不确定性不仅可以用来指导当前对话,还可以作为训练信号回传给模型——让模型在训练时就学会"有把握就做,没把握就问"。推理和训练形成了闭环。
洞察四(K7 + K8):将 POMDP 框架应用于工具调用消歧,并利用 EVPI 的次模性保证贪心策略的效率。这意味着不需要搜索所有可能的问题序列(指数级复杂度),只需要每步选最好的问题就能得到近似最优解。
六、论文中可以提取的通用性灵感
灵感 1:结构化空间优于非结构化空间
论文发现:将消歧问题从自然语言空间搬到工具参数空间,带来了质的性能提升。
通用启示:面对任何"选择困难"问题,如果能找到问题背后的结构化表示(参数、维度、取值域),就可以用数学工具精确操作,远胜于在模糊的自然语言中摸索。
可迁移场景:
- 产品需求分析:将"用户想要什么"拆解为结构化的功能维度,每个维度的优先级可以用 EVPI 式方法量化
- 故障诊断:将"系统哪里出问题了"映射到故障树的结构化空间,按"消除不确定性价值最大的节点"顺序排查
- 教育系统:将学生的知识盲区映射到知识图谱的节点上,按 EVPI 选择最值得教学的知识点
灵感 2:分离"用户端模糊"和"模型端错误"
论文发现:明确区分规格不确定性(用户没说清楚)和模型不确定性(模型没理解对),有助于选择正确的应对策略。
通用启示:在任何人机交互或信息传递场景中,都应该区分"信息源的缺失"和"处理器的误差",用不同的策略应对。
可迁移场景:
- 客服系统:区分"客户描述不清楚"和"客服理解错误",前者引导补充信息,后者提升理解能力
- 需求工程:区分"甲方需求模糊"和"乙方理解偏差",前者需要需求澄清会议,后者需要提升技术理解力
- 医疗诊断:区分"患者症状描述不完整"和"医生诊断推理有误",前者需要进一步检查,后者需要辅助决策系统
灵感 3:用信息价值量化"该不该问"
论文发现:不是所有问题都值得问,用 EVPI 可以定量评估每个问题的价值,减去成本后选择净价值最高的问题。
通用启示:在任何需要"获取信息以辅助决策"的场景中,都应该先评估"这条信息的价值是否大于获取成本",而不是盲目收集所有信息。
可迁移场景:
- 实验设计:在科学研究中,用 EVPI 决定优先做哪个实验——能最大程度缩小假设空间的实验最值得做
- 商业决策:在市场调研中,先评估哪项调研信息对决策影响最大,优先投入资源
- 代码审查:在 Review 过程中,优先关注对系统行为影响最大的代码路径,而非面面俱到
灵感 4:推理时的信号可以作为训练时的奖励
论文发现:推理阶段计算出的不确定性(信念状态分数)可以直接用于构造更精准的训练奖励函数,实现推理-训练的闭环。
通用启示:系统在运行时产生的内部状态(不仅仅是最终结果的对错)包含了丰富的训练信号,应该被充分利用。
可迁移场景:
- 推荐系统:用户浏览时的"犹豫时间"(在多个选项间切换)可以作为训练信号,而不仅仅是最终点击
- 自动驾驶:车辆在行驶中的"不确定区域"(传感器置信度低的区域)可以回传用于主动学习
- 搜索引擎:用户在搜索结果页的"滚动和停留模式"可以用于训练更好的排序模型,而不仅仅是点击率
灵感 5:小模型 + 更好的训练信号 > 大模型 + 标准训练
论文发现:3B 模型 + 不确定性加权训练(65.2%)超越了 7B 模型 + 标准训练(45.1%),模型参数量不是决定因素。
通用启示:在很多 AI 应用场景中,训练信号的质量比模型规模更重要。与其无脑扩大模型,不如花精力设计更好的训练信号。
可迁移场景:
- 资源受限场景(移动端、嵌入式设备):用精心设计的任务特定奖励训练小模型,而非部署大模型
- 数据标注:与其标注更多数据,不如设计更精细的标注维度(如标注"为什么这样做"而不仅仅是"做什么")
- AI 工程:在追求更高性能时,优先考虑数据质量和训练方法创新,而非单纯增加算力和参数
灵感 6:冗余成本的普适价值
论文发现:引入冗余成本惩罚重复提问同一维度的问题,使得总问题数减少 1.5-2.7 倍,同时保持甚至提升任务完成率。
通用启示:在任何交互式系统中,都应该追踪"已经做过什么",并惩罚冗余行为。这个简单的机制可以有效防止系统在原地打转。
可迁移场景:
- 对话系统:记录已讨论的话题,避免 AI 反复问用户同一个问题
- 项目管理:追踪已完成的工作项,避免团队成员重复劳动
- 自动化测试:记录已覆盖的代码路径,优先测试未覆盖路径,提高测试效率
参考文献
- Suri, M., Mathur, P., Lipka, N., Dernoncourt, F., Rossi, R. A., & Manocha, D. (2025). Structured Uncertainty guided Clarification for LLM Agents. arXiv:2511.08798.
- Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2022). ReAct: Synergizing Reasoning and Acting in Language Models. ICLR 2023.
- Zhang, Z., Zhang, A., Li, D., & Chen, W. (2024). Ask-before-Plan: Proactive Language Agents for Real-World Planning. EMNLP 2024 Findings.
- Kobalczyk, K., Miernik, T., Janowski, K., & Kulesza, A. (2025). Active Task Disambiguation with LLMs. ICLR 2025.
- Wu, Y., et al. (2025). CollabLLM: From Passive Responders to Active Collaborators. ICML 2025 (Outstanding Paper).
- Shao, Z., et al. (2024). DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models. arXiv:2402.03300. (GRPO)
- Patil, S. G., Zhang, T., Wang, L., Maly, R., Gu, J., Song, S. H., & Stoica, I. (2024). The Berkeley Function Calling Leaderboard. arXiv:2402.09446. (BFCL)