论文链接:arxiv.org/abs/2608.19202 发表时间:2026年6月(arXiv v1: 2026-06-08,8月更新) 发表机构:加州大学戴维斯分校数学系、慕尼黑工业大学(独立研究者合作,无企业署名) 领域分类:cs.AI, cs.CL, cs.LG(Agent 上下文获取 / 主动推理) 一句话总结:Agent 的每一次提问、检索、工具调用都是一次有价格的"买信息"行为,主动推理给了它一个统一的账本。
一、论文背景
1.1 上下文获取:Agent 被忽视的日常开销
用过 AI 编程助手的人都有这样的经历:你说"帮我优化这段代码",但没说优先省内存还是省时间、能否升级依赖、要不要保持接口兼容。这时助手面临一个抉择——是带着默认假设直接干,还是先停下来问你一句?
这就是论文关心的核心场景:上下文获取(context acquisition)。当用户省略了约束、偏好、文件或任务变量时,智能体有一整套可以动用的"获取手段":
- 澄清提问:直接问用户"你要的是哪种?"
- 检索调用:去知识库里搜一段相关文档
- 工具调用:调一个 API 补上缺失的字段
- 提示试验:自己试几个 prompt 变体,看哪个效果好
- 输入检查:多看一眼输入的某个部分(比如图片的某个区域)
每一种手段都在"买信息",而每一笔交易都有价格:花的是 token、增加的是延迟、消耗的是用户耐心。就像你去买一件不确定有没有货的东西——可以提前打个电话确认(花几分钟),也可以直接开车跑一趟(赌它有货,没有就白跑)。打电话值不值,取决于跑一趟的成本和空手而归的概率。
1.2 现状:上下文获取是"自动行为"而非"显式决策"
问题在于,今天的大多数智能体系统把这个权衡完全交给了直觉。什么时候问、问什么、问几个,要么写死在系统提示词里(“遇到模糊需求要先澄清”),要么干脆是模型涌现出的行为。没有人算过这笔账:这个问题的信息增益是多少?它的 token 成本是多少?问它比直接做划算吗?
更关键的是,“要不要继续获取上下文"和"现在就动手做任务"这两个决定,在现有系统里属于两个世界——前者是提示词工程,后者是任务执行。论文认为它们本该放在同一杆秤上称重:都是动作,都有成本,都有期望收益。
1.3 论文要回答的问题
这篇论文要做的就是把这笔糊涂账变成一笔明白账:给"要不要花 token 获取更多上下文"一个可计算的形式化判据。 答案是主动推理(active inference)框架——不是发明新算法,而是提供一个模型无关的设计语言,让任何 Agent 都能照着把自己的上下文获取层重写一遍。
二、论文定位和关联工作
2.1 主动推理谱系:从自由能原理到 Agent 设计
主动推理源自 Friston 的自由能原理(Friston et al., 2017; Parr & Friston, 2019),原本是计算神经科学的理论:生物体通过最小化自由能来维持自身状态,动作也是最小化自由能的手段。它把"探索”(减少不确定性)与"利用"(达成偏好状态)统一在一个目标函数——期望自由能——里。
论文对此的立场很清醒:不把主动推理当成强化学习的对手。 作者引用 control-as-inference(Levine, 2018)和 Millidge 等人的分析(2020, 2021, 2024):主动推理与"控制即推理"式的 RL 主要区别只在于奖励、目标或偏好如何编码进图模型,二者在目标层面可以对齐。论文的贡献不是宣称主动推理在范畴上不同,而是主张主动推理的分解方式为 LLM 系统提供了紧凑的设计语言——尤其是它把信息增益直接放在目标函数里,而不是靠事后加探索奖励。
2.2 LLM 智能体提问策略研究
把 LLM 当作主动信息获取者而非被动应答器,是近两年的活跃方向:
- UoT(Hu et al., 2024):用不确定性感知的模拟和信息增益奖励选择追问
- 主动偏好推理(Piriyakulkij et al., 2023):用 LLM 诱导的概率模型问有信息量的偏好问题
- CLAMBER(Zhang et al., 2024):评测模型能否发现并澄清模糊的信息需求
- Ask-when-Needed(Wang et al., 2024):研究指令不清时的工具使用失败
- Active Task Disambiguation(Kobalczyk et al., 2025)与 BED-LLM(Choudhury et al., 2025):把澄清显式框架化为 LLM 的贝叶斯实验设计
- CaRT(Liu et al., 2025):研究智能体何时"知道得够多了"可以停止收集、开始行动
这条线的共同问题是:没有精确的不确定性度量,也没有最优基准可以对照。 你知道模型问得好不好,但不知道"最好能好到什么程度"。这正是 OQA 基准要补的洞。
2.3 POMDP 视角与对比
从数学结构看,整个问题就是 POMDP:潜在任务状态 x 不可观测,动作影响观测,智能体维护信念。主动推理在这个熟悉的地形上提供了三样东西:期望自由能的分解(风险 + 认知价值 + 成本)、把查询当一等公民动作的显式后验、以及停止规则。论文 Table 1 给出了操作性对比:
| 维度 | 通用 RL 视角 | 本文的主动推理视角 |
|---|---|---|
| 控制 | 优化动作以最大化采样数据流下的回报 | 选择的动作同时决定接下来什么证据会到来 |
| 探索 | 通常靠奖励加成、熵正则、乐观主义或后验采样引入 | 直接作为期望自由能中的认知价值项出现 |
| 信念与查询 | 信念可能隐含在价值函数、循环状态或模型后验中 | 对意图/目标/最优提示的显式后验使查询成为一等动作 |
| 评估 | 回报、遗憾、准确率或奖励模型分数 | 熵下降量、与 oracle 的差距、每 token 比特数、最终任务成功率 |
作者也强调这个对比不是范畴性的——RL 可以加信息加成,主动推理也可以用 RL 求解器。区别是操作性的:在上下文获取场景中,智能体可以选择下一个测量并因此在行动之前塑造证据流,期望自由能恰好给这种选择一门紧凑的语言。
三、问题定义
3.1 形式化框架
设 x ∈ X 为潜在任务状态——可以是用户意图、目标物品、隐藏偏好、缺失约束,或最优提示。设 a ∈ A 为动作,o 为观测(回复、轨迹或观察),由观测模型 p_θ(o|x, a) 描述。
期望自由能给每个候选动作打分。在确定性观测设定下(OQA 即如此,观测模型的模糊项为零),动作得分可写为:
G_t(a) = 期望风险 − 期望信念改变量
其中期望风险是 E_o[−log p*(o)](偏离偏好的程度),期望信念改变量是假设观测后后验相对当前信念的期望 KL 散度。论文 Proposition 3.1 证明:当内层推断精确时,第二项就是互信息 I(x; o|a)——即期望信息增益;若偏好 p* 为常数(各种观测同等被接受),最小化自由能等价于最大化期望信息增益。再加上成本项 λc(a),就得到完整的决策规则。
3.2 双层结构:内层推断,外层决策
框架的核心是一个双层优化程序:
- 内层(推断):对每个候选动作 a 和假设观测 o,计算变分自由能最小的后验 q*_t+1(x; a, o)——“如果我问了这个问题、得到了这个答案,我的信念会变成什么?”
- 外层(决策):选择使期望自由能最小的动作 a——在上下文动作(问/检索/试验)、任务动作(直接做)与停止动作之间做选择
这有点像下棋前的算棋:内层是"如果我走这步,棋盘会变成什么样",外层是"综合所有可能局面,哪步最值得走"。
3.3 两条关键定理:什么时候值得问
论文给出了两条可以直接落地的判据:
Proposition 3.3(单位信息成本的停止规则):一个获取信息的动作值得执行,当且仅当信息增益超过成本——I(x; o|a) > λc(a)。若按小单位贪婪地花费固定预算,最优选择按单位成本的信息量排序动作。这就是"每 token 多少比特"的准则来源。
Theorem 3.4(上下文的贝叶斯风险价值):设 R(q) 为当前信念下立即行动的贝叶斯风险,则先获取上下文再行动更优,当且仅当风险减少量超过成本——R(q_t) − E_o[R(q_t(·|o,a))] > λc(a)。当终端损失为对数损失时,左端恰为信息增益,两条定理统一。
一句话:只有当期望的不确定性下降幅度配得上它的价格时,才去买信息。 规则简单得近乎常识,但常识从未被这样精确陈述过。
四、问题解法
4.1 AIF-Context:推理时的控制回路
论文第 4 节把上述目标翻译成一个可运行的智能体循环(Algorithm 1):
- 提出少量候选上下文动作集 A^ctx 和任务动作集 A^task
- 对每个上下文动作,预测可能的观测并计算每个假设观测后的后验
- 用期望自由能(或 Theorem 3.4 的贝叶斯风险价值)给动作打分
- 若没有上下文动作在计入成本后胜过"现在就做",则执行最优任务动作;否则执行最优上下文动作,观测,更新信念,循环
这个视图把提示工程里常被混为一谈的三个角色分开了:信念状态(我 currently 认为任务是什么)、测量模型(每个上下文动作能揭示什么)、偏好/损失模型(哪些最终结果重要)。期望自由能评估一个候选问题的标准是"预期减少多少与决策相关的不确定性",而不是"这个问题看起来是否合理"。
4.2 OQA:把提问变成可精确度量的二十问
框架要落地,先得让不确定性可精确测量。OQA(Optimal Question Asking)的设计极为干净:
- 一张有限属性表,N 个候选物品,每个物品对同一组属性有固定取值(如动物表:cat 的 mammal=yes、has_fur=yes、can_swim=no)
- 隐藏目标 x* 从表中均匀采样
- 每轮智能体只能问一个属性,答案由查表给出——二进制表回答"是/否",k 路分类表回答具体取值(如"red")
- 答案无噪声,每轮过滤出一致集 C_t,后验在 C_t 上均匀分布,熵精确等于 log2|C_t|
这是把贝叶斯实验设计(Lindley 1956 以降)的二十问框架(Jedynak et al., 2012)改造成了 LLM 评测:所有量都可复现地计算,没有模糊地带。二进制版覆盖 Places、Cars、Animals 三张真实表(N=25 和 100);多路分类版覆盖 100、200、300 三档合成表,共享八个属性:color、shape、material、size、pattern、origin、use_case、energy。
动态规划 oracle 是点睛之笔。由于后验完全由候选集 C 决定,最优提问策略可用 Bellman 递归精确求解:Cost(C) = min over 属性 a of [1 + Σ_v (|C_v|/|C|) Cost(C_v)],即"问一个问题,加上按分支概率加权的后续最优成本"。论文 Theorem 5.1 证明了该递归的最优性——它给出的是全局最优的自适应决策树,而贪婪信息增益只优化下一步、可能多步次优。DP 的角色因此超越了基准:它度量的是"短视上下文获取的代价"。
4.3 两个 token 预算下的提示工作流
同一套记账法还照进了两个更贴近实际的工作流:
提示补全(生成前澄清):用户要一段产品描述但没说风格。隐藏变量 U = (tone, length, format),各两个取值,均匀采样。智能体最多问三个固定模板的澄清问题,答案由隐藏 U 模拟给出(信念更新带 12% 对称标签噪声)。每个澄清问题按递增日程收费:第一个 24 token、第二个 48、第三个 72。之后用 MAP 风格调用一次模型生成,由确定性验证器判分(三个特征短语须逐字出现、格式和词数须匹配)。五种提问策略对比:baseline(不问)、ask_all(全问)、random、active(选单位 token 熵最大的未问属性,低于阈值 ε 停止)、active_weighted(按验证器是否检查加权:format=1.0、length=0.6、tone=0.25)。
自动提示优化:把六个候选系统提示(letter_only、short_reasoning、eliminate_two 等)当作多臂老虎机,每个提示是未知准确率 θ_p 的 Bernoulli 臂,维护独立 Beta 后验。每步选一个提示,在 ARC-Challenge 选择题上跑一次(temperature=0),解析答案字母记对错。信息效率指标 IE_1k = 1000·ΔH/τ_t 读作"每千 token 的熵下降"。选择策略包括 round robin、Thompson sampling、KG(知识梯度)、MI(最大化最优提示身份熵的期望下降)、EFE(MI 与 KG 混合,认知权重随时间线性衰减),后三者均按每提示的 token 成本估计归一化。训练上限 400 题或 12 万 token。
两个实验的公共精神:token 买的是关于隐藏选择的证据,而证据要在预算内竞争。
五、评估指标与实验证据
5.1 OQA 主结果:前沿模型普遍落后于 oracle
OQA 上评测了七个前沿模型:GPT-5、GPT-4.1、Gemini 2.5 Pro、Gemini 2.0 Flash、Claude Sonnet 4.5、Claude Haiku 4.5、Grok 4。协议:每题一次 API 调用、temperature=0、每个目标全新会话、禁用一切工具。
核心指标是规划差距(planning gap):模型平均提问数与 DP oracle 提问数之差 E[T_model − T_DP]。结果在二进制(N=25/100)和多路分类(N=100/200/300)所有档位上高度一致:模型每轮都在稳定缩小候选集,但全都问得比 oracle 多。 即便在不确定性可以精确测量的最干净环境里,前沿模型仍在问可避免的问题——它们缺的不是知识,而是规划。
值得注意的细节:在 Animals 表中,若干物品共享完全相同的属性向量,导致有些局会带着残余熵提前结束——这是环境本身的信息极限,任何策略都无法突破。
5.2 定向澄清的收益:合规率九倍提升,token 翻倍
提示补全实验(48 个任务,ε=0.02、K_max=3)给出了最抓眼的数字:
| 策略 | 验证器合规率 | 平均 token |
|---|---|---|
| baseline(不问) | 0.0417 | 约 112 |
| active_weighted(网格搜索最优) | 0.375 | 约 219 |
定向澄清把合规率提升了约九倍,代价是 token 翻倍。网格搜索在 24 个训练任务上调 ε ∈ {0, 0.005, 0.01, 0.02, 0.04} 和 K_max ∈ {1,2,3},最优点为 ε = 0.01、K_max = 2**,在 24 个留出任务上验证。这个最优解本身就在讲故事:问两个问题比问三个好——第三问的边际信息不值它的 token。同时 ask_all 花 token 最多却不讨好,baseline 最省但合规率垫底——两个极端都不如"按信息密度挑着问"。
5.3 提示优化:早探索、晚收手
提示优化实验中,400 题上限先于 12 万 token 预算触顶(约 5×10^4 token)。各策略留下的痕迹符合信息论的直觉:KG 倾向于早期集中查询,让少测的提示停在 0.5 先验附近;MI 和 EFE 前期信息量最大;Thompson sampling 和 round robin 把学习摊得更匀。 训练结束后选后验均值最高的提示在 200 题共享留出集上评测。主要教训:用早期试验压低不确定性,而不是过早承诺,然后按全程同一评分规则选战绩最强的变体。
5.4 局限
作者对局限的陈述相当诚实:真实对话有模糊回复、新约束、自相矛盾的偏好、对不上预写属性表的证据;实验关掉了工具(现实中工具承担存储、精确过滤、跨轮记忆的重活);DP oracle 随物品数增长会遭遇状态爆炸,更大的任务需要采样、搜索或学习式前瞻的近似基线。此外——这一点很罕见地被摆到了正文——高效的上下文获取是双刃剑:帮助手少问好问的机器,同样能帮恶意者套取敏感细节、画像用户、探测隐藏系统规则。附录 F 用同一套信息记账法形式化了自适应提示攻击与防御设计(拒答塑形、权限分离、预算限速),并主张把"降低攻击者的信息获取速率"纳入防御目标。
六、效果优势的根源解释
为什么同样是问问题,形式化之后就更有效?根源有三层。
第一,它把"要不要问"从启发式变成了可计算的期望值比较。 系统提示词说"遇到模糊就问",模型于是要么问太多要么问太少——因为"模糊"没有刻度。而 I(x;o|a) > λc(a) 给出了一个带单位的判据:信息增益(比特)对成本(token),比较的是两个实数。提示补全实验里 ε*=0.01 的含义就是:当每 token 的期望熵下降低于 0.01 比特时,闭嘴去写。行为从风格问题变成了优化问题。
第二,定向澄清的信息密度高于盲目继续。 baseline 的合规率只有 0.0417——随机猜中隐藏风格的组合概率量级;而 active_weighted 按"熵 × 验证器权重 ÷ token 成本"挑问题,专问判分时要检查的属性(format 权重 1.0,tone 只有 0.25 因为验证器根本不查语气)。这解释了为何问两个问题就够:问题不是问得越多越好,而是每个问题都要买最终输出会被检验的信息。论文的原话说得直白:付钱问问题是值得的,但仅当问题买到的是"最终输出真正会被评判所依赖的信息"。
第三,oracle 让"短视的代价"第一次可以被定价。 贪婪信息增益只看下一步,DP 看整棵决策树。两者的差距就是"局部好问题未必属于全局好计划"的度量。没有 oracle 的研究只能报告模型的绝对表现,有了 oracle,才能报告本可以省下多少——这是对提问策略研究方法论的实质贡献。
七、必要知识反推
若要真正吃透这篇论文,需要反推补齐以下知识。
7.1 领域层
- 主动推理与自由能原理:Friston 2017 的过程理论、Parr & Friston 2019 的广义自由能;变分自由能与期望自由能的分解(风险、模糊性、认知价值)
- control-as-inference:Levine 2018 综述,理解 RL 目标如何写成概率推断,以及 Millidge 等人对主动推理与 control-as-inference 等价性的分析
- 贝叶斯实验设计:Lindley 1956 的期望信息增益准则、Chaloner & Verdinelli 1995 与 Rainforth et al. 2024 的综述——主动推理的认知价值项在数学上就是它
- 二十问与广义二分搜索:Jedynak et al. 2012 的噪声二十问贝叶斯最优策略、Nowak 2011 的广义二分搜索几何——OQA 的直接前身
7.2 方法论层
- 多臂老虎机与信息定向采样:Thompson sampling、知识梯度(KG)、Russo & Van Roy 2014 的信息定向采样——提示优化实验的五种策略全部来自这里
- Beta-Bernoulli 共轭后验:提示优化的信念更新全靠它;最优臂身份的蒙特卡洛后验分布与熵估计
- 动态规划与 Bellman 最优性:候选子集上的递归 Cost(C)、归纳法证明最优性、子问题缓存(按排序的物品 ID 元组做键)
- 双层优化:Colson et al. 2007、Franceschi et al. 2018——内层推断外层决策的结构与元学习的内环外环同构;隐函数定理保证可微性(Proposition 3.2)
7.3 工程层
- 基于转录的评测协议:每题一次调用、temperature=0、新会话、无工具——保证完全可复现;严格 JSON 格式解析"question"字段
- 合成 token 成本模型:澄清成本递增日程 {24, 48, 72} 模拟上下文增长;每臂指数移动平均成本估计(γ=0.9)做按成本归一化
- 信息效率指标设计:IE_1k = 1000·ΔH/τ_t——把"每单位开销买到的比特数"做成一等公民指标
7.4 知识融合节点
真正的理解发生在这些节点上:当你意识到主动推理的认知价值项 = 贝叶斯实验设计的期望信息增益 = 贪婪信息增益 = 互信息(在精确推断、确定性观测、常数偏好下四者合一,Proposition 3.1 的内容)——四条本来独立的知识线在此打结;当你意识到 OQA 的属性表就是一个受限的假设空间、提问就是选择分割、DP 就是在分割树上做最优搜索——二十问、决策树、POMDP 三个视角叠合为同一个结构;当你意识到提示优化的 Beta 臂、提示补全的风格变量、OQA 的隐藏目标都是同一个抽象——潜在任务状态 x 的不同皮相——论文的统一性就不再是口号,而是可以在自己系统里复用的思维模板。
八、通用性灵感
8.1 灵感一:元决策显式化——辅助动作应与任务动作同台竞争
多数 Agent 系统的架构里,“检索"“问用户"“试一版 prompt"是散落在不同模块里的自动行为,与"直接执行任务"从不同场竞技。这篇论文最大的启发是把这个层级拍平:一切辅助动作都应与任务动作放进同一个期望价值比较里。 你可以在自己的 Agent 里做一个最简改造:在调度器里给"检索"“提问"“先试跑"各配一个预估信息增益和成本函数,与直接执行的期望损失同表比较。哪怕估得很粗糙,也比现在"想到就做"的隐式策略强——粗糙的数字仍比没有数字好排序。
8.2 灵感二:信息增益/成本比是通用的采集准则
“每 token 多少比特"这条准则的适用面远超提问场景。检索系统里,可以用预期信息增益决定要不要再抓一篇文档进上下文;工具调用前,可以用它决定要不要先问用户补齐缺失参数(而不是幻觉一个参数就把 API 调了);评测里,可以用 IE_1k 式的指标横向比较不同采集策略的资金效率。论文给的停止规则简单到可以写在便签上:增益不抵成本,就停。 反过来,部署侧还应有对偶版本——当"信息"是敏感信息、采集者是恶意用户时,防御目标恰恰是把对方的信息获取速率压到最低(附录 F 的立场)。
8.3 灵感三:二十问式受控环境是研究提问策略的理想试验台
OQA 的方法论价值可能超过其基准价值:它示范了如何把一个交互能力问题改造成熵可精确计算、oracle 可精确求解、结果可完全复现的受控游戏。任何研究"模型如何主动获取信息"的人都可以套这个模子:定义有限假设空间、规定允许的查询菜单、查表给答案、DP 求最优。合成属性表还可以任意放大规模(附录 C 给出了生成器),并通过属性名去语义化(十六进制 ID)剥离世界知识的干扰,只测纯规划。做 Agent 评测的人不妨自问:你的 benchmark 里,哪些能力其实缺一个这样的"带 oracle 的干净副本”?
8.4 尾声
这篇论文没有刷新任何 SOTA,它的野心是给 Agent 的一个日常动作——“要不要多问一句”——立一部小小的法:先算信息,再算成本,比较之后再开口。法条朴素,但从此每个提问都有了对账单。对正在构建交互式 Agent 的工程师而言,这可能是最容易被低估、也最容易落地的一类研究:不需要重训模型,只需要在推理时的调度层里,装上一个会算账的上下文获取层。