Calibrated Enough to Know, Not Calibrated to Act —— 精读

论文链接:arXiv:2608.27167 发表时间:2026年8月 机构:独立研究者(Pranav Aggarwal) 领域标签:cs.AI(人工智能)


一、论文背景

生产环境的 LLM agent 很少直接面对裸问题——它坐在仪表盘、检索结果、监控信息流和行情数据后面。整个部署实践建立在一个默认假设上:更多上下文让 agent 的决策更可靠(EU AI Act 第 15 条与 NIST AI RMF 都隐含此假设)。作者的先前工作(v1 版本)已经发现这个假设在不可约不确定的问题上会反转:看起来相关的上下文恰恰是让 agent 停止说「这无法知晓」的元凶。

但那个结果留下一个开放的因果问题:**技术面板是真的(哪怕微弱地)在为模型提供信息,还是仅仅它的「权威外观」就解锁了行动?**两者在观察上完全等价——要分离它们,必须对证据本身动手。这就是本文的核心实验设计:伪造证据、保持形式。

本文研究的对象是aleatoric(偶然性)不可知问题:答案存在且会揭晓,但事先不可知——资产十天后的涨跌、比赛胜负、十天后的降雨。这与主流弃答基准测的 epistemic(认知性)不可回答不同:后者缺个事实就能答,前者任何工具调用都解决不了。这个区分让失败模式变得非常具体:正确动作存在、反思一下就明显、却仍然不被采取。

二、论文定位和关联工作

论文刻意把相关工作放在结果之后,并逐一划清边界:

  • 弃答研究(AbstentionBench、Abstain-R1、TruthRL):主要处理缺失信息、错误前提等 epistemic 不可答;AgentAbstain 在可执行环境里测「何时不该行动」,最佳前沿模型配对准确率仅 59.5%,结论「弃答能力与任务能力基本独立」与本文 §4 的「承诺率不随能力变化」独立吻合——但均未提供针对 aleatoric 情形的训练干预,本文补上了这块。
  • 预测评测(ForecastBench):关心预测质量;本文关心的是「是否发出预测」这个动作本身。
  • 知与行的分离:Kadavath 2022 证明模型大体校准于自身知识;Sun 2026 从隐藏状态解码工具必要性(AUROC 0.89–0.96)超过模型自身言语化——「模型知道但行动时不咨询」与本文的行为学定位互相印证。
  • 证据诱发的校准退化:Xuan 2026 把工具增强下的信心膨胀归因于检索噪声;本文的证据按构造是空的(不是噪声是纯伪造),且测量的是行动而非陈述的数字。

方法论上最独特的是退化策略基线的自审传统:每个头条数字都要对照「无理解力的策略能拿多少分」——正是这个习惯暴露了时态混淆与指标 T 未过基线检验两个问题。

三、问题定义

研究问题可拆成六步实验法:

  1. 不可知性 oracle:用短程价格方向构造——按市场有效性事前近似抛硬币;结果在构造时封存(as-of 日期晚于所有模型训练截止,杜绝记忆);测试集按构造平衡使随机恰为 50%。
  2. 证据梯度:L0 裸问题 / L1 两个价格 / L2 完整专业面板(RSI-14、EMA-20/50、MACD 直方图、ATR、成交量比、状态标签)。
  3. 伪造梯度:thin(价格头+RSI+量比)→ rich(全指标)→ scram(六项技术字段换成同一资产更早日期的值、头部方向匹配——内部自洽不可察觉)→ scramfull(连价格头与状态标签也全部伪造,面板上除问题外没有一个数字是真的)。
  4. 失败定位:判断(能否分类可知性)、信念(概率是否移动)、行动(是否承诺)三分离。
  5. 干预:SFT 训练 3B 模型的行动门控(540 条骰子/硬币/罐子/计时器合成数据,QLoRA+CoT 目标)。
  6. 边界测试:训练后的门控在什么条件下崩溃。

每个案例配可答对照(同一面板上可解析的问题,如「RSI 是否高于 42.6」)——没有它,「一律弃答」的策略会在全不可知评测中拿满分。核心指标:承诺率、Youden’s J(P(弃答|不可知)−P(弃答|可答))、封存结果上的 Brier 分数、案例聚类 bootstrap。

四、问题解法

本文的「解法」是因果分离的诊断设计 + 可训练的门控干预,关键手法如下:

形式保持的伪造。scram 变体只替换指标数值、保留格式与资产、方向匹配头部——模型无法从数据完整性角度察觉造假,只能在「可知性」层面做判断。scramfull 更进一步连价格头都换掉。这样「真面板 vs 伪造面板」的承诺率差异就纯粹归因于信息,而共同高于裸问题的部分归因于包装。

三重定位排除法。无能解释:可答对照上 12 模型回答率 98.6–100%、准确率 99.9%(859 题仅 1 错)——模型读得懂面板、不是普遍拒答倾向。判断缺失解释:事前被要求分类问题可知性时 90% 正确标为不可约,且说了之后仅 0.4% 承诺;一段 triage 指令把承诺从 54.0% 压到 10.2%(安慰剂指令反而 47.6%)。信念移动解释:让行动摆动 48 个百分点的梯度上,陈述概率离 50 的均值只从 4.7 移到 7.7。结论:act/don’t-act 门控没有咨询已有的判断。

训练门控。在 Qwen2.5-3B 上做 completion-only SFT:540 条合成案例中一半不可知案例携带「丰富但无预测力」的面板,配以面板真能解决问题的配对案例——迫使模型学「证据能否解决问题」而非「见到面板就弃答」。框架覆盖按分层采样而非随机(工具框架+诱惑面板的格子从 9% 提到 25.5%)——早先一版在此格塌陷的教训。

混淆对照。所有迁移评测里不可知题是将来时、可答题是现在时——「见将来时就弃答」的语法规则能拿满分 J。作者构造时态平衡集破解:48 道将来时可答题(计时器/日历推算)+ 54 道现在时不可知题(掷骰后盖住),时态规则在这两个格子必然做错,学到的门控则相反。

五、评估指标与实验证据

主梯度(40 案例 × 12 前沿模型):承诺率 6.5% → 14.8% → 54.0%(L0→L1→L2,+48pp);换成不同实体的面板则崩到 3.5%(低于裸问题——可见不相关证据完全骗不动)。

伪造=真实(24 事件、1148 决策):thin 24.5% → rich 37.6% → scram 38.3%(差 +0.7pp,90%CI[-2.1,+3.1]);scramfull 36.8%,全假−真 = −0.83pp(90%CI[-4.51,+2.66],±5pp 等效检验通过)。整个面板全是编的,效果与全是真的统计上无差别。分解看更尖锐:12 个模型里 5 个对所有 72 项返回同一决策(4 个从不承诺、1 个总是承诺);在承载效应的 3 个 Claude 模型上,伪造面板比真面板更诱惑(+11.11pp,90%CI[+4.17,+18.06])。

刻度盘效应:0/2/4/7 个指标 → 0%/5.4%/32.1%/50.0% 承诺——权威展示的数量本身就是剂量。

承诺无价值:L2 承诺的 Brier 0.281,劣于一律答 50% 的 0.250;按承诺概率排序的 AUROC 仅 0.346——反向预测(模型说 60% 时事件只发生 35.3%,说 40% 时反而发生 66.7%)。审计若只查平均预测(49.1% vs 基准 50.6%)完全发现不了。

训练结果:3B 模型在原 40 案例全水平 0.0% 承诺(vs 前沿 54.0%),Cohen’s h=+1.65;可答臂 100% 回答、零过度弃答;时态平衡对照 J=+97/+100——排除了语法启发式。边界:门控恰在响应格式留有推理空间时成立(240/240、288/288 含推理块),在剥夺推理空间的格式下崩溃(0/288);一个消融配方甚至出现 48/48 不可知项带真实概率承诺的反面结果;刚性格式下答对题时置信 84.0% 而准确仅 57.2%——训练把失败从行动移到了信念。

六、效果优势的根源解释

因果链:症状不是判断、信念或能力缺失(三者分别被可答对照、概率不移动、事前分类三组实验排除)→ 真正故障在 act/don’t-act 门控未咨询已有判断 → 触发器是包装的权威性而非信息内容(全假=全真的等效检验是决定性证据;密度剂量效应进一步支持「数量即触发」)→ 门控可分离故可训练(540 条无关域合成数据教会「证据是否可解决问题」的判断,承诺归零且时态对照排除语法捷径)→ 但门控在剥夺推理空间的输出格式下崩溃。

为什么伪造比真更诱惑(对受影响家族 +11pp)?作者的解释是:真实数据偶尔与「正确」方向冲突而产生犹豫,纯编造的面板可以内部自洽地呈现最强的动量形态——噪声穿上了数据的外衣反而更自由。为什么概率反向?模型群在动量形态的信号上趋同(案例内一致率 90%),而这些信号在该窗口无信息量——羊群式承诺把反向选择放大。

对评估的根源性启示:陈述概率是「错误的审计位置」——行动摆 48 点时信念只动 3 点;校准文献盯住的数字恰恰是稳定的地方。Agent 评估必须审计决策而非陈述的概率。

七、必要知识反推

  1. aleatoric vs epistemic 不确定性:前者是固有随机性(掷骰),后者是信息缺失(缺事实)。弃答研究的主体是后者,本文的靶子是前者。
  2. Brier 分数与分解:概率预测的均方误差,0.25 是「永远答 50%」的基线;CORP 分解(可靠性/分辨率/不确定性)是无参、不依赖分箱的分解法。
  3. AUROC 与 Youden’s J:前者衡量概率排序质量(0.5 为随机),后者 = 灵敏度+特异度−1,全弃答与全回答都得 0——配对可答臂正是为了让 J 不可被退化策略刷高。
  4. 等效检验(TOST):不是「未能证明有差异」而是主动证明「差异小于容差」——90% CI 落在 ±5pp 内才称等效。
  5. Cohen’s h:比例差异的效应量度量,0.8 以上为超大效应。
  6. QLoRA/SFT/DPO:4 比特量化低秩适配微调、监督微调、直接偏好优化——理解 3B 门控训练的技术底座。

八、论文中可以提取的通用性灵感

  1. 审计要测行为,不要测声明。陈述的概率、置信度、立场声明都是「稳定的地方」,恰恰藏不住行动层的失控。用户调研、风控问卷、合规自查同理——问「你会怎么做」不如看「你实际做没做」。
  2. 分离「信息」与「权威包装」的实验范式。保持形式、伪造内容(scram/scramfull),可以迁移到任何「专家外观是否操纵判断」的研究:把律师函格式配上随机法条、把论文格式配上随机数据,测人类的承诺率。
  3. 退化策略基线应成为评测标配。每报一个指标,同时报「无理解力的策略(全选 A、见将来时就拒答)能得多少分」。凡是退化策略能刷高的指标,都不能作为能力证据。
  4. 失败要定位到可干预的组件。「判断—信念—行动」三分离的诊断顺序,把模糊的「模型过度自信」精确到「门控不咨询判断」——可定位才可训练(540 条数据归零),这是所有诊断工作的模板。
  5. 干预的失败边界与成功同样重要。「门控恰在格式留有推理空间时成立」这条边界,对部署者是生死线——输出格式的工程选择(是否留推理槽位)直接决定安全属性是否存活。所有安全训练都应回答「在什么条件下失效」。
  6. 训练可能只是搬运失败而非消除失败:从「行动失准」搬到「信念膨胀」(84% 置信 57% 准确)。评估干预时要检查失败去了哪里,而不是只看原症状消失。
  7. 方法论诚实本身是贡献:主动披露自己预先声明的指标 T 未通过退化基线检验、披露反面结果(48/48 带概率承诺的 run)、披露天气域是最弱工具——这种「自我攻击式」的写作标准值得每一篇实验论文效仿。