论文链接:Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations 发表时间:2026年9月10日 机构:University of Massachusetts Amherst —— 高校研究 领域标签:cs.CL / Agent Reliability / Interpretability / Calibration

一、论文背景

智能体正在进入安全关键应用(运维、金融、自动化测试),但 agentic 工作流的失败模式远比单轮模型复杂:规划错误、工具调用错误、环境交互错误层层叠加。核心安全问题随之而来:系统知道自己在失败吗?

现有置信度估计三条路线在 agent 场景都有硬伤:token logprob(表层概率)在多轮聚合后信号微弱;多次 rollout 采样(self-consistency 类)成本翻倍且慢;verbalized confidence(让模型自报)被证明严重过拟合。与此同时,机制可解释性研究反复发现:模型内部表征往往"知道"比输出更多信息——失败信号是否也藏在残差流里?

二、论文定位和关联工作

置信度来源开销agent 场景有效性依据
Token logprob零弱(多轮稀释)表层统计
多样本 rollout高(k× 推理)中行为一致性
Verbalized低弱(自我报告失真)元认知
LTD/ARP(本文)零(读内部态)强表征几何

定位结论:本文把"内部表征优于表层信号"的可解释性发现工程化为 agent 可靠性监视器——定位在 interpretability 与 agent safety 的交叉点,且以零开销为主要卖点。

三、问题定义

具体问题:在多轮交互任务中,能否从模型内部表征可靠预测最终任务成败,且不引入提示改动或额外采样开销?

操作化:训练轻量探针读取中间层表征→输出成功概率;评估协议必须防泄漏——轨迹内轮次不能既是训练又是测试(交叉验证按轨迹切分而非按轮次切分)。

四、问题解法

1. Latent Trajectory Dynamics(LTD):把整条交互轨迹的残差流表征(各关键层的 hidden states)按轮次序列提取,用时间序列特征(均值/漂移/协方差变化等)总结"表征动态"——假设:走向失败的轨迹其内部状态演化模式(如不确定性累积、表征震荡)与成功轨迹可分。

2. Action Representation Probe(ARP):在每个动作决策点(agent 即将输出工具调用/命令的瞬间)读取该时刻表征,探针直接预测"此动作开启的剩余轨迹最终成功与否"——动作级粒度,可在执行前预警。

3. 严格对照协议:三个表层基线(token 概率聚合、序列校准、外部轨迹总结器)+泄漏无交叉验证+三基准×三模型家族的完整网格。

五、评估指标与实验证据

  • 网格覆盖:InterCode-Bash / SQL / Python × Qwen-14B / Qwen-7B / DeepSeek-6.7B 全部 9 个组合。
  • 主结论:LTD 与 ARP 在所有组合上一致超越全部表层与序列基线(AUROC 等指标)——内部表征携带的失败信息在跨任务、跨模型上稳定存在。
  • 零开销:探针只读取前向传播已产生的 hidden states,无额外推理、无提示修改、无多样本采样。
  • 基线细节:外部轨迹总结基线(对同一非终止轨迹范围聚合 token 概率轨迹)是强对手,仍被内部方法支配。

六、效果优势的根源解释

为什么内部表征赢?三个机制性理由:

  1. 信息层级差异:token logprob 是输出分布的边缘统计,经过采样与解码的"有损压缩";hidden state 是决策前的完整内部状态,包含被 argmax 丢弃的替代假设——失败征兆(错误方向的高概率质量)恰恰在被丢弃的部分里;
  2. 轨迹结构利用:LTD 看的是表征随轮次的演化模式而非单点快照——失败往往是渐积的(错误假设累积),动态特征捕获趋势而静态概率只能捕获瞬态;
  3. 决策点对齐:ARP 在动作选择前读状态,天然与"该不该执行这个动作"的干预时机对齐——预警价值高于事后评估。

跨模型一致性(三个家族全部有效)说明这不是某模型的偶然特征,而是"LLM 内部普遍编码了任务成功预期"这一性质的证据。

七、必要知识反推

  • InterCode:Bash/SQL/Python 交互式编码环境基准,agent 逐轮执行命令、环境返回反馈。
  • 残差流:Transformer 各层 hidden state 的加性累积,可解释性研究的标准读取点。
  • 线性探针:在 frozen 表征上训练轻量分类器,检验信息可读性。
  • 泄漏无交叉验证:防止同一轨迹的轮次分属训练/测试导致虚高性能。

八、论文中可以提取的通用性灵感

  1. 监视器可以免费:内部状态是推理的副产品——任何部署系统都应检查"哪些监控信号已经在 hidden states 里",再考虑花钱买采样;
  2. 动态特征优于快照:对过程性任务,表征/指标随时间的变化模式比单点值信息量更大——监控设计要捕捉趋势;
  3. 决策点读取=预警窗口:在不可逆动作执行前读取内部怀疑度,是把"事后归因"变"事前拦截"的通用时序设计;
  4. 跨模型一致性是性质证据:一个发现若在多个模型家族上复现,更可能是机制而非偶然——多模型网格应成为可靠性研究的默认配置;
  5. 防泄漏切分是 agent 评估的生命线:轨迹级切分(非轮次级)防的是"背答案"式虚高——所有时序数据评估都适用。