Do Agents Know When They Succeed? Calibrating Agent Confidence from Internal Representations 精读

UMass Amherst 的这篇论文利用 LLM 内部表征预测智能体任务成败:Latent Trajectory Dynamics(LTD)总结交互轨迹上残差流表征的变化动态,Action Representation Probe(ARP)在动作决策点读取表征预测成功。在 InterCode 的 Bash/SQL/Python 三个交互基准 × Qwen-14B/Qwen-7B/DeepSeek-6.7B 三个模型家族上,两方法全面超越表层 token 概率与序列校准基线(漏损泄漏的交叉验证协议),且零额外开销——不改提示、不需多样本 rollout。智能体安全关键应用第一次有了’从模型内部读出置信度’的免费监视器。

September 11, 2026 · 1 min