论文 A 链接:Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents 论文 A 代码:caiqizh/xconf 论文 B 链接:Not All Agents Are Equal: Code Quality and Post-Merge Maintenance Across Five Autonomous Coding Agents 发表时间:2026年9月 机构:A:剑桥大学 × Google DeepMind(企业+高校:DeepMind 的 Dharshan Kumaran 提供认知科学视角);B:德州理工大学 领域标签:cs.CL / cs.SE / LLM 可信性 / 软件仓库挖掘


一、论文背景(两篇共用的问题域)

AI 系统的"自知之明"缺口:当 LLM/Agent 输出一个答案,它同时应该回答另一个问题——“我有多大把握是对的?“这就是置信度估计(confidence estimation)。它直接决定三件事:交付还是弃答、上报还是自行处理、重试还是止损。

现有方法共享一个盲区(XConf 的切入点):所有主流估计器——自省式(让模型自述置信度)、token 概率式(读 logit)、采样式(self-consistency 投票)——都只看当前这一次推理。但人类不是这样:一个医生对罕见病的把握,来自他记忆中上次类似病例的结果。经验在机器置信度里完全缺席。

Agent 代码质量的经验证据缺口(Not All Agents 的切入点):编码 Agent 已在大规模开 PR,但"AI 写的代码落地后怎样"停留在轶事层面——被 revert 多吗?更不安全吗?人类 reviewer 为它们买单多少?缺的不是观点而是带厂商溯源的大规模数据。

两篇论文恰好构成 Agent 可信性的两翼:事前(输出时刻的置信度)与事后(合并之后的实际质量)。

二、论文定位和关联工作

XConf 的谱系

方法族代表机制缺陷
言语化置信“How confident are you?”模型自述数字校准差,系统性过自信
logit 式语义熵、token 概率读内部概率需 logit 访问;无法捕捉"系统性盲区”
采样式Self-Consistency、Semantic Entropy多次采样看一致性成本×N;编码/Agent 任务上"一次执行即定"天然失效
经验式(本文)XConf检索自身历史战绩需要可评级经验流

近亲是 ExpeL、Reflexion 等经验学习工作——但它们用经验改进能力,XConf 用经验校准置信度,问题正交。

Not All Agents 的谱系

软件仓库挖掘(MSR)领域此前对"AI 生成代码"的研究多基于 Copilot 单点补全或无溯源混合数据;AIDev 数据集首次给 PR 打上五厂商(Codex/Devin/Copilot/Cursor/Claude Code)标签。本文 = AIDev × 58,792 份缓存 API 响应 × 匹配人类基线的统计框架。

三、问题定义

XConf

具体场景:Agent 完成任务并自述"我有 90% 把握”——这个数字可信吗? 抽象问题:给定当前任务 t 与模型自述置信 c,结合模型在"相似任务且相似自述置信"上的历史结果分布,输出一个校准的成败概率。 本质是把置信度从"单次推断"重构为"经验条件频率"——贝叶斯的味道:自述置信是先验,历史战绩是似然修正。

Not All Agents

抽象问题:控制任务/仓库/时间混杂因素后,不同厂商 Agent 产出的 PR 在安全气味、可维护性、合并后 churn、revert 率、评审行为上与人类基线的差异是否显著,且差异归属厂商还是"AI"这个类别? 这是一个因果归因设计:odds ratio + 匹配基线把"Agent vs 人类"拆成"各厂商 vs 人类"。

四、问题解法

4.1 XConf 的两阶段

经验库:模型自己的"评级过的剧集"——每条含(任务、模型反思、自述置信、真实结果、一句话教训)。教训在成绩到达后写入(如"通用测试通过了但边界用例翻车——检查 DST 转换")。

Recall(检索):新任务来时,检索"任务相似 且 当初自述置信相似"的历史剧集,读出历史成功率。双条件检索是关键:只按任务相似检索会把不同把握度的历史混在一起;加入置信条件后,检索到的正是"我以前在这种任务上嘴硬时打得怎么样"。

Reflect(反思):把这份战绩单展示给模型,让它(1)命名自己的复发失败模式,(2)基于记录重述置信度。例:初始 0.90 → 看到历史成功率 0.60 且教训是"通用测试会漏边界" → 修正为 0.55。

工程性质:format-general(推理/编码/多模态/交互 Agent 通吃)、无需 logit、无需训练、成本=1 次额外生成。

4.2 Not All Agents 的测量框架

37,623 个 PR(2,807 仓库,2024.12–2025.07)×5 Agent+人类基线;指标:

  • 安全气味:新增代码中的硬编码凭据、eval 式构造等(静态分析);
  • 可维护性:结构复杂度度量;
  • 合并后 churn:后续修改量;revert 率:被回滚比例(odds ratio 归一);
  • 评审行为:人类评审数、修改请求数、首次评审等待时长。

统计上对仓库、时间、PR 规模做控制,全流水线开源。

五、评估指标与实验证据

5.1 XConf

指标:AUROC(判别力:置信分数能否分开对错)、ECE(校准误差:置信与真实正确率的偏差)、选择性预测收益(弃答最不确定的 x% 后的成功率提升)。

主结果(9 基准 × 4 模型 × 3 家族):

对比结果
XConf vs 10-sample self-consistency(AUROC)24 组中 23 组胜或平
校准 ECE显著更低
生成成本1/10
选择性预测弃答 10% 最不确定 → Agent 任务成功率最高 +8.7 分

证明力分析:9 基准覆盖单步推理到交互 Agent,证明 format-general 不是单点调参;“编码与 Agent 任务上优势最大"恰好是 self-consistency 的理论盲区(无法多次执行)——效应出现在预期位置,机制解释与数据吻合。

5.2 Not All Agents

三大发现(均带效应量):

维度结果数字
Revert 率Codex ≈ 人类的一半;Devin 反而更高Codex 6.1% vs 人类 11.5%(OR 0.50);Devin 14.5%(OR 1.31)
安全气味Agent 汇总后低于人类OR 0.63,主因硬编码凭据与 eval 构造更少
评审负担分布不均Copilot PR 人类评审与修改请求最多;Claude Code PR 首次评审等待最长(中位 12.6h)

证明力分析:厂商间方向相反的结果(Codex↓Devin↑)排除了"AI 普遍更差/更好"的混杂解释——如果效应来自"AI"本身,五家应同向。这是论文标题"Not All Agents Are Equal"的统计学底气。

六、效果优势的根源解释

6.1 XConf:为什么经验能打败采样

因果链:自述置信携带模型的"内部把握感"但系统性过自信(已知现象)→ 该过自信具有个人化模式(同一模型总在同类任务上嘴硬)→ 按(任务相似×置信相似)检索的历史子集正是这些模式的直接统计 → 用经验频率重标定,等于针对"这个模型的这类错误"做个性化校准 → AUROC/ECE 双改善。

对比之下 self-consistency 的机制是"采样分歧度≈不确定性”——它测的是模型的输出方差,测不出"一致地错"(consistently wrong:所有采样共享同一盲区时投票一致而全错)。经验式恰好覆盖这一盲区:历史上"一致地错"的类别在战绩单里就是低胜率。【论文实验支持:编码/Agent 任务(最易一致错)上优势最大】

证据等级:机制主干【论文实验支持】;“个性化校准"解释(相对全局校准的优势)【阅读者推测,论文未做分用户/分错误类别的校准分解】。

6.2 Not All Agents:为什么差异是厂商特定的

因果链:各家 Agent 的差异不在底层模型(多数租用同级前沿模型)而在工程系统——任务分解策略、diff 粒度控制、测试证据的使用、PR 描述规范 → 这些系统差异直接映射为代码行为差异(revert 率、气味密度)→ 因此质量信号应归属"厂商系统"而非"AI 类别”。

【论文实验支持】厂商间异质性本身;【阅读者推测】“系统差异是主因"的归因(论文未打开各厂商系统的黑盒做机制验证)。

6.3 相关工作检索与对照(合并)

研究与本文关系对根源解释的影响
Semantic Entropy(Farquhar et al.)采样式不确定性 SOTA限定:XConf 未在纯事实 QA 上全面胜出——采样族在"分歧可测"的场景仍强
“Just Ask for Calibration”(Tian et al.)言语化置信基线支持:确认言语化过自信,为经验修正留出空间
ExpeL / Reflexion经验改能力而非置信补充:经验流的第二种用途
Coding Agent 早期实证(如 “Do LLM-written PRs get merged?”) 类研究小样本/无溯源支持:本文放大样本并加入厂商维度后结论更细
SWE-bench 系评测合并前能力补充:本文测合并后命运,正交且互补

6.4 综合判断

多研究共同支持:言语化置信过自信是稳健现象;采样式在可多次执行的任务上失效;经验/战绩信息能校准置信。 仍属推测:XConf 经验库的冷启动(新模型/新任务族无战绩时的退化速度未量化);厂商质量差异的系统级根因。 适用边界:XConf 需要结果可评级的闭环(能打分的场景才攒得下战绩);Not All Agents 的结论受时间窗限制(2024.12–2025.07 的产品版本)。

七、必要知识反推

XConf:

  • 校准理论(ECE/AUROC 的计算与含义)——没有指标体系无法证明改进;
  • 检索系统设计(双条件相似度);
  • 认知科学中的 metacognition(元认知)研究——“自知之明来自经验"的人类认知先例(DeepMind 合作者的价值所在);
  • Agent 剧情记录工程。

Not All Agents:

  • 软件仓库挖掘方法(GitHub API、溯源推断);
  • 观察因果学(混杂控制、odds ratio、匹配设计);
  • 安全气味静态分析工具链。

融合关键节点:XConf 把认知科学的"metacognition 靠经验"翻译成可运行的检索+反思回路;Not All Agents 把业界争论翻译成"厂商分层的统计检验”——两者共同的方法论内核是:把可信性从"印象"变成"可测量的量”。

八、论文中可以提取的通用性灵感

  1. 置信度是个性化的:同一模型的不同错误指纹需要不同校准

    • 论文证据:按(任务×自述置信)双条件检索的战绩修正最有效。
    • 推广场景:任何自动决策系统的风险闸门(风控模型按客群分层校准阈值;医疗 AI 按病种族校准弃答率)。
  2. “一致地错"是采样式方法的理论盲区,历史数据是解药

    • 论文证据:编码/Agent 任务(一次执行)上 XConf 优势最大。
    • 推广场景:无法重复执行的决策(交易、部署、发邮件)——记录结果并回馈校准器。
  3. 弃答 10% 换 +8.7 分:可信系统的 ROI 在尾部

    • 论文证据:选择性预测实验。
    • 推广场景:客服自动化(转人工率-成功率曲线找拐点)、自动驾驶接管策略、简历筛选的人工复核队列。
  4. 类别归因要警惕:先问"哪个厂商”,再问"AI 是否"

    • 论文证据:Codex OR 0.50 与 Devin OR 1.31 同框。
    • 推广场景:任何"新技术 vs 旧技术"的评估设计(自动驾驶事故率应按系统分层而非按"自动驾驶"整体);采购决策应评估具体产品而非类别均值。
  5. 合并后的命运才是代码质量的最终考场

    • 论文证据:revert/churn/评审负担三维合并后指标。
    • 推广场景:内容平台(发布后留存而非发布时质量)、学术论文(被引/复现而非接收)——一切"上线时指标"都应配一个"生存指标"。

本精读基于 arXiv:2609.17708 与 arXiv:2609.17598 全文撰写;实验数字均出自论文表图;外部检索截至 2026-09-18。