论文链接:Proof-Carrying Cognition: Closing the Verification Gap with Reality-Settled Reward 发表时间:2026年9月10日 机构:独立研究者(方法论+强实证预注册式研究) 领域标签:cs.LG / Verification Theory / RL / Reward Hacking

一、论文背景

AI 进步的叙事围绕生成侧扩展:更多算力、更多数据、更强生成分辨率。但每个生成能力都需要一个验证能力来筛-select-奖励它:RLHF 需要奖励模型验证回答质量,自我改进需要验证器筛选改进,AI 科学家需要验证发现真伪。验证的分辨率若跟不上生成,扩展只是在生产更多无法筛选的候选。

Goodhart 定律的现代形式——reward hacking——正是这个瓶颈的症状:proxy 验证器在足够强的优化压力下必然被攻破。此前的应对(更强 RM、RLAIF、宪法式 AI)仍停留在"用生成能力造验证器",本文认为这是用问题解决问题——验证的锚点必须在生成系统之外。

二、论文定位和关联工作

路线验证来源结局
更强 RM / RLAIF生成模型自评递归 Goodhart,proxy 上升真值下降
形式验证(Lean 等)数学定理领域受限
Verifiable reward(RLVR)可执行任务本文的近亲,推广到普适理论
Proof-Carrying Cognition现实结算普适框架+理论+实证

定位结论:本文把散落的 verifiable reward 实践提升为普适理论(验证瓶颈归约论+verifier correlation 汇率定理),并用预注册式攻击实验与 GRPO 真值复现完成证据闭环。

三、问题定义

核心论题:验证瓶颈是普适约束——其它瓶颈(数据、算力、对齐)归约为它;验证质量由 verifier correlation(验证器输出与真值的秩相关 ρ)刻画,ρ 决定"算力→能力"的转化率。

两个必须回答的问题:(1) 不完美验证器(ρ<1)在优化压力下的失效形态是什么?(2) 如何在不要求完美验证器的前提下维持真值增益?

四、问题解法

1. 理论层(第 3 节):verifier correlation 是算力-能力汇率——能力增益 ∝ f(ρ, compute);命题 1 给出定量预测(ρ=0.5 实现可靠验证器约一半增益)。

2. 攻击层(第 4 节):Asymmetric Verification 攻击——在 6-token 极小域与 ~10¹⁰ 程序域(预注册放大复制,2–4× 任务量+更强工具)中,让优化器显式攻击验证器:不可靠验证器呈现 Soundness-under-Pressure 失效——优化压力越大,代理通过率越偏离真值(hacking gap 从 ~0.27 到 ~0:对手完全攻破)。

3. 解法层(第 5 节):Reality-Settled Reward——奖励不来自 proxy 判分,而来自现实结算(程序执行结果、物理实验、真实系统反馈);结算流持续重校验证器。锚定结算把 proxy-真值相关性钉在高位。

4. 真值训练复现(GRPO):冻结学习 RM 画出经典 overoptimization 曲线——proxy 攀升、executed reward 崩溃 90%;同一 RM 以 10% on-policy 结算流重训:executed reward 保持为冻结组 6×,并优于等预算 LLM-judge 更新对照。

五、评估指标与实验证据

  • 理论验证:N=4096 时 ρ=0.5 验证器实现可靠验证器增益的 50.2%——与命题 1 精确匹配;
  • 攻击失效:hacking gap 在对手压力下 0.27→~0(验证完全失效);对抗"显式建模结算过程"的对手仍守住(soundness 随结算标签对数线性增长);
  • 标签效率:on-policy 结算比随机标注标签效率高 ~10×——结算流的价值在于其分布命中优化压力最大的区域;
  • GRPO 复现:冻结 RM executed reward 崩溃 90%;10% 结算重训保持 6×;漂移抑制:锚定结算降漂移 26%(冻结验证器无改善)。

六、效果优势的根源解释

为什么现实结算赢过一切 proxy?机制在闭环锚定:

  1. 分布匹配:on-policy 结算流的样本来自"当前策略正试图攻破的区域"——正是 proxy 最容易失真的区域;随机标注命中不了这些区域,故效率低 10×;
  2. 漂移抑制:策略随训练移动,proxy 的失真区域随之移动;持续结算等于每一步重校零点,把 ρ 钉住;
  3. 对手适应性:即使对手建模结算过程(白盒攻击),结算锚点在系统外——攻击结算本身需要伪造现实(执行结果/物理反馈),难度性质不同;
  4. 与理论自洽:50.2% vs 50% 的实证-理论吻合说明框架不是事后拟合——汇率定理具有预测力。

因果链:结算流锚定 ρ → 算力-能力转化率保持 → 真值增益随算力对数线性扩展而非崩溃。

七、必要知识反推

  • Reward hacking / Goodhart:优化 proxy 指标导致真值退化的现象,RLHF 核心难题。
  • RLVR(Verifiable Reward RL):o1/R1 类模型用可执行验证(代码测试、数学检验)作奖励源——本文的实践近亲与推广对象。
  • GRPO:组相对策略优化(DeepSeek R1 使用),本文真值复现的训练框架。
  • 预注册研究:假设与分析计划先于数据收集固定——本文攻击实验的可信度支柱。

八、论文中可以提取的通用性灵感

  1. 瓶颈归约思维:把多个表面瓶颈追问到一个根瓶颈(本文:一切归约为验证),能统一碎片化的应对策略——诊断系统问题时先做归约分析;
  2. 验证质量是汇率不是开关:不完美验证器仍有价值(ρ 决定转化率)——工程上"多差的验证器值得用"有了量化答案;
  3. 结算流要 on-policy:反馈样本必须命中系统正施加压力的区域——任何监控/审计系统的采样都应随被测系统的行为分布移动;
  4. 攻击是最好的体检:预注册的对抗压力测试比无对手的评测更能暴露验证器失真——评测管线应标配"优化器作为攻击者"的红队模式;
  5. 锚点在系统外:自指系统(AI 训 AI、agent 评 agent)的可靠性来自外部现实锚点(执行、物理、人类实验)——闭环越深,越需要外部结算。