论文链接:https://arxiv.org/abs/2608.26324 发表时间:2026 年 8 月(arXiv:2608.26324) 机构:印度理工学院坎普尔(IIT Kanpur,纯高校,3 位作者) 代码:论文未提供公开代码仓库

一、论文背景

Best-of-N(BoN)采样是工业界部署最广的推理时对齐策略:从冻结的基座模型生成 n 个候选回答,用奖励模型逐个打分,返回分数最高的那个。它不需要梯度训练、兼容任何冻结模型、天然随测试时算力扩展,是 API 服务场景下最实用的选择。

但 BoN 有两个互不相干却都很棘手的问题。

第一个是 reward hacking(奖励作弊)。奖励模型只是真实偏好的代理,argmax 选择会系统性地挑出"代理模型打分虚高"的回答——候选越多,挑出的越极端,真实质量反而下降。这就是 Goodhart 定律在推理时的体现。Huang 等人 2025 年的形式化结果证明 BoN 不是 scaling-monotonic 的:n 超过临界值后,更多候选带来更差的对齐。

第二个是隐私泄露。奖励模型是用敏感的人类偏好数据(众包工人或领域专家的成对比较,蕴含个人价值观与文化背景)训练的,且越来越多地跨应用共享。每次奖励模型评估都在泄露训练数据的信息:BoN 的 argmax 在给定分数下是确定性的,攻击者只要构造围绕目标偏好对 (x0, y0+, y0−) 的提示词反复查询,就能从返回答案的分布偏移中推断这条数据是否在训练集里——这正是 LLM 成员推断攻击与下游输出泄露攻击的惯用信号。而差分隐私此前只被用于训练时(DP-SGD、私有 RLHF、私有 DPO 微调),推理时的隐私保护是空白。

这篇论文的问题意识非常漂亮:给 BoN 同时装上隐私保护和反 reward hacking,而且要证明这两件事不但不冲突,在某种意义上根本就是同一件事。

二、论文定位和关联工作

论文的关联工作沿三条线展开。

BoN 理论。Beirami 等人与 Yang 等人分析了 BoN 的 KL-奖励权衡;Verdun 等人提出 Soft BoN(SBoN),证明其以 O(1/n) 速率收敛到 KL 正则化最优;Aminian 等人在代理奖励误差下推导 SBoN 的 KL 与 regret 界;Khalaf 等人刻画了推理时 reward hacking;Yu 等人证明顺序测试时算力优于 BoN 类并行方法。最重要的基座是 Huang 等人:建立 regret 下界(skyline)Ω(√(C_π*·ε²_RM)),并用 χ² 正则化拒绝采样算法 InferenceTimePessimism(ITP)达到该下界。本文自陈 PrivBoN 在算法上等价于 SBoN,新意在于从隐私推导噪声尺度 σ、regret 最优性证明以及 PrivITP 扩展。

LLM 对齐中的差分隐私。全部已有工作都在训练时:Zhang 等人证明 KL 正则化本身为训练出的策略提供 DP;Zhou 等人研究标签 DP 下的私有鲁棒离线 RLHF;Wang 等人提出 DP-AdamW 做私有 DPO 微调。推理方向的私有预测、私有 top-k 选择与本文场景均不同。本文是第一个在推理时提供形式化隐私保证、保护奖励模型训练数据(部署期而非训练期)的工作。

机制设计工具。Gumbel-max 技巧等价于指数机制(McSherry & Talwar);Lebensold 等人关于高斯噪声选择机制的 ex-post 隐私分析为 PrivITP 的停时相关隐私界与 FSRC 组合框架提供工具;Rogers 等人与 Whitehouse 等人的隐私过滤器按最坏情形计费,被 FSRC 严格支配。

三、问题定义

设定:用户提交提示 x,系统返回回答 y。有基座策略 π0(全支撑)、在数据集 D 上训练的奖励模型 r̂_D、未知的真实奖励 r* ∈ [0, R_max]。算法设计者要构造推理时策略 π̂ 最大化真实奖励。

目标:所选回答满足对 D 的差分隐私——对只差一条个体数据的相邻数据集 D、D’,机制输出分布之比被 e^ε 约束,从而无论攻击者查询多少次、有什么侧信息,都无法从选择结果中提取任何单条偏好数据的信息。

代价度量用推理时 regret:Reg(π̂;x) = J(π*;x) − J(π̂;x),其中 J 为真实奖励期望,π* 是任意比较策略。regret 由三个量决定:奖励模型误差 ε_RM(x)(代理与真实的均方差)、覆盖系数 C_π*(x) = 1+2χ²(π*∥π0)(基座策略对目标策略的覆盖好坏)、候选数 n。Huang 等人的 skyline 定理:任何采样-评估框架下的算法都存在 r* 与 r̂_D 使 Reg ≥ (1/4)√(C_π*·ε²_RM)——这是不依赖算法的信息论下界。

核心研究问题:为了满足 ε-DP 而注入的噪声,是否必然突破这条 skyline?即"隐私税"是否为零?差分隐私要求敏感度 Δr(单条训练数据对奖励分数的最大影响)除以 ε 量级的噪声,而噪声会抹掉奖励信号——直观上两者冲突,本文要给出精确回答。

四、问题解法

PrivBoN:一次干预,两个目标

机制极简:对 n 个候选的奖励分数各加独立 Gumbel(0, σ) 噪声再取 argmax,σ = 2Δr/ε。

隐私证明靠经典等价:Gumbel 噪声加 argmax = 按 softmax 概率采样(Gumbel-max 技巧)= 以 r̂_D 为分数函数、1/σ 为隐私参数的指数机制。对相邻数据集,似然比逐项放缩后总计不超过 e^ε,故满足纯 ε-DP。

对齐性质由诱导策略的闭式刻画:n→∞ 时 PrivBoN 策略逐点收敛到 KL 正则化最优 π_∞(y|x) ∝ π0(y|x)·exp(r̂_D(x,y)/σ),即精确实现 max_π E[r̂_D] − σ·KL(π∥π0)。噪声尺度 σ 同时控制隐私预算(ε=2Δr/σ)和 KL 正则强度——关键问题变成这两个要求对 σ 的需求是否相容。

Regret 分解为四项:σC_π*(KL 偏差,噪声大则欠利用奖励信号)+ ε²_RM/σ(过度优化,噪声小则过度榨取模型误差)+ √(C_π*)·ε_RM(不可约项,即 skyline 本身)+ 指数小的有限样本项。平衡前两项得最优噪声 σ* = ε_RM/√C_π*,此时 regret ≤ 3√(C_π*·ε²_RM),匹配 skyline。

“隐私免费"阈值:当 σ 由隐私预算设定(σ=2Δr/ε)时,只要 ε ≥ ε* = 2Δr·√C_π*/ε_RM,隐私要求的噪声不超过对齐最优噪声,regret 仍匹配 skyline——隐私分文不花。示例:ε_RM=0.35、Δr=0.1、C_π*=2 时 ε*≈0.8,任何 0.8 以上的隐私预算都是免费的。

为什么必须用 Gumbel 而不是高斯:附录 E 证明高斯版虽然也满足纯 DP(隐私预算依赖数值积分且随 n 缓慢增长),但其诱导策略没有闭式 tilt 形式;更致命的是由极值理论,n→∞ 时高斯选择集中到 r̂_D 最高的候选上,退化回硬 BoN——软化失效。

PrivITP:解决 ε* 不可验证的问题

PrivBoN 的免费阈值依赖未知的覆盖系数 C_π*,实践中无法验证自己的隐私预算是否落在免费区。PrivITP(Private Inference-Time Pessimism)换路线:χ² 正则化拒绝采样 + 两阶段高斯机制。

阶段一(私有归一化):采样 n 个候选,解经验归一化方程 (1/n)Σrelu(β⁻¹(r_i−λ))=1 得 λ,加高斯噪声得私有归一化常数 λ̃。

阶段二(私有拒绝采样):采一批全新候选(两批独立对隐私与 regret 分析都至关重要),奖励加高斯噪声后按接受概率 w_i = relu(β⁻¹(r̃_i−λ̃))/M 做伯努利拒绝,遇到第一个接受者即返回(停时 t)。

关键设计:ReLU 权重实现"悲观主义”——噪声奖励低于 λ̃ 的候选零权重,直接丢弃奖励模型没有把握排到总体均值之上的回答。这个悲观机制本身就独立于注入噪声抑制 reward hacking,于是正则参数 β(管对齐)与噪声 σ(管隐私)彻底解耦。

隐私分析的技术核心是 reformulation 引理:把 ReLU 接受权重映射为随机阈值机制,得到与 n 无关、只随实际停时 t 线性增长的 ex-post 纯 DP 界 ε₂^post(t)——信息量大的奖励模型下拒绝很快(E[t]=O(1)),实际隐私代价远小于最坏情形。regret 分析靠 smoothed-weight 策略比较引理统一处理阈值噪声、查询噪声与有限样本效应,最终 Reg ≲ βC_π* + β⁻¹(ε²_RM + R_max·σ) + skyline + R_max/√n,最优 β* 下匹配 skyline 至一个噪声膨胀项 R_max·σ,干净分离对齐误差与隐私代价。

多查询部署:ex-post 结构配合 FSRC(Filtered Self-Reporting Composition)组合——按实际花费而非最坏情形记账,预算耗尽即停——期望可答查询数 E[T*] ≥ ε_total/E[ε_τ],在有利区间是最坏情形组合的 Θ(ε_max/E[ε_τ]) 倍。

五、评估指标与实验证据

实验沿用 Huang 等人的设置:4 个奖励模型(Oasst-1.4B、Gemma-2B、Llama-3B、Armo-7B,强弱梯度分明)、2 个基座(Phi-3-Mini、Gemma-2-2B),GSM8K/MMLU/MATH 三个可验证数据集,每提示温度 1 采样 1 万条回答做 50 次 bootstrap。指标为相对基座的准确率提升与期望代理奖励。

主结果(Phi-3-Mini 基座,n=2¹²,准确率提升 %):

数据集算法Oasst-RM(弱)Gemma-RMLlama-RMArmo-RM(强)
GSM8KBoN−5.18−1.877.646.47
GSM8KPrivBoN0.321.156.905.78
GSM8KPrivITP0.811.687.466.63
GSM8KITP(非私有上界)0.852.007.616.81
MATHBoN−5.212.1010.806.10
MATHPrivITP1.723.3810.287.04

三个规律清晰可见:①弱奖励模型下 BoN 出现显著负提升(reward hacking 实锤),私有算法把它翻正;②PrivITP 在每一个(RM, 数据集)配置上支配 PrivBoN;③GSM8K 上 PrivITP 恢复非私有 ITP skyline 的 84-98%,MMLU/MATH 上也在标准误内贴齐。强 RM(Llama、Armo)下 BoN 在该 n 范围尚有竞争力——hacking 压力在基座准确率低时被推迟,但缩放曲线已经显出分岔。

缩放行为(图 1):BoN 的准确率先升后降而代理奖励单调上升——两条曲线分叉即 Goodhart 定律的可见形态;PrivBoN 与 PrivITP 准确率随 n 单调不降,代理奖励饱和不发散。理论还给出交叉点:超过 n* 后 PrivBoN 的真实奖励严格高于 BoN,典型奖励模型下 n* 远小于 100。

机制证据(命题 3.6):n→∞ 时 BoN 胜率趋于 1、hacking gap 以 O(σ_r√log n) 无界增长;PrivBoN 胜率饱和于 Φ(σ_r/(σ√2))<1、hacking gap 收敛到有限值 σ_r²/σ。噪声使选择无法无限榨取奖励模型误差。

多查询部署:Gemma-RM、n=16、β=0.05、总预算 ε_total=50 下,FSRC 组合的 PrivITP 比标准组合多答约 3 倍查询(10 个随机种子),实测停时 t≪n 印证 E[t]=O(1)。

消融与开销:σ 扫描呈单峰曲线(小 σ 趋向 BoN 的 hacking,大 σ 过度正则回落到基座水平),与理论一致;PrivITP 的最优 β 基本不随隐私预算变化——实验验证了 β 与 σ 解耦的理论主张。墙钟开销上 PrivITP 只比 PrivBoN 多 6-14%(阶段二惰性生成,实际成本 n+E[t] 而非 2n)。开放生成任务 AlpacaEval-2.0 上(弱代理 + Prometheus 金标裁判),私有变体与 BoN 差距 2-3 个点且在标准误内重叠——该场景 win-rate 已饱和、代理与金标足够一致,隐私几乎白送。

六、效果优势的根源解释

本文的力量在于一条完整的因果链:同一干预(软化 argmax)→ 两种性质(隐私 + 抗 hacking)→ 指标同时改善。

根源一:argmax 的双重身份是问题的交汇点。 BoN 的病根是硬 argmax:它对分数的微小差异无限敏感,所以(a)单条训练数据引起的分数扰动被确定性地放大到选择结果上——这是隐私泄露通道;(b)代理奖励的高斯误差 ε ~ N(0, σ_r²) 的极端值被 argmax 精确捕捉——n 个样本的最大误差以 σ_r√(2log n) 增长,这是 hacking 通道。PrivBoN 加 Gumbel 噪声后 argmax 变 softmax:(a’) 分数扰动经过概率化稀释,似然比被 e^ε 封顶——隐私成立;(b’) 选择概率随分数差距指数衰减,误差极端值不再必然胜出,hacking gap 收敛到 σ_r²/σ。方法差异(加噪 vs 不加)→ 机制变化(确定性放大变概率软化)→ 指标提升(弱 RM 下 GSM8K 从 −5.18% 到 +0.32%,且随 n 单调)。

根源二:噪声尺度的巧合是结构性的。 对齐理论早已知道最优正则是 σ* = ε_RM/√C_π*(平衡欠利用与过优化);隐私理论要求 σ ≥ 2Δr/ε。两者相容当 ε ≥ 2Δr√C_π*/ε_RM,因为两个目标实现软化的机制是同一个:温度为 σ 的 softmax。这不是数值巧合而是 Remark 3.4 所说的结构巧合——所以才可能有"隐私免费"区间,弱 RM 场景(ε_RM 大 → σ* 大 → 免费阈值低)最容易享受免费隐私。

根源三:悲观主义独立于噪声,实现参数解耦。 PrivBoN 的 σ 身兼隐私与正则两职,阈值 ε* 又依赖不可观测的 C_π*。PrivITP 用 ReLU 截断单独承担抗 hacking(奖励模型没把握的回答直接零权重),噪声只管隐私。机制变化:正则的最优 β* 不再被隐私需求绑架。指标表现:PrivITP 全面支配 PrivBoN,且消融证实最优 β 几乎不随隐私预算移动;regret 界中噪声只以加性项 R_max·σ 进入——隐私的边际代价是可加的而非乘性的。

根源四:ex-post 计费让隐私预算花在刀刃上。 拒绝采样"接受即停"意味着信息量大的查询实际只消耗 E[t]=O(1) 轮隐私,而最坏情形组合按 n 计费。FSRC 按实际停时记账,预算利用率提升 Θ(ε_max/E[ε_τ]) 倍。方法差异(实际成本 vs 最坏成本)→ 机制变化(快速接受的查询省下预算)→ 指标提升(同预算多答 3 倍查询)。

一句话总结:隐私和抗 reward hacking 都是在要求"别把 argmax 用到极致",所以注入的噪声不是隐私税,而是本来就该付的正则化成本——PrivBoN 证明了两者尺度恰好相容,PrivITP 把两者的旋钮彻底分开。

七、必要知识反推

读懂本文需要以下前置知识(按依赖顺序):

  1. 差分隐私基础:ε-DP/(ε,δ)-DP 的定义(相邻数据集上输出分布的似然比约束)、敏感度 Δr 的概念、指数机制及其纯 DP 保证、高斯机制与 report-noisy-max。不懂这些无法理解定理 3.1 的两行证明为何成立。
  2. Gumbel-max 技巧:Gumbel 噪声加 argmax 等价于按 softmax 概率采样——本文整个 PrivBoN 的枢纽;顺带需要了解极值理论中 Gumbel 与高斯极值行为的差异(为什么高斯版 n→∞ 会退化回硬 BoN)。
  3. BoN 的对齐理论:Beirami 等人的 KL-奖励权衡、win-rate n/(n+1) 公式、tilted distribution π_β ∝ π0·e^(βr);特别是 Huang 等人 2025 的 regret skyline 与 InferenceTimePessimism 算法——本文的直接理论基座与对比基线。
  4. χ² 散度与覆盖系数:C_π = 1+2χ²(π∥π0) 为何度量基座策略对目标策略的支撑、它与 regret 下界的联系;χ² 正则化与 KL 正则化在推理时的等价/差异。
  5. Goodhart 定律与 reward overoptimization:Gao 等人的 scaling laws——代理奖励与真实奖励随优化强度分叉的实证现象,本文 hacking gap E_π̂[ε(x,y)] 指标的来源。
  6. 拒绝采样与悲观主义:拒绝采样基本流程;在离线 RL/对齐中"对不确定奖励悲观加权"的思想来源。
  7. ex-post DP 与自适应组合:ex-ante(最坏情形)与 ex-post(按实现输出计费)隐私会计的区别;FSRC 框架与 privacy filters 的对比、Wald 恒等式在停时分析中的用法。
  8. 成员推断攻击:Carlini 等人的训练数据抽取攻击——理解"为什么 BoN 的确定性选择是隐私泄露通道"的威胁模型背景。

八、通用性灵感

  1. 一个干预解决两个问题的"对偶"结构值得优先寻找。本文最漂亮的发现是隐私与正则化在 argmax 软化上是同一件事。设计系统时遇到两个看似冲突的约束,值得先问:它们是否在某个更深的层面共享机制?如果是,解会便宜得多。
  2. “看似有代价的保护"可能是免费的。直觉上隐私噪声必然伤害质量,本文证明只要预算超过阈值 ε*,代价严格为零。工程启示:给任何"保障性开销”(隐私、安全、鲁棒性)做成本核算时,先算清楚它与既有最优配置的重叠区间,别默认它是纯税。
  3. 确定性选择是隐私与过拟合的共同放大器。任何"按分数取最优"的组件(top-k 检索、argmax 解码、最优重排)都同时具备两条风险通道:输入微小扰动的确定性放大(隐私/稳定性问题)与代理指标误差的极值捕捉(Goodhart 问题)。加适当噪声/温度软化是通用缓解手段。
  4. 按实际消耗而非最坏情形记账,能解锁数量级的资源效率。ex-post 隐私 + FSRC 组合把查询吞吐放大 3 倍,本质与"按需计算"“惰性求值"同构:凡是成本依赖随机停时/实现路径的场景(早停训练、级联模型、自适应检索),都该检查最坏情形计费是否严重高估了平均消耗。
  5. 解耦超参数是可维护性的理论保障。PrivBoN 的 σ 一肩挑两担,PrivITP 把 β 与 σ 分开,消融直接验证了"最优 β 不随隐私预算变”。接口设计层面同理:让每个旋钮只管一件事,调参空间才可导航。
  6. 理论阈值不可验证时,换个不需要它的算法。ε* 依赖不可观测的 C_π*,作者的应对不是估计 C_π* 而是设计 PrivITP 绕开它。这种"把不可验证的前提转化为算法选择依据"的思路,在理论落地时比强行估计更稳健。
  7. 弱代理模型的场景是软选择方法最好的试验田。强 RM 下 BoN 与私有方法差距不大(hacking 被推迟),弱 RM 下立即分出胜负。评估任何抗过优化方法时,应刻意构造"代理与目标错位最大"的压测条件,否则容易得出方法无效的错误结论。