Privacy Without Regret: Differentially Private Inference-Time Alignment 精读
印度理工坎普尔提出推理时对齐的差分隐私方法 PrivBoN 与 PrivITP。核心洞察是:差分隐私与抗 reward hacking 本质上是同一个干预——把 Best-of-N 的硬 argmax 软化。PrivBoN 在奖励分数上加尺度 σ=2Δr/ε 的 Gumbel 噪声,等价于指数机制实现 ε-DP,同时等价于 KL 正则化对齐;当隐私预算超过阈值 ε* 时,隐私要求的噪声恰好就是对齐最优的正则,隐私零成本。PrivITP 进一步用 χ² 正则化拒绝采样加两阶段高斯机制,把正则参数与隐私参数解耦,隐私代价只随实际停时增长。实验中弱奖励模型下 BoN 出现负提升(GSM8K 上 −5.18%),而 PrivITP 反而 +0.81%,并在固定隐私预算下靠 FSRC 组合多答约 3 倍查询。