Privacy Without Regret: Differentially Private Inference-Time Alignment 精读

印度理工坎普尔提出推理时对齐的差分隐私方法 PrivBoN 与 PrivITP。核心洞察是:差分隐私与抗 reward hacking 本质上是同一个干预——把 Best-of-N 的硬 argmax 软化。PrivBoN 在奖励分数上加尺度 σ=2Δr/ε 的 Gumbel 噪声,等价于指数机制实现 ε-DP,同时等价于 KL 正则化对齐;当隐私预算超过阈值 ε* 时,隐私要求的噪声恰好就是对齐最优的正则,隐私零成本。PrivITP 进一步用 χ² 正则化拒绝采样加两阶段高斯机制,把正则参数与隐私参数解耦,隐私代价只随实际停时增长。实验中弱奖励模型下 BoN 出现负提升(GSM8K 上 −5.18%),而 PrivITP 反而 +0.81%,并在固定隐私预算下靠 FSRC 组合多答约 3 倍查询。

August 31, 2026 · 4 min

J-Zero: Unified Challenger-Solver-Judge Co-Evolution from Zero Data 精读

自进化大模型在可验证领域已有成熟方案,但在没有标准答案的开放域,学习信号只能来自打分模型,而固定的Judge只能把Solver推到自己内化偏好的上限,饱和后奖励失去区分度。J-Zero让Challenger、Solver、Judge三者零数据共同进化:出题者与解题者通过GRPO对抗博弈,Judge依靠角色不对称与子任务放大两类结构性偏好对做Bradley-Terry更新,标签由构造方式先验决定而非Judge打分,避免自我强化偏差。Qwen3-4B上可验证域提升9.47分、不可验证域提升11.23分,超越R-Zero 4.74分,并持续改进十个迭代而baseline两迭代后退化。本文按九部分结构精读其动机、机制、实验证据与可迁移灵感。

August 29, 2026 · 7 min

Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking 精读

本文精读西湖大学、浙江大学与快手可灵团队合著的 arXiv 2608.20011。论文形式化了流匹配生成模型偏好优化中的流形漂移现象:偏好更新会把轨迹终端样本推离预训练数据流形,产生非零法向位移,这是 reward hacking 的结构性根因。理论上,最优流匹配能精确恢复数据分布,而偏好更新一旦含非零法向分量必然离流形。方法上提出 THERMODPO,用带温度的三态能量 softmax 在胜者侧加流形锚,统一了 RFT 与 FlowDPO,并对流形距离给出逐点上界。实验显示玩具基准 StrictScore 达 0.899,SD3.5-M 四指标宏平均提升 16.0%、OCR 提升 47.5%,FLUX.2 上复现同趋势。

August 24, 2026 · 4 min

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models 精读

深度精读港大与腾讯联合出品的 OSReward——首个系统检验计算机使用 Agent(CUA)轨迹评判器可靠性的基准与开源奖励模型工作。论文构建了覆盖 Web/Windows/macOS/Ubuntu/Mobile 五大平台的 1,019 条人工标注轨迹基准,揭示了所有主流 VLM 评判器存在的系统性「宽容偏差」,并训练出成本降低 30-60 倍的开源奖励模型 OS-Shepherd。本精读从背景补全、研究脉络定位、问题抽象、方法机制、评估证据、效果根源、必要知识反推到可推广灵感,九部分完整拆解这项为 CUA 评判建立标准化评估体系的开创性研究。

August 8, 2026 · 8 min

Verbalizable Representations Form a Global Workspace in Language Models 精读

Anthropic团队在Claude模型内部发现了一个类似人脑全局工作空间的特权表示子空间——J-space。它由一小撮不断演变的’未说出的词语’组成,仅占激活方差不到10%,却承担着言语报告、内部推理、灵活泛化和自我监控的核心功能。本文深度解析Jacobian Lens技术、J-space的五个功能属性、以及反事实反思训练这一全新对齐范式。

July 7, 2026 · 4 min

QUBRIC: 协同设计查询与评分标准,突破可验证奖励的强化学习瓶颈 精读

深度精读 Amazon 与佐治亚理工学院联合发表的 QUBRIC 论文——一个协同设计查询(Query)和评分标准(Rubric)的框架,通过关键点锚定的查询重写、对比式评分标准生成和可学习性过滤,突破传统 Rubric-based RL 中’评分标准质量受限于查询结构’的根本瓶颈。在 ArenaHard 上取得 +5.5 的增益,并零样本迁移到法律、道德、叙事推理三个未见基准上,平均提升 +6.3 分。本文揭示了查询与评分标准的结构耦合关系,为将 RL 扩展到不可验证领域提供了实用路径。

June 10, 2026 · 4 min

Skill-RM: 通过 Agent Skill 统一异构奖励评估标准 精读

深度精读中山大学、香港中文大学、北京大学、ETH苏黎世与阿里巴巴通义千问团队联合发表的 Skill-RM 论文——将奖励建模重新定义为可复用的’奖励评估技能’(Reward-Evaluation Skill),通过结构化的 Agent 技能编排异构评估资源(评分准则、验证器、检查清单、聚合规则),在 RewardBench2、RM-Bench、JudgeBench 三大基准上全面超越传统 LLM-as-a-Judge 和专用奖励模型,为 LLM 后训练提供统一、可解释、可扩展的奖励信号框架。

June 10, 2026 · 4 min