论文信息

  • 论文标题:Manifold Drift in Flow Preference Optimization: A Root Cause of Reward Hacking
  • 论文链接:https://arxiv.org/abs/2608.20011
  • 发表时间:2026 年 8 月(arXiv 2608.20011v1,2026-08-20 提交)
  • 机构:西湖大学、浙江大学、快手可灵 Kling Team(企业+高校合作:快手提供工业级图像生成场景与算力,西湖大学/浙大主导理论与分析)
  • 一句话总结:偏好优化在流模型上失效的病根,是偏好更新把生成轨迹的终点推出了预训练数据流形——论文把这一现象命名为流形漂移(manifold drift),证明它是 reward hacking 的结构性根因,并提出带温度的锚定目标 THERMODPO 加以修复。

一、研究背景:当 DPO 遇上流匹配生成模型

**偏好优化(Preference Optimization)**是大语言模型后训练的标准配方。DPO(Direct Preference Optimization)绕开了显式奖励模型和强化学习的复杂性,直接在「胜者-败者」样本对上优化,被证明简单而有效。于是社区自然地想把它搬到扩散模型与流匹配模型上——毕竟 Stable Diffusion、FLUX、可灵这类最先进的图像/视频生成器,如今都需要对齐人类偏好来提升可控性。

但搬家的过程并不顺利。要理解为什么,先需要一点关于**流匹配(Flow Matching)**的直觉。

可以把流匹配想象成一条「运货航线」:模型学的是一个随时间变化的向量场 $v_\theta(x_t, t)$,把纯噪声 $x_1$(起点,$t=1$)沿着轨迹一步步「运输」到数据样本 $x_0$(终点,$t=0$)。训练目标非常朴素——回归路径速度:

$$\mathcal{L}_{FM} = \mathbb{E}\,\|v_\theta(x_t, t) - (x_1 - x_0)\|^2,\quad x_t = (1-t)\,x_0 + t\,x_1$$

注意论文的时间约定与常见写法相反:$t=1$ 是噪声端,$t=0$ 是数据端,生成是「倒着走」的。

问题来了。离散模型(如 LLM)的偏好优化只是在重选完整的输出,而连续模型的不同之处在于:一次偏好更新改变的不只是「输出哪些样本」,还有产生这些样本的运输动力学本身——整条轨迹的形状都被改写了。此前多项工作(DiffusionDPO、FlowDPO、Adjoint Matching 等)都经验性地观察到:把 DPO 式目标用到连续模型上,样本质量常常不升反降。但这些发现长期停留在「实验现象」层面。

这篇论文的贡献,是把这个现象从「玄学」升级为「病理学」:性能下降不是偶然的超参问题,而是偏好更新方向上必然存在的结构性缺陷。

二、核心问题:流形漂移——reward hacking 的几何根因

2.1 什么是流形漂移

根据流形假设,自然数据(图像、视频)集中在一个远低于像素维度的低维流形 $\mathcal{M}_{data}$ 附近。预训练模型花海量算力学到的,本质上就是这张「地图」。论文把预训练模型的终端分布支撑集记为

$$\mathcal{M}_0 := \mathrm{supp}\big((\Phi^{ref}_{1\to 0})_\# p_1\big)$$

定义(流形漂移):若微调后模型的终端分布 $\mu_\theta$ 的支撑集不再包含于 $\mathcal{M}_0$,即 $\mathrm{supp}(\mu_\theta) \not\subseteq \mathcal{M}_0$,则称发生了流形漂移。

一个直观类比:预训练流形像一张铺好的曲面公路网,生成过程是沿公路开车。偏好优化本该做的是「把车流引导到公路上更受欢迎的路段」,也就是在流形内重新分配概率质量;但实际上它常常直接「把车开出路面」,在公路之外的荒野上开出一条捷径,直达奖励函数喜欢的位置。车确实到了目的地(奖励分数涨了),但走的是没有铺装的地形——视觉伪影、语义扭曲、画质劣化随之而来。这就是 reward hacking 的几何形态。

论文还特别区分了两类奖励,说明为什么漂移常常隐蔽:

奖励类型例子特点
流形无感(manifold-unaware)OCR 只检查图中文字对不对不管整图是否有效,极易被离流形样本欺骗,漂移明显可见
流形有感(manifold-aware)PickScore 评估整图质量本身隐含画质约束,漂移不易被察觉,但仍可能发生

更值得警惕的是作者的一句话延伸:在机器人领域,流形漂移意味着分布外行为——不是画质变差,而是意料之外的动作,风险等级完全不同。

2.2 两个定理:谁在守护流形,谁在破坏它

定理 3.4(最优流匹配守护流形):在正则性假设下,最优 FM 向量场把先验 $p_1$ 精确传输到数据分布 $p_0$,终端支撑集恰好等于 $\mathcal{M}_{data}$。证明思路是经典的连续性方程 + 弱解唯一性论证:插值分布 $\{\rho_t\}$ 与流映射推出的分布 $\{\mu_t\}$ 满足同一个连续性方程和同一边界条件,故必相同。

换句话说:预训练目标本身无罪,它天生把终端锁在数据流形上。

定理 3.5(非零法向分量必然导致漂移):设 $\mathcal{M}_0$ 是二阶连续可微嵌入子流形,取一步梯度更新 $\theta_1 = \theta_0 - \alpha\nabla_\theta \mathcal{L}$。若终端映射 $F(\theta, x_1)$ 的变化量在法空间上的投影非零:

$$\Pi_{N_{x_0^\star}\mathcal{M}_0}\, D_\theta F(\theta_0, x_1)\,[\nabla_\theta \mathcal{L}(\theta_0)] \neq 0$$

则存在步长上界 $\alpha_0$,使得任意小步长 $\alpha\in(0,\alpha_0)$ 的更新都会把终端点推出流形。证明的巧思在于引理 C.1:流形上点的位移,其法向分量至多是位移长度的二阶小量 $O(\|y-x\|^2)$(曲面的局部图刻画);而含非零法向分量的梯度步造成的一阶法向位移是 $O(\alpha)$——一阶对二阶,矛盾,故终点必在流形外。

为什么 FlowDPO 特别容易踩雷? 论文的 Remark 3.6 给出了极具洞察力的代数解释。FlowDPO 在最优点附近可以近似写成:

$$\mathbb{E}\big[\|v_\theta(x_t^w,t)-(x_1-x_0^w)\|^2\big] - \mathbb{E}\big[\|v_\theta(x_t^l,t)-(x_1-x_0^l)\|^2\big]$$

前一项(胜者重构)是好的,它把模型锚在流形上的偏好区域;后一项的减号是原罪——「减去败者误差」意味着鼓励败者侧误差变大,这在几何上等价于对终端样本施加一个离开流形的法向力。切向的力让概率质量在流形上滑动(无害且有益),法向的力把质量顶出流形(reward hacking)。定理 3.5 说明后者不是小概率事件,而是只要法向分量非零就必然发生。

还有一个理论层面的「合法性」论证:DPO 本源自 KL 正则化的奖励最大化,其最优解 $\pi_\theta \propto \pi_{ref}\exp(r/\beta)$ 天然满足 $\mathrm{supp}(\pi^\*)\subseteq\mathrm{supp}(\pi_{ref})$——原教旨 DPO 的目标本来就不允许离开参考分布的支撑集。而实践中流模型的偏好优化删掉了这个约束直接优化向量场,等于把法律改成了丛林法则。

三、方法:THERMODPO——给偏好优化系上「风筝线」

3.1 热力学视角:三态能量 + 温度

既然 FlowDPO 缺一根把终端拉回流形的「锚」,THERMODPO 的做法是在胜者侧加上它。方法的名字来自其热力学式表述:把对齐看作一个平衡问题,用时间相关的温度函数 $\tau(t)$ 在「最大化奖励」与「锚定在预训练流形」之间调度。

延续 FlowDPO 的记号($\ell_\theta^{w/l}$ 是当前模型在胜/败者上的流匹配误差,$\ell_{ref}^{w/l}$ 是冻结参考模型的误差,$\Delta_\theta^{w/l} = \ell_\theta^{w/l} - \ell_{ref}^{w/l}$),定义三个「能量态」——胜者态、败者态、参考态:

$$E_w = -\frac{\Delta_\theta^w}{\tau(t)},\quad E_l = -\frac{\Delta_\theta^l}{\tau(t)},\quad E_b = \frac{\ell_{ref}^w}{\tau(t)}$$

目标是最小化胜者态在这个三态玻尔兹曼系统中的负对数概率:

$$\mathcal{L}_{ThermoDPO} = \mathbb{E}\Big[-\tau(t)\, t^2 \log \frac{e^{E_w}}{e^{E_w}+e^{E_l}+e^{E_b}}\Big]$$

通俗地说:模型被同时要求「比败者更像胜者」(偏好信号)和「重构出胜者本身」(流形锚),温度 $\tau(t)$ 决定这两个诉求的软硬程度——低温时约束刚性(贴近 RFT),高温时偏好信号灵活(贴近 FlowDPO)。

3.2 从理论到实践:THERMODPO-weighted

上面的标准形式在理论分析上最干净,但有个实用缺陷:全局 $t^2$ 系数在终点附近($t\to 0$)恰好趋于零——而终点恰恰是流形保持最关键的时刻(图像就是在 $t=0$ 成形的)。等于说锚在最需要的时刻松了。

于是论文提出实用变体 THERMODPO-weighted:去掉全局 $t^2$,改为给胜者重构误差乘上 $(1-t)^2$:

$$\mathcal{L}_{weighted} = \mathbb{E}\Big[\tau(t)\log\Big(1+\exp\Big(\tfrac{\Delta_\theta^w-\Delta_\theta^l}{\tau(t)}\Big)+\exp\Big(\tfrac{(1-t)^2\,\ell_\theta^w}{\tau(t)}\Big)\Big)\Big]$$

$(1-t)^2$ 在 $t\to 0$ 时取最大值 1、在 $t\to 1$ 时归零——锚的强度恰好按需求倒置:越靠近终点,拉力越强。可以理解为风筝飞得再远(偏好信号再强),线在落地前那一刻攥得最紧。

对比项FlowDPOTHERMODPO-weighted
偏好信号成对比较(胜 vs 败)保留,但经温度 $\tau(t)$ 缩放
流形约束无(减败者误差产生法向离流形力)胜者重构锚 $(1-t)^2\ell_\theta^w$,非负
时间加权无$(1-t)^2$,终点最强
理论保证无支撑集保持流形距离逐点上界(命题 D.4)

四、理论分析:三个定理串起一张统一图景

THERMODPO 的优雅之处在于,它不是又一个「加个正则项试试」的工程补丁,而是把两个已有范式代数上统一了。

定理 4.1(低温退化为 RFT):当 $\tau\downarrow 0$,逐项积分核退化为

$$g_\tau(\theta) \to t^2\cdot\max\{0,\ \Delta_\theta^w-\Delta_\theta^l,\ \ell_\theta^w\}$$

若偏好信号被流形约束主导($\Delta_\theta^w-\Delta_\theta^l \le \ell_\theta^w$),则进一步退化为 $t^2\ell_\theta^w = \|\tilde{x}_0^w - x_0^w\|^2$,即时间加权的胜者重构误差——这正是 RFT(拒绝采样微调)的目标。这里 $\tilde{x}_0^w = x_t^w - t\,v_\theta(x_t^w, t)$ 是从中间点 $x_t$ 出发的一步欧拉重构。证明只用了一条 softmax-sigmoid 极限:$\lim_{\tau\to 0}\tau\log\sum e^{a_i/\tau} = \max_i a_i$。

定理 4.2(高温分解为 FlowDPO + 锚):对任意 $\tau>0$,损失核可精确分解为

$$g_\tau(\theta) = \underbrace{t^2\tau\log\big(1+e^{(\Delta_\theta^w-\Delta_\theta^l)/\tau}\big)}_{\text{温度缩放的 FlowDPO}} + \underbrace{r_\tau(\theta)}_{\text{非负锚项}}$$

$r_\tau(\theta)\ge 0$ 是纯粹的胜者侧惩罚。代数上,THERMODPO = FlowDPO + 非负惩罚,二者之间由温度 $\tau$ 连续插值:$\tau\to 0$ 一端是 RFT,$\tau$ 增大逐渐释放偏好信号。奖励最大化与流形漂移的权衡,从此有了一个可以显式调节的旋钮。

定理 4.3(流形距离上界):

$$g_\tau(\theta) \ge \mathrm{dist}\big(\tilde{x}_0^w,\ \mathcal{M}_{data}\big)^2$$

即逐点损失上界了重构胜者到真实数据流形的距离。推论 C.2 进一步把这个保证从一步重构推广到 ODE 积分终点,代价只是一个 $O(t^2)$ 的局部截断误差。需要诚实指出(论文自己也在表格里标明):这是逐点保证,不是分布层面的保证。

定理内容直觉
Thm 3.4最优 FM 精确恢复 $p_0$ 与其支撑集预训练无辜
Thm 3.5终端更新含非零法向分量 $\Rightarrow$ 必然离流形指控 FlowDPO 的法向力
Thm 4.1$\tau\downarrow 0$ 退化为 RFT低温一端
Thm 4.2$\tau>0$ 分解为温度缩放 FlowDPO + 非负锚高温一端,代数统一
Thm 4.3损失上界重构胜者到 $\mathcal{M}_{data}$ 距离平方几何控制

对 weighted 变体,附录 D 给出了完全平行的命题 D.1/D.3/D.4:低温极限变为 $(1-t)^2\ell_\theta^w$(在 $t\to 0$ 处权重最大,恰好是设计意图),分解与距离上界(当 $t\le 1/2$ 时 $\mathrm{dist}^2 \le g_\tau^{wt}$)均保持。

五、实验:从玩具曲面到工业级模型

5.1 玩具实验:把病理切片放到显微镜下

论文构造了一个精巧的三维曲面(两个高斯鼓包在 $x=\pm 3$,一个凹陷在 $x=0$,沿 $y$ 有轻微调制):鼓包区是胜者区,凹陷区是败者区,其余中性。预训练一个三层 MLP 流匹配模型,各方法同样微调 10K 步、评估 1 万个生成样本。判据是样本是否落在 $\varepsilon=0.15$ 的曲面管道内(OnManifold)以及是否进入胜者区(Win)。核心指标 StrictScore = 0.5×StrictWin + 0.5×OnManifold,同时奖励「对齐」与「在流形上」。

方法Win (%)StrictWin (%)OnManifold (%)StrictScore
RFT93.683.488.30.858
FlowDPO (β=1)92.0000
FlowDPO (β=100)43.437.788.20.629
FlowDPO+RFT (β=1)91.782.988.50.857
FlowDPO+KL (β=100)41.936.489.10.627
Diffusion-SDPO (β=100)42.237.591.30.644
Linear-DPO (β=10)85.874.378.00.761
χPO (β=1)92.7000
χPO (β=100)43.037.288.40.628
THERMODPO-weighted (t, β=1)92.787.692.20.899

这张表把第二节的理论预言展示得淋漓尽致:

  • FlowDPO 与 χPO 在 β=1 时 Win 高达 92%,但 OnManifold 直接归零——胜率是靠「飞出曲面抄近道」刷出来的,StrictWin 与 WinQuality 同步崩塌。这就是流形漂移的现场直播。
  • β 调大能部分救回流形(0 → 0.629),但代价是 Win 从 92% 跌到 43%——在错误的目标上调超参,只能在两种病之间选择得哪一种。
  • 外挂正则(+RFT 达 0.857、+KL 仅 0.627)有效但不彻底;KL 类约束拉近的是整条轨迹与参考场的距离,并不专门保护终端。
  • THERMODPO-weighted 以 0.899 同时拿下最高的 Win(92.7%)与接近最高的 OnManifold(92.2%),比 FlowDPO(β=100) 高 +0.270,比次优的 FlowDPO+RFT 高 +0.042,WinQuality 0.945 也是全场最佳——被吸向胜者区的样本几乎都保持几何有效。

5.2 真实图像:SD3.5-M 上的工业级验证

真实图像实验从 Stable Diffusion 3.5-M 出发,用 OCR 偏好对数据集训练(OCR 属于典型的流形无感奖励,最容易被黑)。偏好对构造自 1000 条 DrawBench 提示词,每条采样 64 张候选图,按 OCR 奖励取一胜一败。统一设置:512×512 分辨率、DPM2 采样器 40 步、AdamW、全局 batch 128、1200 步,64 张 H100 训练。评测刻意区分「训练奖励(OCR)」与「未参与训练的留出评测器(GenEval、HPSv3.0、UniReward)」——只在被优化的奖励上涨分而留出指标下跌,正是 reward hacking 的签名。

方法(CFG=4.5)GenEvalOCRHPSv3.0UniRwd宏平均增益
RFT+11.1%+25.4%+10.5%+5.3%+13.1%
FlowDPO (β=100)−27.0%+18.6%−21.3%−4.6%−8.6%
FlowDPO+RFT+1.6%+49.2%+2.0%+2.3%+13.8%
FlowDPO+KL−1.6%+55.9%−1.2%+2.0%+13.8%
THERMODPO-weighted+3.2%+47.5%+9.0%+4.3%+16.0%

几个关键读数:

  • FlowDPO 是唯一整体为负的方法(−8.6%):OCR 小涨,其余三项全面崩,教科书级的 reward hacking。
  • THERMODPO-weighted 是唯一在四个指标上全部为正的方法:OCR +47.5%(与 FlowDPO+KL 的 55.9% 同一量级),同时 GenEval、HPSv3.0、UniReward 全部保住并提升,宏平均 +16.0% 领先。约束终端位移在切向之后,偏好与保真不再是对立面,而是同升。
  • 人工评测(30 条提示词、逐对比较)显示 THERMODPO-weighted 在视觉质量上普遍被偏好,文本准确性上与各基线持平——奖励模型之外的最后一道验证也通过了。
  • 定性样例中,FlowDPO 系方法出现明显画质劣化,THERMODPO-weighted 与 RFT 则保持了贴近原模型的观感。

5.3 跨模型复现:FLUX.2-klein-4B

在 FLUX.2-klein-base-4B(CFG=3.5)上,趋势复现:THERMODPO-weighted 相对基线在 GenEval(0.7766 vs 0.7347)、UniReward(0.6663 vs 0.6358)、HPSv3.0(9.5420 vs 9.0675)、OCR(0.7241 vs 0.5475)四项全面提升;FlowDPO 的 OCR 更高(0.8349)但另外三项全部低于基线。作者谨慎地说明:这验证了权衡模式的可复现性,而非模型无关的普适定律。

六、深入分析:消融、几何鲁棒性与成本

温度调度稳健性。在 β=1 下扫了四种调度:线性 $\tau=t$、SNR 风格 $t^2/(t^2+(1-t)^2)$、$t^{10}$、$t^{0.1}$,StrictScore 全部落在 0.893–0.900 的窄带内;β 在 {1,10,100,500} 四个数量级上,线性调度的得分也稳定在 0.888–0.899。这个方法对超参不敏感——与 FlowDPO 对 β 的剧烈敏感(0 → 0.629)形成鲜明对照。反过来看未加权版 THERMODPO:最好的配置只有 0.68,多数配置跌回 0.62 一线,证明 $(1-t)^2$ 的终端重加权不是锦上添花,而是决定性的。

流形曲率鲁棒性。把曲面换成平面(第二基本形式为 0)、圆柱(高斯曲率 0 但第二基本形式非 0)、球面(正曲率)、鞍面(负曲率),THERMODPO-weighted 在四种几何上全部拿到最高 StrictScore(0.947 / 0.976 / 0.986 / 0.961),而 FlowDPO 的漂移程度随几何与 β 变化。定理 3.5 只断言法向分量非零则漂移,漂多远取决于曲率——实验与理论在这里互相印证。

RFT 是不是就够了? 附录给出一个诚实的补充:玩具场景下 RFT 训满 100K 步可达 0.954,超过 THERMODPO-weighted 的 10K 步结果。但真实图像上 RFT(+13.1%)在四指标宏平均上不敌本法(+16.0%)——合成偏好区完美贴合重构目标,真实偏好区则不然,成对信号携带的「远离什么」的信息在真实数据上是必要的。

计算成本。完整训练扫描每个方法超过 1536 GPU 时(64×H100×24 小时),报告的检查点约为 RFT 711、FlowDPO 509、FlowDPO+RFT 252、FlowDPO+KL 364、THERMODPO-weighted 690 GPU 时——量级与基线相当,没有额外推理开销,锚只是改变了损失形状。

七、局限性与批判性思考

论文自己列出的局限值得逐条掂量,再补几条我的观察:

  1. 仅限离线设定。所有方法都从固定的胜败对数据集训练,未触及在线 RLHF 的探索、奖励更新与稳定性问题。把流形漂移控制推广到在线流偏好优化(Flow-GRPO 一类)是显然的下一步,但在线采样的支撑集问题会更微妙。
  2. 热力学动机是「借喻」而非推导。作者坦承玻尔兹曼表述只是启发式框架,只证明了其优化与流形控制性质,不存在严格物理推导——或许存在更本质的目标形式。
  3. 人工评测规模偏小。30 条提示词、单一标注者且为论文作者本人、无评分者间一致性统计。虽然方向性与自动指标一致,但证据强度有限。
  4. 保证是逐点而非分布层面。定理 4.3 约束的是重构胜者的距离,不是终端分布整体的支撑集包含关系;从逐点到分布还有一步之遥。
  5. 迁移范围未测。只验证了流匹配系(SD3.5、FLUX.2),未测试思想能否干净地搬到其他连续时间或扩散系对齐算法上;χPO 在此设定下表现与 FlowDPO 相当,也提示原为对数概率比设计的修正未必能平移。
  6. 依赖偏好数据的质量。锚定的是「数据集中的胜者」;若胜者本身带噪或偏好信号有偏,锚也会把模型锚向偏处。论文未讨论偏好数据净化的敏感性。

八、总结与启发

方法层面三句话:(1) FlowDPO 的减号会产生离流形的法向力,非零法向分量必然把终端推出预训练流形(定理 3.5),这是 reward hacking 的结构性根因;(2) THERMODPO 用三态能量 softmax 在胜者侧加重构锚,$\tau\downarrow 0$ 退化为 RFT、$\tau>0$ 代数分解为温度缩放 FlowDPO 加非负锚项,且逐点损失上界到数据流形的距离;(3) 实用版以 $(1-t)^2$ 强化终端锚定,玩具 StrictScore 0.899、SD3.5-M 四指标全正(宏平均 +16.0%、OCR +47.5%)、FLUX.2 复现同趋势,人工评测视觉质量占优。

这篇论文给我的启发超出图像生成本身:

  • 先找几何,再调超参。FlowDPO 调 β 的惨状(0 → 0.629 → 0.620)说明:当失效模式是结构性的,超参只是在两种病之间移动落点。把「更新方向相对数据流形的法向/切向分解」作为诊断工具,可以移植到很多后训练场景。
  • 对齐约束要落在它该在的地方。KL 正则约束的是整条轨迹对参考场的逼近,保护终端的效果有限(0.627);锚定胜者重构则直击终端(0.899)。约束的位置比约束的强度更重要。
  • 分解式证明是最好的设计工具。定理 4.2 那一行代数分解(新目标 = 旧目标 + 非负项)同时给出了方法的合法性、与已有工作的精确关系、以及一个可解释的权衡旋钮(温度)。比起消融表格,这种分解更能说服审稿人,也能指导实践者按需调温。
  • 奖励无感 vs 奖励有感的评测观。只看被优化的指标永远发现不了 hacking;训练奖励 + 留出评测器 + 人工评测的三层验证,是本文实验设计的可复用模板。
  • 对具身智能的警示。作者点出流形漂移在机器人语境下等价于分布外行为。随着流模型进入决策与控制,这条论断值得每个做在线 RL 与策略蒸馏的人提前记住。

一句话收束:偏好优化不该教会模型「抄近道离开路面」,而该教会它「在路上开得更好」——THERMODPO 用一根温度可调的风筝线,把这两件事变成了同一件事。