论文 A 链接:A Zeroth-Order Paradigm for LLM Preference Alignment 论文 B 链接:SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization|代码 发表时间:2026年9月 机构:A:UC Berkeley × NYU × 阿里巴巴达摩院(决策智能实验室);B:中国人民大学高瓴人工智能学院 × IQuest Research × 微软亚洲研究院(企业+高校) 领域标签:A:偏好对齐/零阶优化;B:长上下文/线性注意力
第一乐章:ComPO——偏好对齐的零阶范式
A.1 背景
**直接偏好对齐(DPO 及其家族)**绕开了奖励模型+RL 的繁琐,直接在偏好对(chosen, rejected)上优化可微损失,效率高。但它有个被反复观察到的病理:likelihood displacement(似然位移)——在 chosen 与 rejected 的似然边际很小的偏好对上,优化会同时压低两者(或以非全局的方式移动似然), chosen 反而受损。直觉上:当两个答案模型的概率几乎一样时,“拉开差距"的梯度方向带有巨大噪声。
零阶优化是什么? 不用梯度的优化——只靠"查询函数值、比较结果好坏"来更新参数(如进化策略、随机搜索)。comparison oracle(比较神谕)即"问它 A 好还是 B 好”。
A.2 问题定义与解法
抽象问题:能否从偏好对中提取方向信息而不在其上优化任何可微偏好损失,同时保持(或提升)对齐质量与理论保证?
ComPO 三步:
- 离线比较机制:用比较 oracle(如奖励模型的偏好判断或显式比较器)对候选更新方向做零阶方向提取——参数更新沿"被偏好"的方向走,损失本身不可微也不需要可微;
- 收敛保证:在平滑性、梯度稀疏、oracle 与隐目标兼容性假设下证明基本离线方案的收敛;
- 在线 ComPO:保留离线比较机制 + 用无标注自生成做对参考策略的 reverse-KL 控制(防漂移);在局部覆盖与分布内成对奖励准确性假设下给出性能保证(覆盖视角)。
A.3 实验证据
- 模型:Mistral、Llama、Gemma-2、Qwen3、Gemma-3 五家族;
- 基准:AlpacaEval 2(LC/WR 胜率)、Arena-Hard、MT-Bench(Turn-1/Turn-2);
- 结果:改进现有直接对齐方法(含长度控制胜率);对级诊断显示与 likelihood displacement 缓解一致的证据模式(对上似然不再出现系统性双向压低)。
证明力分析:五家族跨尺度的结果排除单模型巧合;对级诊断(不只看平均分,还看成对似然行为)把"结果好"与"机制如预期生效"对齐——这是本文最有说服力的部分。
A.4 根源解释与外部对照
因果链:低边际偏好对上,可微损失的梯度由噪声主导 → DPO 类更新方向失真 → displacement;ComPO 把"方向"交还给比较 oracle(它在低边际区仍然可靠——比较比数值回归更鲁棒)→ 更新方向干净 → displacement 缓解 → 胜率与对齐质量提升。【诊断实验支持主干;“比较比回归鲁棒"的统计直觉为论文论证+阅读者概括】
| 相关研究 | 关系 | 影响 |
|---|---|---|
| DPO | 直接对齐基线与 displacement 现象来源 | 对照:ComPO 正面缓解其病理 |
| IPO/SimPO 等变体 | 损失形状改良 | 补充:都在可微框架内修补;ComPO 换范式 |
| Zeroth-order 优化文献(如 MeZO) | 零阶方法在 LLM 的先例 | 支持:零阶在 LLM 尺度可行 |
| Online DPO/迭代偏好法 | 在线数据混合思想 | 支持:reverse-KL 控制的必要性共识 |
第二乐章:SpectralShift——线性注意力的谱视角
B.1 背景
Gated DeltaNet(GDN):线性注意力家族的代表——用固定大小状态替代增长的 KV cache,状态按门控衰减更新,长上下文可扩展性强。已被多个前沿模型采用。
长上下文扩展的常规做法:继续预训练(更长序列、RoPE 类调整频率)。但线性注意力的状态动力学由转移矩阵支配,其谱(特征值分布)决定信息如何被记住/遗忘——softmax 注意力的扩程经验直接照搬会忽略这层结构。
B.2 问题定义与解法
谱分析的两个发现(长程信息检索的必要条件):
- 足够宽的慢谱带:特征值接近 1 的慢模式承载长程记忆,其"带宽”(衰减时间的分布)须覆盖目标依赖长度——依赖距离 10 万 token 的任务需要衰减慢于 10 万步的模式;
- 快衰减模式的保留:特征值显著小于 1 的快模式负责"清空过期状态、切换上下文"——全慢等于永不遗忘,检索会被旧上下文污染。
SpectralShift 两步:
- alpha 投影重参数化初始化:直接重塑衰减谱(加宽慢带),而不是靠训练慢慢学出;
- alpha 投影学习率缩放:长上下文持续训练时对 alpha 施加不同学习率——保护谱结构不被训练冲毁。
B.3 实验证据
10B GDN 模型、8K→32K→64K→128K 课程扩展(TokenL/基线对照):
| 最大长度 | 方法 | RULER 平均 | 关键列 |
|---|---|---|---|
| 32K | SpectralShift vs Base | 52.9 vs 49.7 | 64K 列 45.8 vs 40.6 |
| 64K | SpectralShift vs Base | 59.7 vs 55.5 | 128K 列 52.7 vs ~45 |
通用基准(DROP/RACE)几乎无损——谱手术没有伤短文本能力。
证明力分析:通用任务持平+长程任务单调增益的组合排除了"更大感受野换全面能力"的折中解释;课程设置(同预算)保证公平。
B.4 根源解释与外部对照
因果链:默认初始化的慢带太窄 → 长于带宽的依赖被状态动力学强制遗忘(无论怎么训)→ 重参数化拓宽慢带后,原本"物理不可达"的检索范围变为可学习 → 学习率缩放保护已学的谱形状 → 长程检索持续提升。快/慢双要素由消融互证(只加慢不带快,检索提升但上下文切换任务受损)。【论文实验支持主干】
| 相关研究 | 关系 | 影响 |
|---|---|---|
| DeltaNet/GDN 原始工作 | 状态动力学的定义 | 基础 |
| RoPE 频率调整(NTK/LongRoPE 类) | softmax 侧扩程经验 | 对照:位置编码方案不适用线性注意力状态 |
| Mamba 状态空间谱分析文献 | 谱决定记忆容量的共识 | 支持:跨架构印证 |
| 长上下文课程训练实践 | 数据侧经验 | 支持:与本文初始化侧正交可叠加 |
合并的通用性灵感
当梯度信号在某个区域系统性失真,把方向判断外包给更鲁棒的信号源(ComPO:比较优于回归)
- 推广:A/B 测试优于留存预测模型(低边际区域);人工评审用于争议样本;排行榜投票替代评分。
先分析系统的"模态结构"再动手扩展——很多容量问题是结构限制而非数据不足(SpectralShift:慢带宽度物理上决定了可达检索长度)
- 推广:缓存系统的容量规划(命中率带宽分析)、组织的沟通半径(层级跨度限制)、无线网络的频谱分配。
手术要保护双要素:加能力时别破坏清理机制(快慢模式缺一不可)
- 推广:数据库索引(加速读别拖慢写)、免疫系统(增强记忆别丢自体耐受)、团队流程(加自动化别删人工复核)。
理论保证与实证诊断并重:假设写清+对级/消融验证(两篇共同的方法论气质)
- 推广:任何算法改进的自证标准——假设透明、可反驳、有针对性诊断。
本精读基于 arXiv:2609.19144 与 2609.14320 全文撰写;实验数字均出自论文表图;外部检索截至 2026-09-18。