Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers —— 精读

论文链接:https://arxiv.org/abs/2608.26762

代码:https://github.com/thomsonreuters/presentation-dependence(含 τ-PSI 实现、评估 harness、银标签、11 个 dense base 的 LoRA adapter)

发表时间:2026 年 8 月 27 日(arXiv:2608.26762v1,Preprint)

发表机构:Thomson Reuters Labs + University of Toronto / Vector Institute(企业+高校合作:第一作者 Frohmann 双隶属,企业提供专有法律检索集合 Legal-A/B 与约 10 万 GPU 小时算力)

作者:Markus Frohmann、Mahdiyar Alavi、Elizabeth Lingg、Navid Rekabsaz


一、论文背景

Reranker、奖励模型、多文档 QA 评分器这三类组件有个共同的工作方式:在同一个 LLM prompt 里给一批候选文档或回复打分。这种批式打分(batched pointwise scoring)兼具两种好处——pointwise 交叉编码器有逐候选分数(阈值可以消费),listwise 重排器有共享上下文(指令、查询、评分规则只编码一次,还降低了单查询延迟)。

但共享 prompt 意味着一个候选的分数以整个 prompt 为条件,而不只取决于它自己——论文称之为呈现依赖(presentation dependence)。长上下文模型对输入各处注意力不均匀(“迷失在中间"效应),凡候选被联合打分的地方就有顺序敏感。这不是小毛病:开箱即用的模型上,顺序能决定偏好模型 top 选择在 65.4% 的查询上是否正确(10 个随机排列下)——也就是说,顺序决定了哪个回复成为 RLHF 的训练标签。

问题的要害在于:这类评分器是按排序质量(如 nDCG@10)选出来的,但它们的分数最终驱动的是"决策"而非"排名”——阈值把超过截止线的文档放进审查队列或生成上下文;阅读器从最高分的几条里读出答案;偏好模型的分数决定训练用的回复对。论文的出发性问题:排序质量相同的两个评分器,决策是否也相同?如果不相同,什么修复手段才能真正触达决策?

二、论文定位和关联工作

论文 Related Work 把已有工作按"代价落在哪个阶段"分类,本文定位为"训练级修复":

顺序敏感的测量。Zeng 等人测量了检索集合上的位置敏感并提出位置敏感指数,论文把它适配到排名层面得到 τ-PSI;奖励模型与 LLM 裁判的并排比较偏差也被广泛记录,仅交换顺序即可翻转两候选判定,翻转率随两者质量差距变化。

提示词构造通道。除顺序外,prompt 的构造方式(排序池如何切分成窗口、槽位标记、答案骨架措辞)同样影响分数——分区 listwise 重排用融合/重校准处理跨窗口可比性,但没有任何位置偏差测量控制过骨架措辞这一变量。

推理时修复:批式自一致性(BSC)对每查询在 K 个排列下平均分数;TourRank 集成锦标赛分组;Stable-RAG 在排序器下游从多个检索顺序的中心解码;CapCal/CalibraEval 走校准路线。代价是每查询重复支付推理成本。

训练级修复:DebiasFirst 用位置感知增广加逆倾向加权;RankVicuna 从打乱顺序蒸馏;Brown & McIlroy 在去除顺序的输入上微调;PA-GRPO 用 RL 奖励一致决策。代价是监督与一次训练,结果是衰减而非保证。对同一输入不同视图的分歧施加惩罚是半监督学习的标准一致性正则手段,但既有工作(跨排列示例、跨措辞)稳定的是离散答案选择——没有任何阈值能消费离散答案;本文稳定的是阈值所作用的连续分数。

架构级修复:SetRank 把候选编码为集合;LLM 侧变体限制跨候选注意力以单遍获得顺序不变。代价落在机制本身——注意力限制削弱了共享 prompt 本来要提供的跨候选信息(论文附录 D.2 移植该机制发现在此读出方式下质量稳定性双输)。

本文的差异化:在训练中衰减依赖,保留单排列服务与无限制共享 prompt;且在评分器的消费者产出上(而非评分器自身输出上)测量稳定性,度量的是跨排列的变化而非单排列下的值。

三、问题定义

论文给出清晰的概念框架与测量定义:

呈现通道。查询与候选池不变时,prompt 有四个可变属性:候选呈现顺序、顺序切分成窗口的规则、槽位标记、答案骨架措辞。四者的一个设定合称一个呈现。默认只变化顺序、固定其余。

测量顺序依赖(τ-PSI)。每个实例在 M=10 个随机排列下打分得 10 个排名,取两两 Kendall 相关的平均做变换:τ-PSI = (1 − mean τ)/2。每个顺序都产生相同排名时为 0,排名不相关时 0.5,完全颠倒时 1——它是"离集合式行为有多远"的距离,越低越稳定。

测量消费者产出。对每个消费者同时报告输出质量与输出变化率(两个排列下不一致的比率,对所有排列对平均):阈值消费者看保留集 F1 与平均成对 Jaccard 重叠;阅读器消费者看判决准确率/精确匹配与答案翻转率;偏好模型消费者看选中对翻转率。关键论断:τ-PSI 度量排名的移动而非消费者的产出,两者对评分器的排序可以不同。

分数分解。把评分器输出分解为 f_B(x, π) = μ_B(x) + δ_B(x, π)——顺序边际 μ_B 是排列不变评分器会输出的分数(对所有排列取期望),顺序残差 δ_B 才是顺序依赖的来源(期望为零)。BSC 用推理时平均估计 μ_B;论文的目标是在单次服务排列下通过训练直接压缩 δ_B,而 μ_B 不受约束。

四、问题解法

4.1 分数读出:无解码的批式打分

通用指令模型不直接输出批式打分所需的逐候选分数。论文的读出方案:prompt 给出评分指令、查询与 B 个候选(各带 [i] 标记),要求每候选给 {0,1,2,3} 中的一个整数等级。不采样生成任何文本,而是追加一个固定答案骨架(每候选一个占位等级 token),一次前向即得每位置上四个等级 token 的分布,重归一化后取期望等级 E[g]=Σg·P(g) 并归一到 [0,1] 作为分数。一个 prompt 得全部 B 个分数,读出不可能遗漏或重复候选,分数连续且跨实例可比(阈值可用),且任意宽度下(降到 B=1)读出不变。

4.2 OC-SFT:顺序一致性监督微调

监督信号:教师(默认是学生自己的基座模型,自蒸馏,故增益不可能来自更强教师)给训练实例候选打分产出一个连续目标。各训练变体共享教师与训练池,只在目标函数上不同。

OC-SFT 保留单排列的教师目标,但把同一窗口在 N 个排列 π₁…π_N 下打分(N=2 即可,一对视图足以估计方差,多至 8 未见质量变化),损失为:

L_OC-SFT = mean_d (s₁(d) − ỹ(d))² + λ·(1/N)·Σᵢ mean_d (sᵢ(d) − s̄(d))²

第一项是相关性锚(仅第一个视图携带教师监督,防止模型塌缩成一致但无关的评分器),第二项是顺序方差惩罚——把每个视图拉向视图均值,期望上正比于 E‖δ_B‖²,直接惩罚窗口内残差。注意训练内的打乱只置换窗口内槽位、候选同伴不变,而 τ-PSI 的打乱可能改变同伴——度量对评分器的扰动至少不小于惩罚所针对的扰动,因此测出的是泛化。

与另两条路线的成本对照:单序蒸馏从不遇到多排列(质量基准);Order-averaged 蒸馏需要 T=10 遍教师打分把平均预计算进标签(十倍教师成本换 μ_B 目标);OC-SFT 只需 1 次教师标签 + 每步 2 个视图(约两倍训练步成本),服务时 1 个排列。有趣的形式对应:用 GRPO 的组相对语言说,μ_B 是组均值、δ_B 是偏差——只是组内变化的是排列而非采样动作,残差可微、无需 rollout。

4.3 实验设置

三任务同一读出同一目标函数:段落重排(主设置,MS MARCO 训练 B=20,评估 18 个集合:TREC DL19-23 + 11 个 BEIR + 2 个汤森路透专有法律集合);多文档 QA(HotpotQA 干扰项设置 B=10,零样本迁移 2WikiMultiHopQA/MuSiQue);回复排序(UltraFeedback B=4,评估 RewardBench-2/Nectar/PPE/RM-Bench 五个集合)。主模型 Qwen3-4B,另覆盖 1.7B–32B 共 12 个 base(Qwen3/Gemma4/Granite4.1 三族 + 稀疏 MoE),全程 LoRA。

五、评估指标与实验证据

主表结果(Qwen3-4B,M=10 排列,训练行为 3 种子均值):

变体nDCG@10↑τ-PSI↓保留集Jacc.↑QA nDCG↑答案翻转↓排序nDCG@1↑对翻转↓
开箱即用0.3700.2980.4390.9110.2210.6550.877
Round-robin0.4220.2970.4430.9110.2210.6580.878
BSC×10(集成)0.4650.1800.7070.9460.1570.7160.636
jina-reranker-v30.4470.1770.6670.9490.1720.4790.685
GPT-5.40.468—0.7070.9720.0940.7260.489
单序蒸馏0.4490.2090.6560.9510.1770.6840.869
Order-avg 蒸馏0.4550.1300.7430.9560.1490.6930.724
DebiasFirst0.4540.1280.7590.9550.1640.6940.718
排列增广0.4550.1290.7600.9550.1620.6960.707
OC-SFT0.4590.0830.8350.9610.1250.7010.661

核心证据链:

  1. 等排名质量 ≠ 等决策。五个训练变体 nDCG@10 差 ≤0.010(比任何一个变体下单次排列移动一个查询分数的幅度还小),保留集重叠却横跨 0.656–0.835——差一个数量级以上。机制:阈值读绝对分数而 nDCG@10 只读前十的折价顺序,截止点附近的小分数移动即可换入/换出文档,同级候选互换则几乎不动 nDCG。两个已发表系统佐证:GPT-5.4 质量全场第一但保留集重叠(0.707)不及 OC-SFT;jina-reranker-v3 保留集 F1 最高但重叠仅 0.667。
  2. 提示词层修复失败。Round-robin 划分(把第一阶段相邻排名分散到不同窗口)+0.052 nDCG@10,但三项决策指标零变化;CapCal 校准对质量与重叠均无可测改善。窗口跨窗重缩放则完全无法纠正分区效应(窗口间不是平移关系)。
  3. 训练触达决策且无需推理加价。OC-SFT 的 τ-PSI 0.083、Jaccard 0.835、答案翻转 0.125、对翻转 0.661,全面领先三个同样针对顺序的训练目标(0.128–0.130 / 0.743–0.760 / 0.149–0.164 / 0.707–0.724),同时 nDCG@10 还微升(0.449→0.459)。关键是单排列服务即超过 BSC 十排列集成(0.835 vs 0.707 的重叠),且在 QA/回复排序两个消费者上 OC-SFT@K=1 胜 BSC@K=10。
  4. 机制证据:方差分解显示开箱模型窗口内分数方差 82.5% 来自"同伴耦合"残差(槽位效应仅 16.9%);OC-SFT 移除 96.8% 的该残差方差,槽位残差 RMS 从 0.0976 压到 0.0019。消融:排列增广/DebiasFirst(同样用打乱视图训练但无显式一致性项)只关掉约三分之二差距,EMA mean-teacher 类通用一致性机制关掉 71% 却让阅读器掉 0.023 精确匹配——显式一致性惩罚项是必要的。
  5. 泛化与样本效率:对训练从未见过的扰动(池成员替换),OC-SFT 的 Pool-PSI 0.031 vs 单序蒸馏 0.099、top-10 变动率 36.3% vs 65.0%——顺序一致性训练泛化到池替换;12 个 base 上全部比 order-averaged 稳定;1K 样本超过后者 30K 样本的表现。但不迁移到标记重命名(需另加标记一致性惩罚)。
  6. 宽度与吞吐:批式 B=20 打分比逐个打分快约 45%,QA 上共享上下文 +0.043 nDCG;段落相关性上宽度效应与零不可区分;训练与推理端平均可叠加(composability)。

六、效果优势的根源解释

建立"方法差异→机制变化→指标提升"因果链:

方法差异一:在损失中显式约束 δ_B(vs 只在标签端或推理端平均)→ 机制变化:权重本身趋于排列不变,服务只需一次前向 → 指标提升:Jaccard 0.656→0.835,且超过 BSC×10 的 0.707。Order-averaged 蒸馏把平均烘焙进标签(教师十遍成本),学生看到的仍是单一目标值、自身残差不受直接约束;BSC 在推理端平均,十倍推理成本才估计出 μ_B。OC-SFT 把不变性要求放在学生自己的前向行为上——方差惩罚直接作用于可微的分数输出,梯度路径最短。

方法差异二:惩罚连续分数的排列方差(vs 稳定离散答案或奖励一致决策)→ 机制变化:截止点处的分数被钉住,阈值消费的输入稳定 → 指标提升:保留集重叠 0.835 且匹配保留率下增益保持。稳定离散选择(如 InfoAC、PA-GRPO 类思路)不触及阈值读的绝对分数;OC-SFT 移除 96.8% 的同伴耦合残差方差,直接压制"换入/换出文档"的分数抖动源。

方法差异三:相关性锚 + 方差项的组合(vs 单独任一项)→ 机制变化:模型既不塌缩为无关评分器,也不退化为单序蒸馏 → 指标提升:nDCG@10 微升 0.010 而非下降。消融证实:去锚则一致但无关(不可用),去方差项则回到单序蒸馏的 0.209 τ-PSI。

方法差异四:窗口内槽位置换训练(vs 依赖推理排列覆盖)→ 机制变化:学到的不变性泛化到训练从未施加的池替换扰动 → 指标提升:Pool-PSI 0.099→0.031、top-10 变动 65.0%→36.3%。训练时的同伴不变、度量时的同伴可变,惩罚目标比度量扰动更弱却依然泛化——说明模型学到的是"同伴不应影响分数"的一般性质而非记住特定排列。

方法差异五:自蒸馏教师(vs 更强教师)→ 机制变化:增益只能来自惩罚项而非监督升级 → 指标提升归因唯一。换更强教师(含 GPT-5.4)买到质量但买不到稳定性,反证 OC-SFT 的稳定性收益来自一致性项本身。

为什么质量不降反升:宽度效应按集合符号不定,而顺序平均回收的质量部分(BSC 在推理端平均带来的质量增益)恰好是 OC-SFT 在训练端内化的部分——两者机制同源,所以 OC-SFT 单排列就能拿到 order-averaged 的质量(0.459 vs 0.455)外加远超其稳定性。

七、必要知识反推

读懂并复现这篇论文需要以下知识(按依赖顺序):

  1. 信息检索评测体系:nDCG@10 的折价机制、BEIR/TREC DL 零样本评测协议、第一阶段检索(BM25/BGE/SPLADE++)与重排的两阶段架构、MS MARCO 训练集。
  2. 重排器设计谱系:pointwise(monoT5、RankLLaMA)vs listwise 生成式(RankGPT、RankZephyr)vs 批式 pointwise(本文场景)的取舍——逐候选分数与共享上下文能否兼得。
  3. 位置偏差与顺序敏感:“lost in the middle” 的 U 形注意力、成对判定的顺序翻转现象、τ-PSI 所改编的位置敏感指数、Kendall τ 相关。
  4. 一致性正则化:半监督学习中的 mean teacher、R-Drop 式多视图分歧惩罚、视图内方差作为可微正则项的构造(及其与 GRPO 组相对 advantage 的形式对应)。
  5. 从 logits 读出分数:答案骨架 + 占位 token + 期望等级的无解码读出——为什么不采样生成能消除解码随机性、保证候选不重不漏。
  6. SFT 工程细节:LoRA 微调、银标签(教师自蒸馏)构造、一致性权重 λ 的选择协议(本文三任务分别取 5/3/1)、3 种子均值的显著性实践。
  7. 奖励模型评估:RewardBench-2/PPE/RM-Bench 的机制差异、成对偏好翻转率作为奖励模型稳定性的度量。

八、通用性灵感

  1. “排名指标饱和、决策指标分化"是评测的普遍盲区。任何用排名/AUC 类指标选模型、却用绝对分数驱动下游(阈值、路由、训练信号)的场景——内容审核分级、漏洞优先级排序、候选筛选——都该补一条"决策稳定性"度量:重排输入看输出变化率。成本极低:稳定性度量所需排列本来就可供出。
  2. 把不变性写进损失,胜过在推理端补偿。多排列平均(自一致性)是推理端修补,十倍成本只到训练级修复的下限;视图方差惩罚以一次前向服务拿到更好效果。“在标签里平均”(蒸馏目标)也弱于"在学生行为上约束”——梯度要打到你要改变的量上。
  3. 分解目标变量是设计正则项的钥匙。f = μ + δ 的分解先明确"哪部分是害"(δ_B)、“哪部分不能动”(μ_B),惩罚才能精准。同样的思路可用于任何"输出 = 期望行为 + 扰动敏感项"的分解:只约束后者,前者自由。
  4. 训练扰动可以比评测扰动弱。OC-SFT 只做窗口内置换却泛化到池替换——不必在训练中枚举全部扰动,学到"不变性原则"比记住"不变性场景"更值钱。但边界也要诚实:标记重命名就不迁移,每种不变性要单独检验。
  5. 自蒸馏作为归因控制。教师就是学生自己的基座,增益便不可能来自更强监督——这个实验设计技巧能干净地把"方法收益"与"数据收益"分离,任何消融研究都可借用。
  6. 可复现性本身可以是产品属性。论文的动机是法律检索这类高风险场景:同查询同候选必须同决策。在构建评分类系统时,把"输出稳定性"当成与"输出质量"并列的第一_class 需求,而不是事后补丁——尤其当评分器的输出会变成下一轮训练的标签时,不稳定性会被放大为训练噪声(65.4% 的查询上顺序决定偏好标签,这是所有用偏好对训练的团队都该自查的数字)。