The Laws of Context Allocation (Ascp) 精读
论文链接:arXiv:2608.23252 代码仓库:PeiYangLiu/ascp(代码+数据+因果测量工具) 发表时间:2026年8月 机构:北京大学(国家软件工程研究中心,第一/二/通讯作者)+ 腾讯(第三作者)——企业+高校合作 领域标签:cs.IR / cs.CL(RAG 理论/生成式搜索)
一、论文背景
生成式搜索是什么? 用户提问后系统检索文档、LLM 阅读并生成带引用的答案——AI 搜索(Perplexity 类产品)的核心管线。长上下文模型兴起后,一个看似自由的选择出现了:同样的 token 预算,是堆一个宽上下文(一次读 24 篇文档),还是窄窗多轮(每轮读 2 篇、生成 12 轮)? 业界凭直觉各选各的,没有定量定律。
测量先于优化:要研究分配,先要能测量"每篇文档被用到什么程度"。现有工具全是相关性代理——BM25、embedding 余弦、注意力权重——它们测的是"这篇文档与查询/生成文本有多相关",不是"这篇文档因果地改变了生成"。一篇高度相关但被忽略的文档,代理分数照样很高——这就是"诊断幻觉":你以为模型在用证据 A,其实它在用证据 B。
本文三件套:因果测量工具(LOO 探针)→ 分配定律(k×T 因子实验)→ 闭环调度器(Ascp,读因果反馈动态分配)。
二、论文定位和关联工作
- RAG 归因线(attention/feature attribution 类):注意力权重≠因果利用是已知警示——本文给出可并行的因果探针(teacher-forced 反事实,无解码开销)。
- 迭代检索线(IRCoT/FLARE 等):多轮检索启发式有效——本文给出定量定律与机制解释(为什么多轮赢)。
- 推理时缩放线:把"多轮生成"视为搜索场景的 test-time scaling——与 o1 类推理链的思想同源,但落地在证据分配。
三、问题定义
抽象问题:固定推理预算 B(token 数)在检索宽度 k(每轮读几篇)与生成轮数 T 间如何分配使生成质量最大化? 前置问题:如何测量单篇文档对生成文本的因果利用率(而非表面相关性)?
四、问题解法
4.1 因果留一(LOO)探针
对已生成文本 Y 与文档集合 D,逐篇做 teacher-forced 反事实:移除文档 d_i 后重新计算 Y 中每个 token 的 log-likelihood,per-token 似然下降量即 d_i 的因果利用率。可并行、无解码开销(只做前向)。类比医学:相关代理像"问卷自述",LOO 像"撤药试验"——停了这个药(文档),病情(似然)恶化多少,才是它真实的作用。
4.2 去混杂因子实验
k∈{2,5,12,24}×T∈{1,5,12} 全交叉、同预算(24 slot)对比——控制总 token 消耗后隔离分配方式的影响。
4.3 Ascp 闭环调度器
次模调度:每轮读因果反馈(哪些知识面已被消费),惩罚已消费面、优先未曝光证据;配归因引导对比解码(logit 级减去过度使用文档的概率质量,APC 安全约束)。
五、评估指标与实验证据
分配定律(同预算 24 slot):
| 分配 | PR@T |
|---|---|
| (k=24, T=1) 宽窗单轮 | 0.253 |
| (k=2, T=12) 窄窗多轮 | 0.397(+0.144,95%CI [0.119,0.170]) |
- T:1→12 带来 16.8-20.5pp 绝对 recall 提升;宽度弹性 -0.68(注意力稀释定律:每多读一篇,单篇利用率系统性下降);
- 规模验证:Qwen2.5-14B +0.134、32B +0.138——定律不是小模型伪影。
LOO 探针的效度(决定性实验):same-query 硬负例(同一查询的其他相关文档作为负例)下:LOO AUC 0.876@k=3,BM25 坍缩到 0.444、query-doc cosine 0.484(随机水平)——同一查询的文档全在同一语义空间,任何基于相似度的方法在此处原理性失效,只有干预式消融能区分"真用了"与"话题相关"。
闭环调度:2400 个冻结 held-out 帧,Ascp PR 0.309 vs Carriage 0.276(+0.033)、PM-2-RAG 0.228(+0.081)、vanilla RAG +0.072(全部 BH q<0.001);证据消费率 ECR 0.626 vs deep rotation 0.375——同 recall 少喂 40% 文档。
杀手级消融:把调度器的因果反馈换成 embedding 相似度 → 增益完全坍缩(-0.002, p=0.73)——全部收益来自反事实信号,不是"多轮"这个形式本身。
六、效果优势的根源解释
宽上下文为什么输:双重惩罚——检索侧:深排名文档的 relevance density 衰减(排第 24 的文档本来就弱);生成侧:注意力稀释(弹性 -0.68,每篇分到的有效注意力随 k 递减)。
窄窗多轮为什么赢:每轮强制曝光新证据;实测轮转实际 grounding 50.9 篇文档 vs 固定上下文 12 次采样仅 10.3 篇——LLM 无法从静止 prompt 幻觉出多样性,必须靠外部轮转喂入。新证据占生成收益的 72%(k=2 时)。
调度器增益的来源:因果反馈告诉调度器"哪个知识面已消费"——避免重复喂同质文档;换成相似度后该信号消失(相似度无法区分"用过"与"相关"),增益归零——消融直接锁死因果链。
七、必要知识反推
- 领域知识层:RAG 管线组件(检索器/生成器/引用机制);portfolio recall 等多文档生成指标的设计。
- 方法论知识层:反事实干预与因果识别(LOO 是 do-calculus 的工程近似);因子实验设计(k×T 交叉控制预算);次模优化(收益递减下的分配问题经典工具)。
- 工程知识层:teacher-forced 批量前向的低成本实现(无解码、可并行);对比解码的 logit 操作。
知识融合的关键节点:把因果推断的"干预识别"思想从特征归因迁移到"证据利用"测量,再用测出来的因果量作为闭环控制的反馈信号——测量、定律、控制三位一体,这是完整科学闭环的范式(类似统计力学:测温度→建状态方程→造发动机)。
八、论文中可以提取的通用性灵感
“相关"与"被使用"是两个概念,干预才能区分(机制类)
- 证据:same-query 硬负例下相似度全部坍缩到随机(0.44-0.48),LOO 0.876。
- 推广:会议参与(到场≠贡献,撤掉他试试项目是否停摆)、信息消费(收藏≠阅读——“撤掉这个信息源,你的决策会变吗”)、团队评估(离开某人业绩是否变化,比绩效分数更接近真实贡献)。
静止的大上下文产生幻觉一致性,轮转才有多样性(机制类)
- 证据:固定上下文 12 次采样仅 grounding 10.3 篇,轮转 50.9 篇。
- 推广:头脑风暴(同一批人同一个房间想不出新点子,换人/换环境打破锚定)、投资研究(定期更换信息源而非加订更多同质报告)、创作(轮换素材库比囤积素材更防自我重复)。
预算分配定律比预算总量更重要(现象类)
- 证据:同预算 24 slot,分配方式差异 +0.144;T 的弹性远大于 k。
- 推广:工作时间的深度/碎片分配(同样的 8 小时,2 小时×4 段深块 vs 24 个碎片,产出天壤之别)、学习(少量内容多轮复习 vs 一次大量输入,间隔效应的工程版本)、营销预算(多轮小预算触达 vs 一次性铺量)。
消融要打到"换掉核心信号"这一层(方法论类)
- 证据:因果→相似度的替换消融使增益完全归零,锁死收益来源。
- 推广:任何系统改进都应做"等成本替换消融”——把你的核心组件换成等成本的常规替代品,若性能不变,说明改进来自别处(通常是工作量/数据量),这是对自己最诚实的检验。