论文标题:Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors 论文链接:https://arxiv.org/abs/2608.26175 代码与数据:https://github.com/MantasLukauskas/lost-in-compression (全部代码、2.5 万+ 缓存压缩结果、17.8 万+ 评估记录) arXiv 提交时间:2026 年 7 月 27 日(v1,8 月 28 日更新) 机构与作者:Mantas Lukauskas,Hostinger(立陶宛主机托管公司)+ 考纳斯理工大学——企业工程师与高校联合的单人作者论文

一、论文背景

长提示主导着 LLM 应用的部署成本。检索文档、工具输出、对话历史往往比问题本身长几个数量级。提示压缩的思路是在上下文抵达目标模型之前先把它缩短,其中最实用的一族是抽取式:一个小模型决定保留哪些词元或句子,其余丢弃,压缩后的提示仍是纯文本、兼容任何 API——这正是 LLMLingua 系列走红的路线。

但这些方法的开发、训练和评估几乎全部发生在英语世界。经济学现实早就对其他语言不友好了:子词词表把大部分容量分给英语,低资源语言和非拉丁文字要支付持久的词元溢价(token premium)。在这篇论文的平行语料上,同样的内容在九种非英语语言里要多花 1.3 至 1.8 倍 o200k 词元(印地语在 Qwen2.5 分词器下溢价高达 4.45 倍)。

这构成了一个尖锐的悖论:压缩在测试最少的地方潜在价值最大。如果一个英语监督训练的压缩器在非英语文本上退化得更厉害,用户就被罚了两次——词元本来就贵,压缩造成的质量损失还更大。此前没有任何工作系统性地审计过这个问题,这篇论文补上了这个空白。

二、论文定位和关联工作

论文在 Related Work 中梳理了四条线,并明确了自己在每条线上的位置。

提示压缩一线:基于困惑度的剪枝(LLMLingua-1)、蒸馏词元分类(LLMLingua-2)、查询感知重排(LongLLMLingua)、自信息过滤(RECOMP、CPC、EXIT、Sentinel)构成抽取式家族,加上生产系统 Headroom 的 Kompress-v2 和面向 RAG 的查询感知剪枝器 Provence/XProvence。值得注意的是:所有公开抽取式系统发布的检查点都是英语监督的——这与论文记录的失败模式一致。已有部署侧研究(Kummer 等)测过 LLMLingua 家族的延迟与保持率遵从度(rate adherence),但只在英语上;本文发现同样的遵从失败强烈依赖语言。另一条压缩到连续表征的路线(gist 词元、上下文自编码、KV 缓存驱逐)需要模型内部访问,无法用于商业 API,被排除在审计外。对 LLMLingua-2 的可迁移性审计此前只覆盖扩散 LLM 这一轴,跨语言轴从未被审计过。

分词器不平等一线:Petrov 与 Ahia 等人已确立非英语文本的词元定价更高;论文把溢价当作测量背景而非贡献,研究它与压缩的交互。

多语压缩一线:XProvence 是近年唯一的例外——在 BGE-M3 重排器上用 16 种语言的银标签训练。它报告了很强的多语剪枝能力,但没有测量共享目标模型上相对英语的跨语言迁移差距——这正是本文的研究对象。一个有意思的旁证:Headroom 的中文社区分叉(headroom-zh)专门加了中文通道,因为上游英语压缩器在汉字上是"空操作";上游后来在其非学习通道合并了 CJK 感知分词——这是论文量化结论的独立部署侧确认。

多语评估一线:Belebele 提供 122 种语言的平行阅读理解选择题;MultiEURLEX 提供平行法律文档。LLMLingua-2 自己的评估是纯英语的,尽管它的 XLM-R 骨干是多语的——论文要检验的正是骨干的多语预训练是否足以让压缩技能迁移,答案是否定的。

三、问题定义

论文的核心研究问题是:抽取式提示压缩器在英语之外的语言上是否存在迁移差距?如果存在,差距由什么驱动?

形式化地,对语言 ℓ 和压缩条件 c,定义归一化上下文利用率:

U(ℓ,c) = (acc(ℓ,c) − acc(ℓ,无上下文)) / (acc(ℓ,完整上下文) − acc(ℓ,无上下文))

即条件 c 下"可用上下文价值"被保留的比例——完整上下文为 1、无上下文为 0 的归一化锚点。迁移差距定义为 τ(ℓ,c) = U(EN,c) − U(ℓ,c),正值代表该语言相对英语受损更多。

要回答这个问题,审计协议必须把三个混杂变量钉死:

  1. 任务难度:用完全平行的评估项(Belebele 300 题 × 10 语言),各语言答的是同一批内容的翻译版。
  2. 分词器效应:所有对照在目标模型的分词器(o200k)里做预算匹配——截断和随机删除对照逐项匹配到 LLMLingua-2 实际达成的词元预算,而非名义请求率。
  3. 模型行为:设置无上下文锚点吸收"先验猜测能力"的语言差异;full / no-context / shuffled-context 三重锚点。

被审对象:四个学习型压缩器(LLMLingua-2 XLM-R 版、LLMLingua-2 mBERT 版、Kompress-v2——三个英语监督;XProvence——一个多语监督)对阵四个确定性基线(TF-IDF 句子抽取、前缀截断、随机词删除、词形还原+停用词删除)。评估跑在 11 个目标模型上:主力 GPT-5.4-mini 与 Claude Haiku 4.5 全网格(n=300),另 9 个模型缩减网格复制(GPT-5.6-luna、Gemini 3.5 Flash、Llama 4 Maverick、Mistral Medium 3.5、DeepSeek V4 Flash、Kimi K2.6、MiniMax M3、Nova 2 Lite、Qwen 3.7 Plus)——覆盖十家厂商,特意纳入四家中国厂商模型以检验"重中文预训练是否保护中文压缩"。总计约 25.8 万次评估调用。

语言覆盖:EN、PL、FI、ET、LV、LT、UK、ZH、AR、HI 十种语言、五个语系、七个分支、五种文字系统(拉丁、西里尔、汉字、阿拉伯、天城文),o200k 溢价从 1.28(中文)到 1.83(拉脱维亚语)。

统计上用条目级配对自助法(2000 次重采样)报 95% 置信区间,不做多重校正,但强调"跨模型、跨方法、跨保持率复现的模式"而非任何单一区间——并通过段落级聚类自助敏感性检验确认所有头条结论不变。

四、问题解法

严格说这是一篇审计型论文,其"方法"就是审计协议本身,外加两个衍生分析。

**主审计(Section 4)**按三个维度分解差距。按保持率:ρ∈{0.75, 0.5, 0.33} 三档请求率下测量 U 与 τ。按方法:学习型压缩器对阵同预算的确定性对照,如果差距只出现在学习型一侧,就排除了任务或分词器的解释。按目标模型:11 个模型复制,如果每个厂商的模型都复现同一模式,就排除了特定模型的解释。此外用 mBERT 骨干替换 XLM-R 骨干做"架构排除"实验:同一英语监督、不同编码器骨干,若差距照旧,则差距不在骨干。

长上下文压力测试(Section 5):把目标段落埋进七个同语言干扰段落中(约 2–3k 词元、150 项),检验"压缩必须在干扰中存活"的更难设定。配套一个任务依赖臂:MultiEURLEX 法律主题分类,答案依赖表面信号而非分散内容,用来检验差距是否是任务性质的函数。

翻译套利分析(Section 6):先翻成英语再压缩(NLLB-200-distilled-600M 翻译 + LLMLingua-2 压缩),对比原生语言压缩的准确率与词元成本——如果差距跟随表面语言而非语义,翻译管道应当占优。

协议里还有几个体现严谨性的细节:LLMLingua-1 因技术门禁被排除(它对立陶宛语完全不压缩,实际保持率 0.99——这本身就是困惑度剪枝不可迁移的证据);答案解析用"脚本无关"的字母抽取规则,因为词边界正则在 CJK/阿拉伯/天城文旁边会失效;指令语言恒定英语,隔离"指令遵循能力"的混杂。

五、评估指标与实验证据

三大发现及支撑数据如下。

发现一:迁移差距真实、随压缩率急剧放大、跨模型复现。

语言ρ=0.75ρ=0.5ρ=0.33(GPT / Claude 的 U 值)
EN0.88 / 0.950.74 / 0.820.57 / 0.62
PL0.91 / 0.84*0.58* / 0.54*0.41* / 0.18*
LT0.82 / 0.820.39* / 0.51*0.10* / 0.24*
ET0.80 / 0.84*0.52* / 0.54*0.20* / 0.26*
UK0.79 / 0.910.53* / 0.53*0.10* / 0.26*
ZH0.62* / 0.73*0.20* / 0.46*−0.03* / 0.26*

(* 表示与英语的差距 95% 置信区间不含 0;表中为 LLMLingua-2 在两个主力模型上的表现)

温和压缩(0.75)下各语言几乎无差别;激进压缩(0.33)下 8/9 非英语语言差距显著(两个主力模型均是)。立陶宛语、乌克兰语只保留 10% 上下文价值,中文跌破无上下文锚点(U=−0.03)——压缩后的上下文比不给上下文还糟,而用户仍在为这些词元付费。中文还有一个反直觉细节:它的词元溢价全组最小(1.28 倍),却受压缩惩罚最大——词元定价与压缩安全性是解耦的。跨 11 个模型复制:ρ=0.5 的平均差距 +0.26 至 +0.40,中文全部是受创最重语言(DeepSeek 上达 +0.82)。四家中国厂商模型(DeepSeek/Kimi/MiniMax/Qwen)的中文差距反而最大(+0.70 至 +0.82)——重中文预训练毫无保护作用,因为信息在压缩器一侧就已被删除。更新一代目标模型(GPT-5.6-luna)也无法恢复:差距 +0.35 vs 老款 +0.27。安全压缩预算(U≥0.8 的最深保持率):英语约 2 倍压缩,其余九语约 1.3 倍或更浅——非英语预算直接减半。

发现二:差距追踪监督语言,而非架构。

压缩器骨干监督ρ=0.5 差距(GPT 主力)
LLMLingua-2XLM-R英语(MeetingBank 蒸馏)平均 +0.23,7/9 语言显著
LLMLingua-2mBERT英语平均 +0.31,7/8 语言显著(ZH 除外)
Kompress-v2ModernBERT英语为主 17 域+0.29,8/8 可审语言显著(Claude +0.39)
XProvence v1BGE-M316 语原生多语−0.03,0/9 显著(无差距)
XProvence v2BGE-M3翻译版 MS MARCO 重训保守阈值无差距;激进阈值 +0.16 至 +0.29 复现
确定性方法(TF-IDF/截断/随机/词形还原)——GPT 上 0/9 显著

三种不同骨干的英语监督压缩器全部复现差距、多语监督完全无差距、确定性方法无差距——三元组把结论钉死在监督数据上。XProvence v2 的行为更添一层警示:激进阈值下对 92% 的中文输入返回空上下文(无任何错误或警告),说明翻译数据训练的多语校准并不稳定。附带还记录了两种保持率遵从失败:mBERT 版对中文请求 0.75 实际 1.20(越压越长,因字符级 WordPiece 破坏了汉字预算核算);Kompress-v2 对中文请求压缩实为空操作(实际保持 0.91–0.96,空白符分词无法切分汉字)。方法论后果很严重:英语 0.33 保持率下 LLMLingua-2 领先 TF-IDF 12–14 个点,非英语缩至 −5 至 +7 且在爱沙尼亚/立陶宛/中文被反超——只看英语评估会排出错误的方法序。

发现三:长上下文压力测试中,激进学习压缩把非英语上下文压到无上下文水平。 目标段落埋在七个干扰段中时,GPT 上立陶宛语、拉脱维亚语、波兰语的压缩上下文 U≤0——花了词元成本却零收益;英语仍保留 0.56。而词形还原+停用词这类确定性方法在自然预算下各语言都保留 44–66%。任务依赖臂给出关键限定:MultiEURLEX 主题分类上压缩在所有语言近乎免费(压到 20 倍仍不掉分,只看标题的 5% 预算启发式甚至打平或超过全文)——跨语言惩罚是"答案依赖分散内容"任务的属性,不是压缩本身的属性。翻译套利:译英再压缩以约 0.18 倍原生词元成本在五种测试语言中的三种打平或战胜原生压缩(立陶宛语 +10 个点)。

另一个部署侧不可见的失败模式:Claude 对降级输入的拒答率上升——截断/随机删除的中文调用拒答达 11%,无上下文时按语言 9–31%——激进压缩会把答案变成用户可见的拒答,这在纯英语评估中完全看不到(GPT 无此行为,故头条结论不受影响)。

六、效果优势的根源解释

这篇论文的"效果"是诊断证据的强度。为什么差距由监督语言驱动?建立"方法差异→机制变化→指标提升"的因果链:

第一步:实验设计的三角定位。 差距的可能来源有四个——任务难度、分词器、目标模型、压缩器。平行数据钉死任务;预算匹配对照钉死分词器;11 个模型复制钉死目标模型;剩下的变量只能在压缩器内部。压缩器内部又有两个候选:骨干架构与监督数据。mBERT/XLM-R/ModernBERT 三种骨干的英语监督压缩器全部复现差距,XProvence v1(BGE-M3,多语监督)完全无差距——架构被排除,监督语言是唯一在所有对比中一致的解释变量。这正是控制变量审计的力量:不是靠单一实验,而是靠一组正交对照把因果归因收敛到唯一幸存假设。

第二步:失败机理是语法载体破坏,而非事实删除。 诊断数据排除了"压缩器删除了非英语事实"的直觉解释:ρ=0.33 下携带数字的词元在立陶宛语(0.70)、拉脱维亚语(0.78)、波兰语(0.70)的保留率都高于英语(0.61),但质量跌得远更多。真实机理是类型学的:波罗的、斯拉夫、芬兰语族的主题角色编码在屈折词缀里而非词序里,英语训练的分类器学到的"删低信息功能词元"策略,在这些语言里删的恰恰是承载句法关系的词形变化;中文(孤立语、无格变化、受创最重)则是另一条路:多数汉语词是多字的,字符级删除会造出别的词或非词,而语法助词(宾语标记"把"、被动标记"被"、体标记"了"、从属标记"的")恰是英语训练分类器学会丢弃的高频"功能词元"。附录 D 的格标记最小对探针提供了初步因果证据:完整段落时两种语言都满分,ρ=0.33 压缩后英语保持 98.7% 而立陶宛语跌到 82.7%,错误模式是退到"未陈述"而非角色颠倒——压缩摧毁的是允许角色指派的线索,不是事实本身。

第三步:机理如何解释各指标表现。 表面语法载体被破坏(机制)直接预测观测到的模式:U 值随压缩率陡降(删得越多,屈折骨架损毁越彻底);中文最惨(语法粒子是高频删除目标+多字词被切碎+分段/预算控制双重失败叠加);确定性方法无差距(TF-IDF 抽取整句、词形还原只删停用词,都不做词元级"低信息"判断,语法骨架完整保留);翻译套利有效(翻译把文本搬进英语的语法载体范式后,英语压缩器的一切假设都成立了——这本身就是"差距跟随表面语言而非语义"的机制性证明);MultiEURLEX 无差距(主题分类靠标题等表面信号,不依赖被破坏的分布式句法线索)。

第四步:多语监督为何无差距。 XProvence v1 的两点细节都有机制解释:它在非英语上达成保持率更高(中文 0.67、印地语 0.83 vs 英语 0.47),部分安全性来自"校准的保守主义——不确定的地方少删";其 16 种训练语言只覆盖本文四种非英语语言,其余五种靠骨干跨语言迁移也无差距——说明多语监督教会的是不依赖英语特定"功能词"启发式的通用判断。v2 的失败反过来印证:翻译数据训练的分数校准在中文上退化(阈值 0.1 时保留整段、阈值 0.5 时删空 92%),加上其分句器把中文段落当单一单元(平均 1.0 段 vs 其他文字 3.4–4.3 段),中文剪枝沦为全有或全无——多语监督消除差距的条件是分数按语言校准,翻译训练不保证这一点。

七、必要知识反推

读懂并延伸这篇论文需要以下知识储备:

  1. 抽取式提示压缩的技术谱系:LLMLingua-1 的困惑度剪枝(小代理 LM 打分删高困惑词元)与 LLMLingua-2 的蒸馏词元分类(GPT-4 在 MeetingBank 上做保留/删除标注、蒸馏成 XLM-R/mBERT 分类器)的差别——理解"监督语言"指什么的前提。
  2. 分词器经济学:子词词表的 BPE/WordPiece/Unigram 机制,为何低资源语言和非拉丁文字溢价;o200k、Qwen2.5、XLM-R 三种分词器的定价差异;XLM-R 分词器对十种语言定价几乎相等(0.97–1.25)这一点为何能排除"输入长度"解释。
  3. 语言学类型学基础:屈折语(波罗的/斯拉夫语族的格与一致)、黏着语(芬兰语族)、孤立语(中文)如何分别编码语法关系;为什么"低信息功能词元"这个英语中心的启发式在类型学上是错误的。
  4. 受控实验设计与归一化度量:平行数据、预算匹配对照、双锚点归一化的原理;配对自助法置信区间、聚类敏感性检验、多重比较的处理哲学(不做校正但强调跨条件复现)。
  5. 多语基准的构造:Belebele(122 语平行阅读理解)、FLORES 翻译链带来的"翻译腔"偏差方向(非英语段落句法上更接近英语,故测得的差距对原生文本是下界)、MultiEURLEX 的多标签主题分类设定。
  6. 生产部署约束:前缀缓存经济学(压缩共享缓存上下文的实际节省低于朴素词元算术;查询感知剪枝产生每查询唯一上下文、彻底放弃缓存复用)、rate adherence 作为生产可观测指标(请求率与达成率的分歧是所有失败模式的免费信号)。
  7. 相关工具栈:NLLB-200 机器翻译、BGE-M3 多语重排器、simplemma 词形还原、spaCy 分句——以及各检查点的许可证约束(XProvence 与 NLLB 均为非商业许可,商用需自建或退回确定性方法)。

八、通用性灵感

  1. “英语评测会排出错误的方法序"是普适教训。 英语 0.33 保持率下学习型压缩领先 TF-IDF 十几个点,跨到九种语言优势蒸发甚至反转。任何在单一语言/单一分布上做的基准排名,都应问一句:换一个分布,序会不会翻转?论文给的解法是报告跨语言"保持率—效用"曲线而非单点英语分数——这种"曲线而非单点"的评估哲学值得一切基准工作采纳。
  2. 控制变量三角定位是因果归因的模板。 任务、分词器、目标模型、骨干逐一钉死后,“监督语言"作为唯一幸存假设胜出。这套"平行数据+预算匹配+多模型复制+骨干替换"的组合拳,可直接搬到工具调用的多语审计、检索器的领域迁移审计等任何"X 方法是否在 Y 分布上退化"的问题。
  3. 表层统计会骗人,要测"信息载体"级别的保留。 数字保留率更高但质量更跌,说明逐词元统计无法预测语义损伤。真正的诊断维度是该语言的语法信息承载在哪种载体上(词序 vs 屈折 vs 助词),工具设计必须类型学感知——这解释了为什么 headroom-zh 社区必须为汉字单独开通道。
  4. “静默失败"是生产系统的隐形杀手。 空操作、越压越长、空上下文返回——所有这些失败都不报错、不警告,唯一的免费信号是请求率与达成率的分歧。论文建议"按语言监控达成率"几乎零成本,这是任何部署学习型预处理组件的系统都该上的护栏。
  5. 翻译套利是一种通用架构模式。 当目标语言上工具失效而英语上工具成熟时,“翻译到工具语言、执行、再回来"可以是占优策略(0.18 倍成本、三种语言打平或更优)。同一时期已有独立工作把这套经济学做成代码 agent 的边缘侧中间件——说明这不是孤例而是可复用的设计。
  6. 任务的"信息分布"决定压缩安全性。 答案依赖分散内容的任务(阅读理解)压缩危险,依赖表面信号的任务(主题分类)压缩近乎免费、甚至 5% 预算的标题启发式就能打平全文。部署压缩前先问"我的任务的答案信号是集中的还是分散的”,比选压缩器更重要。
  7. 单人作者+企业背书的审计也可以达到顶会级严谨度。 预注册模型清单、分层敏感性检验、诚实披露 FLORES 翻译腔偏差方向、明确标注"方向性而非决定性"的子实验(n=60 的套利臂)——这种自我约束的研究规范,比论文结论本身更值得学习。