论文链接:arXiv:2510.03215(ICLR 2026 已录用,v2 2026-03-02) 代码仓库:github.com/thu-nics/C2C 发表时间:2025年10月首投,2026年3月修订 机构:清华大学(通讯 Yu Wang)+ Infinigence AI + 香港中文大学 + 上海交通大学 + SLAI/上海AI Lab——高校与企业(Infinigence AI 推理优化公司)联合研究 领域标签:cs.CL / Multi-LLM Systems / KV-Cache / 推理加速
一、论文背景
多 LLM 系统是什么? 从 Mixture-of-Agents、MetaGPT 到 Chain-of-Agents,让多个模型分角色协作解题已成主流范式;另一路是路由系统(RouteLLM 等)按难度把查询分给不同大小的模型。两条路线的共同底层动作是信息在模型间流动。
文本通信(T2T)的三宗罪(论文 Figure 2 的 Coder-Writer 例子极形象):
- 信息瓶颈:高维表征被反复压缩成线性 token 串。Coder 知道
<p>是段落分隔符、内容该插在它后面——但"写进 section 包裹器里"这句话传不过去,Writer 只能把自我介绍插错位置。 - 语言歧义:成语、欠指定指代、模糊表达让接收方靠猜。
- 解码延迟:每次通信都要 token-by-token 生成完整解释文本。
为什么想到 KV-Cache? Transformer 推理时每层都为每个 token 缓存 Key/Value 向量——它是模型对上下文"消化后"的表征,维度高、语义密、且推理时天然就在那里。三个 oracle 问题指引设计:同一上下文下"更富的 cache"能否不靠加长提升质量?不同模型的 cache 能否互相转换?不同模型对同一输入的理解是否互补?
二、论文定位和关联工作
| 谱系 | 代表工作 | 核心思想 | 与本文关键区别 |
|---|---|---|---|
| 模型内 KV 复用 | 跨层注意力共享(Brandon et al. 2024)、prefix 缓存 | 省算力 | 单模型内部;C2C 跨家族跨尺寸 |
| 跨模型 KV 复用 | DroidSpeak (arXiv:2411.02820) | 同基础模型微调版之间选择性重算+复用 KV | 要求同架构;目的是加速;C2C 支持异构家族且目的是语义增强 |
| 协作多 LLM | MetaGPT / MoA / Multi-agent Debate / MCP / A2A 协议 | 文本消息交换 | 全部走 T2T 接口;C2C 把通信介质换成 cache |
| 路由系统 | RouteLLM / R2R | 按查询/按 token 选模型 | 下游模型丢掉上游理解;C2C 显式传递理解 |
| 潜空间通信 | Pidkuiko & Starkov 2025; Zheng et al. 2025(论文引) | 探索深层协作 | C2C 给出通用、可规模化的实现与系统评测 |
定位结论:C2C 不是又一个缓存加速技巧,而是把**KV-Cache 从"计算副产品"提升为"模型间通信介质"**的新范式主张——DroidSpeak 复用 cache 是为了省算力(同构前提),C2C 融合 cache 是为了传语义(异构支持)。
三、问题定义
具体问题:Receiver 模型回答问题时缺某类理解/知识(如小模型不懂 HTML 结构),Sharer 模型有。如何把 Sharer 的理解传给 Receiver,而不经过文本?
核心洞察(类比):T2T 像两个人只能通过"写便条"协作——专家把满脑子的直觉写成一段话,新手再读话重建直觉,两头都失真。C2C 是"直接拷贝一段脑区激活":共享的不是结论的描述,而是加工过程本身。
形式化:给定 Sharer cache C_S(X) 与 Receiver cache C_n(X)(第 n 层),求融合 cache C_F,n = C_n(X) + F_n(C_n(X), C_S,G(n)(X)) 其中 F_n 是待训练的 fuser,G 是层映射。解码时 Receiver 基于融合 cache 生成回答。约束:两个 LLM 全部冻结,只训 Fuser。
精妙之处:残差式设计(C_n + F_n(…))保证 fuser 只能"增强"不能"覆盖"——消融显示纯投影替换会把准确率打到 20.7%,残差融合拉回 44.88%,再加门控到 47.95%。
四、问题解法
4.1 Oracle 实验先行(设计由证据驱动)
- 富化 oracle:few-shot 的收益到底来自"多了可注意的 token"还是"示例富化了问题的嵌入"?实验:prefill 示例+问题后丢弃示例段 cache 只留问题对齐切片(长度不变)——准确率 58.42%→62.34%,证明 cache 语义质量可独立于长度提升。
- 层选择性:给不同层做富化,top-5 层富化优于全层富化,选最差层反而降分——这直接催生了后面的逐层门控。
- 可转换性 oracle:3 层 MLP 把 Qwen3-4B 的 cache 映射进 Qwen3-0.6B 空间,t-SNE 显示映射后落入目标空间(但只覆盖子集——各模型理解本就不完全重叠,恰好说明互补性)。
4.2 Fuser 结构(三模块)
- 投影模块:拼接两模型 cache → 投影层 → 特征融合层
- 动态加权:输入感知的头部调制,逐样本重加权
- 可学习门控:每层一个标量门,Gumbel-sigmoid + 温度退火——训练时可微、推理时二值化,自动决定"哪些层值得注入"
4.3 双重对齐
- token 对齐:不同 tokenizer 切分不同——把 Receiver token 解码回字符串再用 Sharer tokenizer 重编码,一对多时选字符串覆盖最大的
- 层对齐:终端对齐策略——从双方最后一层对齐起,倒数第二层次之,直到浅模型第一层
4.4 训练
冻结双模型,Receiver 以融合 cache 为条件做标准 next-token 预测(类 SFT),梯度只穿过 C2C 模块。主实验用 OpenHermes2.5 前 50 万样本训练。
五、评估指标与实验证据
设置:Receiver 固定 Qwen3-0.6B,三个 Sharer(Qwen2.5-0.5B / Llama3.2-1B / Qwen3-4B-Base);四基准 MMLU-Redux / OpenBookQA / ARC-C / C-Eval;零样本、贪心解码;A100 单卡批 1。Baseline:Receiver-only、Sharer-only、查询级路由、T2T。
| 实验 | 关键数值 | 说明 |
|---|---|---|
| 主表(三 Sharer 平均) | Receiver 提升 +11.00 / +9.64 / +11.88 点;比 T2T 高 +5.36 / +4.15 / +3.06 点 | 12/12 任务-基准格全胜 T2T |
| 效率 | 比 T2T 加速 3.46× / 1.51× / 14.41×;平均 2.5× | T2T 的 Sharer 解码 80 token 花 1312ms;C2C 并行融合仅 90ms |
| Base 模型 Sharer | Qwen3-4B-Base 单独跑仅 1-5 分(不会跟指令),经 C2C 后 Receiver 达 43.95/53.20/55.39/42.79 | 弱指令 Receiver 借用强 base 模型知识——base 模型无法跟指令也能当 Sharer,T2T 完全做不到 |
| 长文本 | LongBenchV1 三个长度段(0-4k/4-8k/8k+)C2C 全面超 T2T 与单模型 | 收益不随长度消失 |
| 尺寸缩放 | Sharer 越大 C2C 增益涨得比 T2T 快 | Sharer 知识越富,cache 传输越划算 |
| 异构组合 | Gemma3/Math/Coder Sharer 五组合 C2C 平均超 T2T 8.59 点 | 跨家族(Qwen+Gemma)、跨专长均有效 |
| 角色互换 | 互换后 C2C 仍 +5.05,T2T 反而 −6.30 | 方向鲁棒 |
| 消融:增益来源 | Single 596M 参数 36.81(MMLU)< Identical 529M 42.17 < C2C 478M 42.92 | 排除"多训了参数"与"同模型自通信"两种解释——异构互补才是主因;且 C2C 参数最少 |
| 消融:fuser 组件 | 纯投影 20.70 → +残差融合 44.88(+24.18)→ +门控 47.95(+3.07) | 残差原则与层选择各自贡献巨大 |
| 有效秩分析 | K cache 秩 388→395、V 532→560 | 融合确实丰富了 Receiver 的语义空间(秩上升=信息注入) |
实验设计为何有证明力:Single/Identical/C2C 三臂消融把"参数量、同构自通信、异构互补"三个混淆一次拆开;T2T 的 prompt 公开于附录保证对比公平;互换实验排除方向性运气。
六、效果优势的根源解释
6.1 因果链
- T2T 的信息损失是结构性的(论文 oracle 支持 + DroidSpeak 先例):文本是 10⁵ 词表上的一维序列,模型内部 d≈896-2560 维的分布式表征必须有损压缩。Coder-Writer 例子中
<p>的结构语义在文本化时彻底蒸发。 - cache 融合保住了高维语义(论文实验支持):有效秩上升(388→395 / 532→560)说明 Sharer 的表征方向被真实注入而非平均掉;准确率增益随 Sharer 增大而扩大(缩放实验)——注入的是知识而不只是噪声。
- 互补性是增益的真正来源(消融证明):Identical(同模型自通信)只从 36.81→42.17,异构 C2C 再到 42.92 且参数更少——不同模型对同一输入的正确答案集合只有部分重叠(论文 Figure 7),异构差异=可收割的互补理解。
- 延迟优势来自并行的物理事实:token 解码是串行的(每步依赖前一步),cache 融合是一次矩阵乘——1312ms vs 90ms 不是优化差距而是范式差距。(与 Skeleton-of-Thought 的"并行化解码"同源洞察,方向不同:SoT 并行化单模型生成,C2C 消除协作通信的解码)
6.2 外部检索与对照
| 研究 | 相似尝试/相关结论 | 与本文关系 |
|---|---|---|
| DroidSpeak (arXiv:2411.02820, UChicago+微软) | 同基座微调模型间选择性复用 KV,4× 吞吐 | 前提限定:要求同架构,方向是省算力;C2C 放宽到跨家族并把目标从效率改为质量——两者共同证明"KV 跨模型可迁移"这个物理基础 |
| Skeleton-of-Thought (Ning et al., ICLR 2024) | 分解提示并行生成子段 | 同构结论:串行解码是延迟主因,绕过即加速;但 SoT 仍在文本层,C2C 下探到表征层 |
| Cartridges (Eyuboglu et al. 2025) | 自学习生成轻量 KV"墨盒"复用长上下文 | 互补邻居:单模型内把上下文固化成可复用 cache;与 C2C 组合可想象"跨模型墨盒" |
| 论文自引 Pidkuiko & Starkov 2025 | 潜空间直接共享的早期探索 | 研究脉络的直接前驱,C2C 提供了系统化、异构化的实现 |
| 未发现 | 未见 O(N) 训练成本下多模型(>2)cache 互通的工作 | 论文自认 scale 到 N 模型是 open problem——当前边界在 pairwise |
6.3 综合判断与未决问题
- 多研究共同支持:KV-Cache 跨模型可迁移且有价值(DroidSpeak+C2C 双源);串行解码是协作延迟的结构性瓶颈(SoT+C2C)。
- 本文独有证据:异构互补>同构自通信的因果分离(Identical 消融);层选择性富化的因果(top-5 层>全层)。
- 仍属推测/边界:弱 Sharer 会注入噪声拖累强 Receiver(论文自认 T2T 同病);任务局限于 QA 类四基准,多轮 Agent 工具调用场景只有附录数学案例研究;训练成本 O(N²)(每对模型训一个 fuser);隐私收益(不暴露明文)只有方向性讨论未实验。
七、必要知识反推
- Transformer 推理机制层:prefill/decode 两阶段、KV-Cache 的形状与语义(每层每 token 的 K/V)、为什么解码必须串行——不懂这些无法把 cache 当通信介质。
- 表征几何层:t-SNE 可视化、有效秩(Roy & Vetterli 2007)、表示空间子集覆盖的解读——oracle 实验的推断全靠这些工具。
- 训练工程层:冻结主干只训 adapter 的范式、Gumbel-sigmoid 温度退火(可微→二值)、SFT 式 next-token 监督——fuser 的可实现性依赖这些技术。
- 多 LLM 系统层:MoA/Debate/路由的通信拓扑、MCP/A2A 协议的文本模板局限——知道旧范式的失真点才能定位新范式的卖点。
- 知识融合关键节点:① “丢弃示例段 cache"的 oracle 设计——用一个删除实验分离了"上下文长度"与"表征富度"两个变量;② 残差原则的坚持——纯投影 20.7 分的血案反向证明了"增强而非覆盖”;③ token 重编码对齐——解决异构 tokenizer 这一别人绕开的脏活。
八、论文中可以提取的通用性灵感
核心思想:两个智能体协作时,传输"加工过程"(中间表征)比传输"结论描述"(输出文本)信息保真度更高、速度更快。
- 论文证据:C2C 比 T2T 平均 +3.1-5.4% 且 2.5× 加速;有效秩与互补答案集分析。
- 推广场景:多 Agent 系统传递结构化工作记忆而非聊天记录;模型级联中传 logits/嵌入而非文本;人机协作中共享思维导图而非成文报告。
核心思想:一个对象的"副产品"(KV-Cache 本为省计算而生)可能在另一个问题域里是主产品(通信介质)。
- 论文证据:cache 同时满足高维、语义密、推理时免费存在三个通信介质理想属性。
- 推广场景:把编译中间码用于跨语言迁移;把日志副产品用于异常检测;把注意力图用于可解释性。
核心思想:注入式增强要遵守残差原则——加法门控而非整体替换,让系统能保留自身已有能力。
- 论文证据:纯投影替换 20.70 分 vs 残差融合 44.88 分,24 分差距是全文最大的单一消融效应。
- 推广场景:Adapter/LoRA 设计;机器人学中叠加先验而非覆盖策略;RAG 系统拼接而非替换用户上下文。
核心思想:融合收益要能追溯到"互补性",用同构对照排除"参数变多/训练变多"的平凡解释。
- 论文证据:Single/Identical/C2C 三臂消融,C2C 参数最少分最高。
- 推广场景:集成学习证明多样性价值;多源数据融合的增益归因;团队协作中"互补技能"的量化验证。
核心思想:异构双模(base 模型有知识无指令跟随、instruct 模型有跟随无知识)可以通过表征层管道互补。
- 论文证据:Qwen3-4B-Base 单独跑 1-5 分,经 C2C 让 0.6B Receiver 达 53+(OpenBookQA)。
- 推广场景:让小 instruct 模型调用大 base 模型的领域知识;专家系统与 LLM 的表征层桥接;低成本蒸馏新范式(不用生成文本教师样本)。