论文链接:arXiv:2510.03215(ICLR 2026 已录用,v2 2026-03-02) 代码仓库:github.com/thu-nics/C2C 发表时间:2025年10月首投,2026年3月修订 机构:清华大学(通讯 Yu Wang)+ Infinigence AI + 香港中文大学 + 上海交通大学 + SLAI/上海AI Lab——高校与企业(Infinigence AI 推理优化公司)联合研究 领域标签:cs.CL / Multi-LLM Systems / KV-Cache / 推理加速

一、论文背景

多 LLM 系统是什么? 从 Mixture-of-Agents、MetaGPT 到 Chain-of-Agents,让多个模型分角色协作解题已成主流范式;另一路是路由系统(RouteLLM 等)按难度把查询分给不同大小的模型。两条路线的共同底层动作是信息在模型间流动。

文本通信(T2T)的三宗罪(论文 Figure 2 的 Coder-Writer 例子极形象):

  1. 信息瓶颈:高维表征被反复压缩成线性 token 串。Coder 知道 <p> 是段落分隔符、内容该插在它后面——但"写进 section 包裹器里"这句话传不过去,Writer 只能把自我介绍插错位置。
  2. 语言歧义:成语、欠指定指代、模糊表达让接收方靠猜。
  3. 解码延迟:每次通信都要 token-by-token 生成完整解释文本。

为什么想到 KV-Cache? Transformer 推理时每层都为每个 token 缓存 Key/Value 向量——它是模型对上下文"消化后"的表征,维度高、语义密、且推理时天然就在那里。三个 oracle 问题指引设计:同一上下文下"更富的 cache"能否不靠加长提升质量?不同模型的 cache 能否互相转换?不同模型对同一输入的理解是否互补?

二、论文定位和关联工作

谱系代表工作核心思想与本文关键区别
模型内 KV 复用跨层注意力共享(Brandon et al. 2024)、prefix 缓存省算力单模型内部;C2C 跨家族跨尺寸
跨模型 KV 复用DroidSpeak (arXiv:2411.02820)同基础模型微调版之间选择性重算+复用 KV要求同架构;目的是加速;C2C 支持异构家族且目的是语义增强
协作多 LLMMetaGPT / MoA / Multi-agent Debate / MCP / A2A 协议文本消息交换全部走 T2T 接口;C2C 把通信介质换成 cache
路由系统RouteLLM / R2R按查询/按 token 选模型下游模型丢掉上游理解;C2C 显式传递理解
潜空间通信Pidkuiko & Starkov 2025; Zheng et al. 2025(论文引)探索深层协作C2C 给出通用、可规模化的实现与系统评测

定位结论:C2C 不是又一个缓存加速技巧,而是把**KV-Cache 从"计算副产品"提升为"模型间通信介质"**的新范式主张——DroidSpeak 复用 cache 是为了省算力(同构前提),C2C 融合 cache 是为了传语义(异构支持)。

三、问题定义

具体问题:Receiver 模型回答问题时缺某类理解/知识(如小模型不懂 HTML 结构),Sharer 模型有。如何把 Sharer 的理解传给 Receiver,而不经过文本?

核心洞察(类比):T2T 像两个人只能通过"写便条"协作——专家把满脑子的直觉写成一段话,新手再读话重建直觉,两头都失真。C2C 是"直接拷贝一段脑区激活":共享的不是结论的描述,而是加工过程本身。

形式化:给定 Sharer cache C_S(X) 与 Receiver cache C_n(X)(第 n 层),求融合 cache C_F,n = C_n(X) + F_n(C_n(X), C_S,G(n)(X)) 其中 F_n 是待训练的 fuser,G 是层映射。解码时 Receiver 基于融合 cache 生成回答。约束:两个 LLM 全部冻结,只训 Fuser。

精妙之处:残差式设计(C_n + F_n(…))保证 fuser 只能"增强"不能"覆盖"——消融显示纯投影替换会把准确率打到 20.7%,残差融合拉回 44.88%,再加门控到 47.95%。

四、问题解法

4.1 Oracle 实验先行(设计由证据驱动)

  • 富化 oracle:few-shot 的收益到底来自"多了可注意的 token"还是"示例富化了问题的嵌入"?实验:prefill 示例+问题后丢弃示例段 cache 只留问题对齐切片(长度不变)——准确率 58.42%→62.34%,证明 cache 语义质量可独立于长度提升。
  • 层选择性:给不同层做富化,top-5 层富化优于全层富化,选最差层反而降分——这直接催生了后面的逐层门控。
  • 可转换性 oracle:3 层 MLP 把 Qwen3-4B 的 cache 映射进 Qwen3-0.6B 空间,t-SNE 显示映射后落入目标空间(但只覆盖子集——各模型理解本就不完全重叠,恰好说明互补性)。

4.2 Fuser 结构(三模块)

  1. 投影模块:拼接两模型 cache → 投影层 → 特征融合层
  2. 动态加权:输入感知的头部调制,逐样本重加权
  3. 可学习门控:每层一个标量门,Gumbel-sigmoid + 温度退火——训练时可微、推理时二值化,自动决定"哪些层值得注入"

4.3 双重对齐

  • token 对齐:不同 tokenizer 切分不同——把 Receiver token 解码回字符串再用 Sharer tokenizer 重编码,一对多时选字符串覆盖最大的
  • 层对齐:终端对齐策略——从双方最后一层对齐起,倒数第二层次之,直到浅模型第一层

4.4 训练

冻结双模型,Receiver 以融合 cache 为条件做标准 next-token 预测(类 SFT),梯度只穿过 C2C 模块。主实验用 OpenHermes2.5 前 50 万样本训练。

五、评估指标与实验证据

设置:Receiver 固定 Qwen3-0.6B,三个 Sharer(Qwen2.5-0.5B / Llama3.2-1B / Qwen3-4B-Base);四基准 MMLU-Redux / OpenBookQA / ARC-C / C-Eval;零样本、贪心解码;A100 单卡批 1。Baseline:Receiver-only、Sharer-only、查询级路由、T2T。

实验关键数值说明
主表(三 Sharer 平均)Receiver 提升 +11.00 / +9.64 / +11.88 点;比 T2T 高 +5.36 / +4.15 / +3.06 点12/12 任务-基准格全胜 T2T
效率比 T2T 加速 3.46× / 1.51× / 14.41×;平均 2.5×T2T 的 Sharer 解码 80 token 花 1312ms;C2C 并行融合仅 90ms
Base 模型 SharerQwen3-4B-Base 单独跑仅 1-5 分(不会跟指令),经 C2C 后 Receiver 达 43.95/53.20/55.39/42.79弱指令 Receiver 借用强 base 模型知识——base 模型无法跟指令也能当 Sharer,T2T 完全做不到
长文本LongBenchV1 三个长度段(0-4k/4-8k/8k+)C2C 全面超 T2T 与单模型收益不随长度消失
尺寸缩放Sharer 越大 C2C 增益涨得比 T2T 快Sharer 知识越富,cache 传输越划算
异构组合Gemma3/Math/Coder Sharer 五组合 C2C 平均超 T2T 8.59 点跨家族(Qwen+Gemma)、跨专长均有效
角色互换互换后 C2C 仍 +5.05,T2T 反而 −6.30方向鲁棒
消融:增益来源Single 596M 参数 36.81(MMLU)< Identical 529M 42.17 < C2C 478M 42.92排除"多训了参数"与"同模型自通信"两种解释——异构互补才是主因;且 C2C 参数最少
消融:fuser 组件纯投影 20.70 → +残差融合 44.88(+24.18)→ +门控 47.95(+3.07)残差原则与层选择各自贡献巨大
有效秩分析K cache 秩 388→395、V 532→560融合确实丰富了 Receiver 的语义空间(秩上升=信息注入)

实验设计为何有证明力:Single/Identical/C2C 三臂消融把"参数量、同构自通信、异构互补"三个混淆一次拆开;T2T 的 prompt 公开于附录保证对比公平;互换实验排除方向性运气。

六、效果优势的根源解释

6.1 因果链

  1. T2T 的信息损失是结构性的(论文 oracle 支持 + DroidSpeak 先例):文本是 10⁵ 词表上的一维序列,模型内部 d≈896-2560 维的分布式表征必须有损压缩。Coder-Writer 例子中 <p> 的结构语义在文本化时彻底蒸发。
  2. cache 融合保住了高维语义(论文实验支持):有效秩上升(388→395 / 532→560)说明 Sharer 的表征方向被真实注入而非平均掉;准确率增益随 Sharer 增大而扩大(缩放实验)——注入的是知识而不只是噪声。
  3. 互补性是增益的真正来源(消融证明):Identical(同模型自通信)只从 36.81→42.17,异构 C2C 再到 42.92 且参数更少——不同模型对同一输入的正确答案集合只有部分重叠(论文 Figure 7),异构差异=可收割的互补理解。
  4. 延迟优势来自并行的物理事实:token 解码是串行的(每步依赖前一步),cache 融合是一次矩阵乘——1312ms vs 90ms 不是优化差距而是范式差距。(与 Skeleton-of-Thought 的"并行化解码"同源洞察,方向不同:SoT 并行化单模型生成,C2C 消除协作通信的解码)

6.2 外部检索与对照

研究相似尝试/相关结论与本文关系
DroidSpeak (arXiv:2411.02820, UChicago+微软)同基座微调模型间选择性复用 KV,4× 吞吐前提限定:要求同架构,方向是省算力;C2C 放宽到跨家族并把目标从效率改为质量——两者共同证明"KV 跨模型可迁移"这个物理基础
Skeleton-of-Thought (Ning et al., ICLR 2024)分解提示并行生成子段同构结论:串行解码是延迟主因,绕过即加速;但 SoT 仍在文本层,C2C 下探到表征层
Cartridges (Eyuboglu et al. 2025)自学习生成轻量 KV"墨盒"复用长上下文互补邻居:单模型内把上下文固化成可复用 cache;与 C2C 组合可想象"跨模型墨盒"
论文自引 Pidkuiko & Starkov 2025潜空间直接共享的早期探索研究脉络的直接前驱,C2C 提供了系统化、异构化的实现
未发现未见 O(N) 训练成本下多模型(>2)cache 互通的工作论文自认 scale 到 N 模型是 open problem——当前边界在 pairwise

6.3 综合判断与未决问题

  • 多研究共同支持:KV-Cache 跨模型可迁移且有价值(DroidSpeak+C2C 双源);串行解码是协作延迟的结构性瓶颈(SoT+C2C)。
  • 本文独有证据:异构互补>同构自通信的因果分离(Identical 消融);层选择性富化的因果(top-5 层>全层)。
  • 仍属推测/边界:弱 Sharer 会注入噪声拖累强 Receiver(论文自认 T2T 同病);任务局限于 QA 类四基准,多轮 Agent 工具调用场景只有附录数学案例研究;训练成本 O(N²)(每对模型训一个 fuser);隐私收益(不暴露明文)只有方向性讨论未实验。

七、必要知识反推

  • Transformer 推理机制层:prefill/decode 两阶段、KV-Cache 的形状与语义(每层每 token 的 K/V)、为什么解码必须串行——不懂这些无法把 cache 当通信介质。
  • 表征几何层:t-SNE 可视化、有效秩(Roy & Vetterli 2007)、表示空间子集覆盖的解读——oracle 实验的推断全靠这些工具。
  • 训练工程层:冻结主干只训 adapter 的范式、Gumbel-sigmoid 温度退火(可微→二值)、SFT 式 next-token 监督——fuser 的可实现性依赖这些技术。
  • 多 LLM 系统层:MoA/Debate/路由的通信拓扑、MCP/A2A 协议的文本模板局限——知道旧范式的失真点才能定位新范式的卖点。
  • 知识融合关键节点:① “丢弃示例段 cache"的 oracle 设计——用一个删除实验分离了"上下文长度"与"表征富度"两个变量;② 残差原则的坚持——纯投影 20.7 分的血案反向证明了"增强而非覆盖”;③ token 重编码对齐——解决异构 tokenizer 这一别人绕开的脏活。

八、论文中可以提取的通用性灵感

  1. 核心思想:两个智能体协作时,传输"加工过程"(中间表征)比传输"结论描述"(输出文本)信息保真度更高、速度更快。

    • 论文证据:C2C 比 T2T 平均 +3.1-5.4% 且 2.5× 加速;有效秩与互补答案集分析。
    • 推广场景:多 Agent 系统传递结构化工作记忆而非聊天记录;模型级联中传 logits/嵌入而非文本;人机协作中共享思维导图而非成文报告。
  2. 核心思想:一个对象的"副产品"(KV-Cache 本为省计算而生)可能在另一个问题域里是主产品(通信介质)。

    • 论文证据:cache 同时满足高维、语义密、推理时免费存在三个通信介质理想属性。
    • 推广场景:把编译中间码用于跨语言迁移;把日志副产品用于异常检测;把注意力图用于可解释性。
  3. 核心思想:注入式增强要遵守残差原则——加法门控而非整体替换,让系统能保留自身已有能力。

    • 论文证据:纯投影替换 20.70 分 vs 残差融合 44.88 分,24 分差距是全文最大的单一消融效应。
    • 推广场景:Adapter/LoRA 设计;机器人学中叠加先验而非覆盖策略;RAG 系统拼接而非替换用户上下文。
  4. 核心思想:融合收益要能追溯到"互补性",用同构对照排除"参数变多/训练变多"的平凡解释。

    • 论文证据:Single/Identical/C2C 三臂消融,C2C 参数最少分最高。
    • 推广场景:集成学习证明多样性价值;多源数据融合的增益归因;团队协作中"互补技能"的量化验证。
  5. 核心思想:异构双模(base 模型有知识无指令跟随、instruct 模型有跟随无知识)可以通过表征层管道互补。

    • 论文证据:Qwen3-4B-Base 单独跑 1-5 分,经 C2C 让 0.6B Receiver 达 53+(OpenBookQA)。
    • 推广场景:让小 instruct 模型调用大 base 模型的领域知识;专家系统与 LLM 的表征层桥接;低成本蒸馏新范式(不用生成文本教师样本)。