论文一链接:Mo’ Models, Mo’ Problems: How to best select model pools when designing Multi-Agent Systems 论文二链接:Co-Skill: A Collaborative Communication Framework for Skill Evolution 发表时间:2026年9月 机构一:University of Copenhagen + NVIDIA(高校+企业实习合作);机构二:Harbin Institute of Technology, Shenzhen 领域标签:cs.MA / cs.AI

一、论文背景

共享背景:多 agent 系统从"能不能协作"进入"怎么协作得好"。MAS 两大主流形态:before-generation(路由器选模型再答)与 after-generation(多模型各答再聚合:投票/裁判)。两个工程瓶颈浮现——

瓶颈一(Mo’ Models):HuggingFace 已有近 300 万模型(两个月新增 15 万+),MAS 该选哪些模型进池?直觉说"多多益善、越杂越好",经典集成学习也讲多样性——但对 LLM MAS 成立吗?

瓶颈二(Co-Skill):成本高效的混合演化范式(云端大模型生成 skill、边缘小模型执行内化)已有 SkillRL 等实现,但成功率低、token 高——病根在哪?

二、论文定位和关联工作

研究脉络代表工作核心思想与两文关键区别
MAS 路由RouteLLM、AvengersPro查询→模型映射Mo’ Models:路由器的候选池本身怎么选
MAS 聚合majority voting、GenSelect多答合一Mo’ Models:聚合对异构弱成员的鲁棒性审计
异构 MASDeePEn、LLM-Blender异构组合尝试结果不稳定,无系统选型研究
skill 演化SkillRL、Skill0云生成/边内化Co-Skill:双向感知通信结构
边云协同边缘 RL 系工作边缘侧优化Co-Skill:通信内容结构化

定位结论:两文分别卡住 MAS 的入口(选谁)与通道(怎么说话)——Mo’ Models 首次系统研究模型池选择;Co-Skill 首次把边云 skill 演化的通信做结构化。

三、问题定义

Mo’ Models:给定模型空间 M(百万级),如何选子集 C⊂M 使 MAS(路由/投票/裁判三种架构)实际性能最优?核心张力:oracle(理想上界)随池扩大单调升,实际性能为何不跟?

Co-Skill:云端 LLM 分析边缘 SLM 轨迹生成 skill、边缘执行内化——“盲通信”(云端不知边缘能做什么、边缘不知云端要什么)如何消除?核心张力:上传原始轨迹 token 冗余 25-42%、下行指令超出边缘执行粒度。

合读抽象:多 agent 协作的收益取决于成员间信息结构——Mo’ Models 证明"成员能力分布"决定聚合能否放大(嵌套解集下加噪声成员是纯减分);Co-Skill 证明"通信编码"决定协作成本(结构化 trie/树 vs 平面文本)。

四、问题解法

Mo’ Models:八策略×两架构的 oracle-achieved 对照

23 模型(6 族、2B-1.6T、4 个科学专用)×8 选择策略(大小/家族/LLM 挑选/准确率/IoU 正确答案多样性/误差多样性/准确率×多样性组合)在 HLE/GPQA/Frontier Science 上:先测 oracle(池内任一模型答对即算对的 pass@1 上界),再测实际三种 MAS(AvengersPro 式路由 / E5 聚类 majority vote / GenSelect 式锦标赛 LLM judge),ΔMAS Gain=相对池内最佳单模型的增益。

Co-Skill:双向感知三件套

(1) 云感知前缀合并轨迹 trie:边缘把轨迹按共享前缀合并成 trie、标出分叉点——云端沿树对比成功/失败路径即定位"哪个行为差异导致分叉"(对比学习),上传 token 大减;(2) 边缘感知渐进 skill 树:云端不一次下发全量 skill,而是按边缘能力逐层展开(L0→L5),每层观察边缘稳定后再加深;(3) 分离式演化:云端演化 skill 上下文+温度制库管理(Idle→Active→Resident),边缘可选 GRPO RL+自顶向下剪枝把 skill 内化进参数。云端 DeepSeek-V4-Pro,边缘 Qwen3-4B-Thinking。

五、评估指标与实验证据

论文发现关键数字证明什么
Mo’ Modelsoracle-achieved 鸿沟扩池几乎总使实际性能低于最佳单模型“多多益善"被证伪
Mo’ Models同族唯一稳定同家族池是唯一稳定正收益策略(Gemma4/OLMo3 偶有真提升)聚合需要行为兼容性
Mo’ Models解集嵌套准确模型正确答案 Mantel rM=0.931、误差仅 0.384正确趋同/错误分散→投票失稳
Mo’ Modelsspecialist 神话破灭物理/化学微调模型不优于通用底座(同底座对照)训练数据主导≠域增益
Mo’ Models同构对照同构 MAS 随复杂度/成员数单调升(majority@5 29.4→32.2、judge@5 36.5)现成架构为同构设计
Co-Skilltoken 冗余实证raw 轨迹 25.0-41.8% token 是重复前缀盲上传的浪费可量化
Co-Skill总收益token 较 SOTA 省 15.6-41.9%、成功率 +25.8-76.4%结构化通信双向有效
Co-Skill复杂任务优势Clean/Cool 任务云方案退化 45%/35% 时 Co-Skill 达 88.9-90.5%渐进树匹配边缘能力

证明力分析:Mo’ Models 最强的设计是"oracle-实际"双轨——单看 oracle 会以为 Accuracy×多样性组合前景最好(上界高),实际跑出来反而低于随机池——鸿沟本身是发现。rM=0.931/0.384 的不对称是机制解释的关键证据:正确答案趋同使多数票的"多数"无信息、错误分散使错误答案互不相同——聚合机制在此分布下天然失效。Co-Skill 的trie 效率图(每任务 token/USD 绝对值标注)与渐进树分级实验(L0-L5 各级边缘成功率)把"结构化为什么省"落到可检验的中间量上。

六、效果优势的根源解释

根源机制与证据链(Mo’ Models)

  1. 高准确模型的解集嵌套使多样性池无红利(论文实验已支持):准确者都对同批题、错误者各错各的——投票时正确票型分散度低于错误票型的现象不存在,“少数服从多数"反而可能被系统性带偏;LLM judge 对弱成员答案的甄别也不可靠(多数意图子集低于随机池)。机制链:能力同质化→解集嵌套→加异构成员=加噪声成员→聚合输出质量下滑。
  2. 同族正收益的机制是"行为兼容性”(论文实验已支持):同族模型错误模式相似(聚类证据),聚合时弱成员的错误至少与强成员相关——可被投票纠正;跨族错误正交分散,反而稀释正确票。
  3. 能力-选型脱节:specialist 的域增益未兑现(论文实验已支持):微调数据主导不转化为域内正确答案多样性——选型不能看 model card 叙事,必须实测。

根源机制与证据链(Co-Skill)

  1. 前缀 trie 把"找差异"从文本 sift 变成树对比(论文实验已支持):失败原因在轨迹分叉点——trie 结构让云端 O(分叉) 而非 O(全文) 定位,25-42% 冗余前缀不再上传。
  2. 渐进树让指令粒度匹配执行能力(论文实验已支持):一次性下发全量 skill 时边缘"消化不了”(brittle execution);逐层展开在边缘成功率稳定处停住——L0-L5 分级实验直接显示"稳定/不稳定/过拟合"三区。
  3. 分离演化尊重能力不对称(论文设计+消融支持):云端适合反思与抽象(不宜 RL——太贵)、边缘适合 RL 内化(缺推理容量)——各做擅长的。

相关工作检索与对照

研究相似尝试相关结论与本文差异影响
DeePEn(2404.01522)异构 MAS 聚合非单调改进单架构小规模支持:异构不稳定有先例
LLM-Blender(2306.02561)多模型融合跨数据集不稳融合器视角支持:聚合鲁棒性问题真实
经典集成理论(Dietterhoff 2000 综述线)误差多样性→收益需 error diversity传统 ML对照:LLM 的正确答案趋同破坏前提
SkillRL(Co-Skill 引用)平面 skill 库云更新混合演化可行盲通信对照:Co-Skill 的直接基线
Skill0(2603 系)边缘 RL+固定 skill边缘内化可行无云端分析支持:分离演化的边缘侧
Mixture-of-Agents(2406.04692)同构 MoA 层级同构多样有效同构为主支持:同构收益与本文同构对照一致

相反结论检索:存在主张"异构多样性提升 MAS"的工作(如 MoA 部分设置、Yang et al. 2026 防饱和论)——本文如实呈现张力并给出适用条件拆解:多样性在同构(提示/实例级)下有效、在异构跨族下于其基准上失效;任务域(科学推理)与聚合架构(简单三式)是边界条件,非普适否定。

综合判断与未决问题

多研究共同支持:异构 MAS 不稳定(DeePEn/LLM-Blender+Mo’ Models);同构多样性有效(MoA+本文同构对照);结构化通信优于平面文本(Co-Skill vs SkillRL)。仍属推测:更聪明聚合器(学习式融合/校准加权)能否救活异构池——本文只测三种简单架构;Co-Skill 的树结构在开放域(非 ALFWorld/WebShop 类任务)的可扩展性。适用边界:Mo’ Models 限科学推理三基准+简单聚合;Co-Skill 限两个交互基准+特定云边模型对。失效条件:成员能力代差极大(一个前沿+若干玩具)时聚合可能退化为"选最好"——此时路由(before-generation)优于聚合,与本文路由结果一致。

七、必要知识反推

领域知识层:MAS 架构分类(路由/投票/裁判的能力与失效面);HuggingFace 模型生态的实际构成(族系/规模/专用变体分布)——选型研究的池设计要反映真实选择空间;边云协同的约束(带宽、边缘算力、延迟)。

方法论知识层:oracle-actual 双轨评估(上界与达成的分离);Mantel 检验/Spearman 相关的距离矩阵分析;逐层能力探测(渐进树的 L0-L5 稳定性判据);对比学习直觉(分叉点=因果行为差异)。

工程知识层:轨迹压缩的 trie 数据结构实现;RocksDB skill 库与温度制生命周期管理;verl 框架的 GRPO 边缘训练。

知识融合关键节点:Mo’ Models 的枢纽是把经典集成学习的理论前提(误差多样性)拿来逐条审计 LLM 场景是否满足——发现"正确答案趋同"这个前提破坏点,需要同时懂集成理论(知道前提是什么)与 LLM 评测(能量化趋同度)。Co-Skill 的枢纽是"通信的信息论视角"——把协作双方当作信源信宿,问"信道上传的是什么、该传什么"。

八、通用性灵感

  1. 加成员前先测解集分布:如果潜在成员对同一批问题的答案高度趋同,加入他们只增加聚合噪声——选型看"错误模式相似度"而非"能力分数"(论文证据:rM=0.931/0.384 不对称)。推广: committees(观点趋同的专家团没有集体智慧)、投资组合(相关性高的资产加仓不分散风险)、多源信息验证(转载链不算独立信源)。
  2. “多多益善"在聚合系统里是可证伪假设:oracle 上界单调升而实际达成下降——上界与达成的鸿沟要同时报(论文证据:oracle-actual 双轨设计)。推广:人才招聘(候选人池越大录取质量未必越高——筛选机制承载不了)、并行计算(核数超过任务可分性后通信开销反噬)。
  3. 专家承诺要实测兑现:微调数据主导不等于域内增益——“物理专家模型"在物理题上未必胜过通才(论文证据:specialist 对照实验)。推广:资历≠绩效(头衔承诺需行为证据)、专业软件未必优于通用工具的特定场景。
  4. 通信要按接收方能力分层编码:一次性发全量信息对方消化不了时,渐进式披露(按稳定判据逐层加深)优于全量灌输(论文证据:渐进树 L0-L5 三区实验)。推广:教育(因材施教的分层教材)、API 设计(渐进式文档 onboarding)、医患沟通(按理解力分层告知病情)。
  5. 差异定位在"分叉点”:把轨迹存成树,比较成本从 O(n) 降到 O(分叉):成功与失败的差异藏在分叉处——前缀合并让"找不同"变成树对比(论文证据:25-42% 前缀冗余消除)。推广:debug(diff 而非全文 review)、A/B 测试(找行为分岔的变量)、版本控制(增量提交的意义)。