论文一链接:Mo’ Models, Mo’ Problems: How to best select model pools when designing Multi-Agent Systems 论文二链接:Co-Skill: A Collaborative Communication Framework for Skill Evolution 发表时间:2026年9月 机构一:University of Copenhagen + NVIDIA(高校+企业实习合作);机构二:Harbin Institute of Technology, Shenzhen 领域标签:cs.MA / cs.AI
一、论文背景
共享背景:多 agent 系统从"能不能协作"进入"怎么协作得好"。MAS 两大主流形态:before-generation(路由器选模型再答)与 after-generation(多模型各答再聚合:投票/裁判)。两个工程瓶颈浮现——
瓶颈一(Mo’ Models):HuggingFace 已有近 300 万模型(两个月新增 15 万+),MAS 该选哪些模型进池?直觉说"多多益善、越杂越好",经典集成学习也讲多样性——但对 LLM MAS 成立吗?
瓶颈二(Co-Skill):成本高效的混合演化范式(云端大模型生成 skill、边缘小模型执行内化)已有 SkillRL 等实现,但成功率低、token 高——病根在哪?
二、论文定位和关联工作
| 研究脉络 | 代表工作 | 核心思想 | 与两文关键区别 |
|---|---|---|---|
| MAS 路由 | RouteLLM、AvengersPro | 查询→模型映射 | Mo’ Models:路由器的候选池本身怎么选 |
| MAS 聚合 | majority voting、GenSelect | 多答合一 | Mo’ Models:聚合对异构弱成员的鲁棒性审计 |
| 异构 MAS | DeePEn、LLM-Blender | 异构组合尝试 | 结果不稳定,无系统选型研究 |
| skill 演化 | SkillRL、Skill0 | 云生成/边内化 | Co-Skill:双向感知通信结构 |
| 边云协同 | 边缘 RL 系工作 | 边缘侧优化 | Co-Skill:通信内容结构化 |
定位结论:两文分别卡住 MAS 的入口(选谁)与通道(怎么说话)——Mo’ Models 首次系统研究模型池选择;Co-Skill 首次把边云 skill 演化的通信做结构化。
三、问题定义
Mo’ Models:给定模型空间 M(百万级),如何选子集 C⊂M 使 MAS(路由/投票/裁判三种架构)实际性能最优?核心张力:oracle(理想上界)随池扩大单调升,实际性能为何不跟?
Co-Skill:云端 LLM 分析边缘 SLM 轨迹生成 skill、边缘执行内化——“盲通信”(云端不知边缘能做什么、边缘不知云端要什么)如何消除?核心张力:上传原始轨迹 token 冗余 25-42%、下行指令超出边缘执行粒度。
合读抽象:多 agent 协作的收益取决于成员间信息结构——Mo’ Models 证明"成员能力分布"决定聚合能否放大(嵌套解集下加噪声成员是纯减分);Co-Skill 证明"通信编码"决定协作成本(结构化 trie/树 vs 平面文本)。
四、问题解法
Mo’ Models:八策略×两架构的 oracle-achieved 对照
23 模型(6 族、2B-1.6T、4 个科学专用)×8 选择策略(大小/家族/LLM 挑选/准确率/IoU 正确答案多样性/误差多样性/准确率×多样性组合)在 HLE/GPQA/Frontier Science 上:先测 oracle(池内任一模型答对即算对的 pass@1 上界),再测实际三种 MAS(AvengersPro 式路由 / E5 聚类 majority vote / GenSelect 式锦标赛 LLM judge),ΔMAS Gain=相对池内最佳单模型的增益。
Co-Skill:双向感知三件套
(1) 云感知前缀合并轨迹 trie:边缘把轨迹按共享前缀合并成 trie、标出分叉点——云端沿树对比成功/失败路径即定位"哪个行为差异导致分叉"(对比学习),上传 token 大减;(2) 边缘感知渐进 skill 树:云端不一次下发全量 skill,而是按边缘能力逐层展开(L0→L5),每层观察边缘稳定后再加深;(3) 分离式演化:云端演化 skill 上下文+温度制库管理(Idle→Active→Resident),边缘可选 GRPO RL+自顶向下剪枝把 skill 内化进参数。云端 DeepSeek-V4-Pro,边缘 Qwen3-4B-Thinking。
五、评估指标与实验证据
| 论文 | 发现 | 关键数字 | 证明什么 |
|---|---|---|---|
| Mo’ Models | oracle-achieved 鸿沟 | 扩池几乎总使实际性能低于最佳单模型 | “多多益善"被证伪 |
| Mo’ Models | 同族唯一稳定 | 同家族池是唯一稳定正收益策略(Gemma4/OLMo3 偶有真提升) | 聚合需要行为兼容性 |
| Mo’ Models | 解集嵌套 | 准确模型正确答案 Mantel rM=0.931、误差仅 0.384 | 正确趋同/错误分散→投票失稳 |
| Mo’ Models | specialist 神话破灭 | 物理/化学微调模型不优于通用底座(同底座对照) | 训练数据主导≠域增益 |
| Mo’ Models | 同构对照 | 同构 MAS 随复杂度/成员数单调升(majority@5 29.4→32.2、judge@5 36.5) | 现成架构为同构设计 |
| Co-Skill | token 冗余实证 | raw 轨迹 25.0-41.8% token 是重复前缀 | 盲上传的浪费可量化 |
| Co-Skill | 总收益 | token 较 SOTA 省 15.6-41.9%、成功率 +25.8-76.4% | 结构化通信双向有效 |
| Co-Skill | 复杂任务优势 | Clean/Cool 任务云方案退化 45%/35% 时 Co-Skill 达 88.9-90.5% | 渐进树匹配边缘能力 |
证明力分析:Mo’ Models 最强的设计是"oracle-实际"双轨——单看 oracle 会以为 Accuracy×多样性组合前景最好(上界高),实际跑出来反而低于随机池——鸿沟本身是发现。rM=0.931/0.384 的不对称是机制解释的关键证据:正确答案趋同使多数票的"多数"无信息、错误分散使错误答案互不相同——聚合机制在此分布下天然失效。Co-Skill 的trie 效率图(每任务 token/USD 绝对值标注)与渐进树分级实验(L0-L5 各级边缘成功率)把"结构化为什么省"落到可检验的中间量上。
六、效果优势的根源解释
根源机制与证据链(Mo’ Models)
- 高准确模型的解集嵌套使多样性池无红利(论文实验已支持):准确者都对同批题、错误者各错各的——投票时正确票型分散度低于错误票型的现象不存在,“少数服从多数"反而可能被系统性带偏;LLM judge 对弱成员答案的甄别也不可靠(多数意图子集低于随机池)。机制链:能力同质化→解集嵌套→加异构成员=加噪声成员→聚合输出质量下滑。
- 同族正收益的机制是"行为兼容性”(论文实验已支持):同族模型错误模式相似(聚类证据),聚合时弱成员的错误至少与强成员相关——可被投票纠正;跨族错误正交分散,反而稀释正确票。
- 能力-选型脱节:specialist 的域增益未兑现(论文实验已支持):微调数据主导不转化为域内正确答案多样性——选型不能看 model card 叙事,必须实测。
根源机制与证据链(Co-Skill)
- 前缀 trie 把"找差异"从文本 sift 变成树对比(论文实验已支持):失败原因在轨迹分叉点——trie 结构让云端 O(分叉) 而非 O(全文) 定位,25-42% 冗余前缀不再上传。
- 渐进树让指令粒度匹配执行能力(论文实验已支持):一次性下发全量 skill 时边缘"消化不了”(brittle execution);逐层展开在边缘成功率稳定处停住——L0-L5 分级实验直接显示"稳定/不稳定/过拟合"三区。
- 分离演化尊重能力不对称(论文设计+消融支持):云端适合反思与抽象(不宜 RL——太贵)、边缘适合 RL 内化(缺推理容量)——各做擅长的。
相关工作检索与对照
| 研究 | 相似尝试 | 相关结论 | 与本文差异 | 影响 |
|---|---|---|---|---|
| DeePEn(2404.01522) | 异构 MAS 聚合 | 非单调改进 | 单架构小规模 | 支持:异构不稳定有先例 |
| LLM-Blender(2306.02561) | 多模型融合 | 跨数据集不稳 | 融合器视角 | 支持:聚合鲁棒性问题真实 |
| 经典集成理论(Dietterhoff 2000 综述线) | 误差多样性→收益 | 需 error diversity | 传统 ML | 对照:LLM 的正确答案趋同破坏前提 |
| SkillRL(Co-Skill 引用) | 平面 skill 库云更新 | 混合演化可行 | 盲通信 | 对照:Co-Skill 的直接基线 |
| Skill0(2603 系) | 边缘 RL+固定 skill | 边缘内化可行 | 无云端分析 | 支持:分离演化的边缘侧 |
| Mixture-of-Agents(2406.04692) | 同构 MoA 层级 | 同构多样有效 | 同构为主 | 支持:同构收益与本文同构对照一致 |
相反结论检索:存在主张"异构多样性提升 MAS"的工作(如 MoA 部分设置、Yang et al. 2026 防饱和论)——本文如实呈现张力并给出适用条件拆解:多样性在同构(提示/实例级)下有效、在异构跨族下于其基准上失效;任务域(科学推理)与聚合架构(简单三式)是边界条件,非普适否定。
综合判断与未决问题
多研究共同支持:异构 MAS 不稳定(DeePEn/LLM-Blender+Mo’ Models);同构多样性有效(MoA+本文同构对照);结构化通信优于平面文本(Co-Skill vs SkillRL)。仍属推测:更聪明聚合器(学习式融合/校准加权)能否救活异构池——本文只测三种简单架构;Co-Skill 的树结构在开放域(非 ALFWorld/WebShop 类任务)的可扩展性。适用边界:Mo’ Models 限科学推理三基准+简单聚合;Co-Skill 限两个交互基准+特定云边模型对。失效条件:成员能力代差极大(一个前沿+若干玩具)时聚合可能退化为"选最好"——此时路由(before-generation)优于聚合,与本文路由结果一致。
七、必要知识反推
领域知识层:MAS 架构分类(路由/投票/裁判的能力与失效面);HuggingFace 模型生态的实际构成(族系/规模/专用变体分布)——选型研究的池设计要反映真实选择空间;边云协同的约束(带宽、边缘算力、延迟)。
方法论知识层:oracle-actual 双轨评估(上界与达成的分离);Mantel 检验/Spearman 相关的距离矩阵分析;逐层能力探测(渐进树的 L0-L5 稳定性判据);对比学习直觉(分叉点=因果行为差异)。
工程知识层:轨迹压缩的 trie 数据结构实现;RocksDB skill 库与温度制生命周期管理;verl 框架的 GRPO 边缘训练。
知识融合关键节点:Mo’ Models 的枢纽是把经典集成学习的理论前提(误差多样性)拿来逐条审计 LLM 场景是否满足——发现"正确答案趋同"这个前提破坏点,需要同时懂集成理论(知道前提是什么)与 LLM 评测(能量化趋同度)。Co-Skill 的枢纽是"通信的信息论视角"——把协作双方当作信源信宿,问"信道上传的是什么、该传什么"。
八、通用性灵感
- 加成员前先测解集分布:如果潜在成员对同一批问题的答案高度趋同,加入他们只增加聚合噪声——选型看"错误模式相似度"而非"能力分数"(论文证据:rM=0.931/0.384 不对称)。推广: committees(观点趋同的专家团没有集体智慧)、投资组合(相关性高的资产加仓不分散风险)、多源信息验证(转载链不算独立信源)。
- “多多益善"在聚合系统里是可证伪假设:oracle 上界单调升而实际达成下降——上界与达成的鸿沟要同时报(论文证据:oracle-actual 双轨设计)。推广:人才招聘(候选人池越大录取质量未必越高——筛选机制承载不了)、并行计算(核数超过任务可分性后通信开销反噬)。
- 专家承诺要实测兑现:微调数据主导不等于域内增益——“物理专家模型"在物理题上未必胜过通才(论文证据:specialist 对照实验)。推广:资历≠绩效(头衔承诺需行为证据)、专业软件未必优于通用工具的特定场景。
- 通信要按接收方能力分层编码:一次性发全量信息对方消化不了时,渐进式披露(按稳定判据逐层加深)优于全量灌输(论文证据:渐进树 L0-L5 三区实验)。推广:教育(因材施教的分层教材)、API 设计(渐进式文档 onboarding)、医患沟通(按理解力分层告知病情)。
- 差异定位在"分叉点”:把轨迹存成树,比较成本从 O(n) 降到 O(分叉):成功与失败的差异藏在分叉处——前缀合并让"找不同"变成树对比(论文证据:25-42% 前缀冗余消除)。推广:debug(diff 而非全文 review)、A/B 测试(找行为分岔的变量)、版本控制(增量提交的意义)。