论文链接:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning 模型仓库:internlm/Intern-S2-Mobius (HuggingFace) 发表时间:2026年8月14日 机构:Shanghai AI Laboratory(Intern-S2团队,Kai Chen、Dahua Lin、Ning Ding等) 领域标签:cs.AI / 大模型架构
一、论文背景
Transformer的隐性分工。在Transformer中,FFN(前馈网络)与Self-Attention实际承担着不同角色:研究已反复验证FFN本质上是Key-Value知识向量池——Key匹配输入模式、Value存储关联知识;Self-Attention则负责组合推理——在token间建立关系。但这个分工被"逐层绑定"锁死了:第L层的Attention只能处理第L-1层FFN产出的知识,残差连接虽提供跨层通道,却是单向的——只有浅层隐状态能"看到"深层知识(前向传播的天然方向),深层的推理算子永远无法回头访问浅层知识库里没被激活的内容。
CoT是对单向性的补偿。当关键知识在浅层没被激活时,模型无法直接产出高信息密度的token,只能生成一个低信息token(比如"让我们看看…"),下一轮前向传播时用这个新token去激活更多知识——这就是链式思考(CoT)的机制本质。代价是双重的:推理链越长生成成本非线性增长;且模型倾向于"试错-修正"的冗长模式,简单问题也写长答案。领域内已有两条改进路线:一是连续思维(如Meta的COCONUT,把最终隐状态直接反馈为下一步输入嵌入,不解码为语言);二是循环语言模型(如Universal Transformer及后续,重复应用共享计算块增加有效深度)。Sapient的层级推理模型HRM是这两条路线的代表成果——用大小两个循环层级实现自适应深度,小模型规模即在ARC等推理基准表现突出。
瓶颈的双重性。论文开篇点出当前两条主流路线都到顶了:堆数据和参数的Scaling Law边际收益递减;牺牲能力换效率的线性注意力"没有真正便宜到可商用"。于是提出第三条路:通过提高架构复杂度来抬高智能上限,从而降低端到端开销——这个反直觉命题(更复杂的架构反而更便宜)是全文的锚点。
二、论文定位和关联工作
Mobius处在"后Transformer架构探索"脉络中,与三条既有线对话:
连续思维线:COCONUT、CODI、SoftCoT等证明连续状态可以承载推理信息而无需解码为语言,但它们只是在标准Transformer上"外挂"少量隐状态。Mobius把这一模式变成原生架构能力——循环状态对着共享Memory精炼、并同时支撑多个未来token。
循环语言模型线:Universal Transformer、recurrent-depth预训练等通过共享块重复增加有效深度、实现测试时算力扩展。Mobius也做隐式循环,但每次更新只经过极少数层(更高循环频率),且始终可访问全量共享知识库。
高效推理线:投机解码(外部草稿器)、简洁CoT(RL压长度)从解码协议和奖励设计下手。论文指出投机解码只遍历一次知识库就出token,而Mobius在内部做多轮知识遍历+多token迭代,在解码前就产生更高信息密度的隐状态。
| 维度 | Transformer+CoT | 线性注意力 | 循环LM(HRM等) | Mobius |
|---|---|---|---|---|
| 知识-推理关系 | 逐层绑定 | 逐层绑定 | 逐层绑定但循环 | 全局解耦共享 |
| 跨层信息流 | 仅前向残差 | 仅前向残差 | 循环但同层重复 | 原生双向访问 |
| 推理媒介 | 离散token串 | 离散token串 | 隐状态+token | 连续隐向量+并行多token |
| 效率来源 | — | 降低单步复杂度 | 深度自适应 | 更少更高质量的token |
三、问题定义
论文的抽象问题可以表述为:知识存储与推理计算解耦后,模型能否用更少的token(更低端到端成本)完成同等甚至更强的组合推理?
形式化地,给定知识容量预算 $K$ 与推理深度预算 $D$,标准架构中两者被逐层耦合为 $\sum_l k_l \cdot d_l$(每层各自的知识×深度),推理只能通过串行token链 $y_1, y_2, ..., y_n$ 逐步激活知识。Mobius将知识重构为全局共享库 $M$,推理算子 $R_1...R_L$ 通过隐状态 $h$ 反复查询 $M$,问题变为:$h$ 经过 $L' \ll L$ 层的多轮迭代后,能否以 $n' \ll n$ 个高密度token表达同等推理结果?
这个抽象的精妙处在于把"效率"重新定义为信息密度问题而非速度问题:端到端加速不是靠每步更快,而是靠每token携带更多信息——需要更少步数。
四、问题解法
核心构造:一个Memory,多个Reasoner。Mobius-v0把所有层的FFN水平拼接成一个全局知识向量库(Memory),Self-Attention作为Reasoner保留在原层位。隐状态兼任缓存与载体:Reasoner反复用隐状态查询Memory取所需知识向量,知识再传回推理算子。大规模时用类MoE的块状划分做稀疏激活,避免全库激活的访存压力。
原生能力一:反向残差连接。因为所有Reasoner共享同一个知识库,深层Reasoner可以检索超出其层级的知识——等价于信息从深到浅的反向流动,而无需构造难以并行化的显式反向计算图。机制意义:关键知识不再受"浅层是否恰好激活"的运气支配。
原生能力二:动态隐推理。Transformer推理一个token需遍历全部层;Mobius在极少数层内对隐向量做多轮精炼迭代(试错、修正、审议都内化为连续向量的优化),只有在深层才并行解码多个token。这是Looped Transformer与扩散语言模型的"升级综合":更高循环频率+多token联合表示,缓解KV-cache管理压力并保持迭代过程的连续可微性。
案例对照(论文Table 2,线性代数多选题):两模型都答对,但Intern-S2-Mobius-35B用516 token完成(任务框架17+反例构造178+定义核对142+选项匹配22+可见答案157),Qwen3.5-35B用2364 token——多出的1147 token全是"重复推导与检查"段。Mobius直接给出反例$\ v_1=(1,0), v_2=(2,0)$,省去了Transformer式的一遍遍试错验证。
五、评估指标与实验证据
指标体系:能力指标(MMLU Pro、GPQA Diamond、IMO Bench、AIME 2026、HMMT 2026等9项通用+3项科学任务)、效率指标(端到端推理加速比、请求吞吐量、平均输出token长度)、数据效率指标(达到同等MMLU所需训练数据比例)。
核心数据表:
| 实验 | 关键数字 | 含义 |
|---|---|---|
| 从零训练数据效率 | 7B MoE(1TB token):Mobius达到Transformer在1TB的MMLU分数只需0.626×数据 | 1.6倍数据效率 |
| 35B能力对比 | MMLU Pro 89.05 vs 85.31;AIME 2026 95.31 vs 92.08;AMO 58.00 vs 50.00;SimpleQA 28.90 vs 21.39;科学任务均值52.14 vs 18.20(Qwen3.5-35B基线) | 持续预训练保能力且增强 |
| 端到端效率 | 近4×加速;吞吐量在MMLU Pro上batch 28时2.9×、GPQA上4.6× | 同参数级更快 |
| 输出压缩 | 输出长度缩短:MMLU Pro 1.5×、GPQA 4.6×、IMO Bench 5.0×、AIME 1.2× | 加速主要来自更短CoT |
| 推理质量 | 五基准平均67.88 vs 65.05(通用) | 更短并未牺牲正确性 |
实验设计为何有证明力:数据效率实验从零训练对照排除了"继承预训练知识"的混淆;35B实验从Qwen3.5-35B-A3B持续预训练——同一初始化、同一数据量,唯一变量是架构切换,因此能力差异(+2.83通用/+33.94科学)与效率差异(4×)可归因于架构本身;逐基准对照的案例表(516 vs 2364 token)提供了"省掉的正是冗余推导"的直接证据,排除了"输出被截断所以短"的解释。
六、效果优势的根源解释
为什么4×加速。因果链:Transformer的token媒介推理有信息密度天花板(离散token是低密度载体)→复杂推理只能靠长链补偿→生成成本随链长非线性增长;Mobius把审议内化为连续向量迭代(可微、无解码开销)→每个解码出的token在解码前已经过多轮知识遍历精炼→同样的推理步骤数被压缩进隐空间→输出token数下降1.2–5倍→端到端延迟与成本随输出长度线性下降。案例表证明压缩的正是"重复推导与检查"段落,即冗余部分。
为什么科学任务暴涨(18.20→52.14)。生物/分子基准需要大量领域知识的组合调用。Transformer中领域知识分散在各层FFN且受单向激活限制;Mobius扁平化全部知识后"更大量知识同时参与交互",跨域组合泛化的概率上升。这与论文"科学发现"一节的论述一致:知识平坦化增加组合泛化可能。
为什么数据效率1.6×。作者假说:Transformer各层参数存在冗余(同一知识多层重复存储);解耦后的共享库去除了这种冗余,同等数据能达到更高压缩率。这个解释目前是假说性质(论文明确标注"remains to be fully explored"),如实指出:数据效率的机制归因尚无直接证据,是本工作开放问题之一。
为什么动态隐推理不是"黑箱化偷懒"。可预见的质疑是:隐空间推理是否只是把可读的思维链藏起来?论文用step对齐比较回答:Mobius的可见输出包含任务框架、反例构造、定义核对、选项匹配的完整结构——推理步骤没有减少,只是每步的表述更紧凑(178 token的反例构造 vs 283+283 token的两轮平行尝试)。这是"压缩冗余"而非"隐藏过程"。
七、必要知识反推
领域知识层:FFN即Key-Value记忆的表征研究结论(不理解这个就想不到"把FFN拼成共享库");残差连接的单向性及其对CoT长度的因果影响(这是问题定义的根基);MoE稀疏激活的工程实现(大规模共享库的可行性方案)。
方法论知识层:持续预训练的对照设计(同一初始化切换架构,隔离架构变量);CoT压缩领域的既有评测协议(输出token长度作为效率代理);HRM/COCONUT/Looped Transformer三条线的技术细节(“升级综合"需要知道综合的是什么)。
工程知识层:推理吞吐评测(batch size扫描下的req/s);共享FFN的访存优化(稀疏激活的块划分);隐向量循环的KV-cache管理。
知识融合的关键节点:最关键的洞察是把"FFN=KV库"的表征结论从分析工具翻转为设计蓝图——既然FFN本来就是知识库,那把多层的库合并成一个全局库并不改变其功能本质,只改变了访问权限的拓扑。这个视角翻转(从"解释模型如何工作"到"规定模型应如何构造”)是全部后续设计的种子。
八、论文中可以提取的通用性灵感
灵感1:解耦存储与计算是提升复用效率的通用杠杆。知识去重(62.6%数据)+推理算子共享访问,与数据库的存算分离、CPU缓存层次、微服务的状态外置同构。论文证据:1.6倍数据效率直接来自消除层间知识冗余。推广场景:企业知识库统一化(各部门重复维护的文档合并为单一事实源);CDN与边缘计算(内容与计算节点的解耦调度);组织设计(专家知识集中沉淀而非散落在各流程)。
灵感2:补偿机制的消除要靠根因修复,而非优化补偿本身。CoT是对单向信息流的补偿,业界大量工作在"让CoT更短",Mobius直接消除单向性这个根因。推广场景:性能优化(消除GC压力优于调优GC参数);流程再造(取消审批环节优于加速审批);缓存策略(修正写放大优于扩容缓存)。
灵感3:把离散中间表示换成连续向量可同时获得压缩与可微性。token→隐向量的转换让"试错-修正"变成可优化过程而非搜索过程。论文证据:5倍输出压缩且科学任务大涨。推广场景:规划系统(连续松弛的任务规划代替离散搜索);机器人控制(隐空间轨迹优化);推荐系统(连续用户态代替离散画像);编译器(连续中间表示的可微代码优化)。
灵感4:访问权限拓扑的改变可以等价于"反向连接"。直接实现反向计算图很昂贵(不可并行),但让所有节点共享同一个库就"免费"获得了双向访问。推广场景:组织信息流(中央知识库让新员工也能引用"资深员工才知道"的经验,无需正式的逆向汇报线);版本控制(monorepo让任何模块看到任何历史,无需跨库同步);内存架构(统一地址空间消除I/O方向的非对称)。
灵感5:效率的终极指标是"每单位输出的信息密度"而非"每步速度"。4×加速全部来自更少更精的token。推广场景:写作与汇报(结论先行的金字塔原理);API设计(一次调用返回完整资源而非分页爬取);教育(课时压缩靠知识密度而非语速);通信协议(头压缩与语义压缩)。