• 论文链接:https://arxiv.org/abs/2608.26288
  • 代码:原文未提供(附录 G 含合成目标上的数值演示)
  • 发表时间:2026 年 8 月 26 日(arXiv:2608.26288v1)
  • 机构:东京大学 + RIKEN(两位作者按字母序署名)

一、论文背景

在大语言模型预训练中,绝大多数可训练参数都以矩阵形态存在(隐藏层权重)。2024 年出现的 Muon 优化器针对这一特点设计:它维护梯度的指数移动平均(动量),然后沿"动量正交化后的方向"前进。所谓正交化,就是把动量矩阵 M = UΣVᵀ 映射为极因子 UVᵀ——保留奇异子空间、把所有正奇异值拉到 1。

计算极因子最直接的办法是做 SVD,但 SVD 在大规模 GPU 训练中太贵。Muon 的实际做法是用几步 Newton–Schulz 迭代:一个只依赖矩阵乘法的固定五次多项式,迭代 q 步后奇异值被近似推向 1。这一廉价正交化正是 Muon 能在 LLM 规模上实用的关键。

Muon 的工程战绩相当亮眼:scaling 研究报告了显著效率提升,Kimi K2 和 GLM-4.5 两个前沿模型都用 Muon 系优化器训练,系统性 benchmark 也把 Muon 列为最强预训练优化器之一。但理论界长期存在一个尴尬的分裂:

  1. 光滑目标路线:大多数收敛性分析直接把 Newton–Schulz 换成精确极因子(或精确线性最小化 oracle),有限迭代根本不进入分析;少数考虑有限迭代的工作(如 Kim & Oh、Shulgin 等)把它当作相对精确更新的逼近误差——在这种框架下,迭代越深保证越好,有限深度"只能帮倒忙"。
  2. 非光滑路线:Cutkosky 等人的在线到非凸转换(O2NC)框架可以处理非光滑非凸目标。Jiang 等人据此观察到:精确极分解版 Muon 等价于算子范数球上的追随领导者(FTL)算法——FTL 可能承受线性 regret,因此无法保证收敛。他们另外构造了 Pion 和 Leon 算法,靠注入随机扰动或增广动量矩阵来强行稳定,但这些组件 Muon 本身并不使用。

于是留下一个基本问题:有限 Newton–Schulz 迭代本身能否成为收益而非误差,让带动量的 Muon 在非光滑目标上找到平稳点?

二、论文定位和关联工作

本文的定位非常精准地卡在两条路线的空隙中:保留 Muon 实际使用的动量 + 有限 Newton–Schulz 组件,在非光滑非凸目标上给出首个平稳点保证,且不添加任何 Muon 之外的组件。

与最相关工作的关系:

  • Parshakova 等(2026):构造了凸 Lipschitz 目标上的反例,证明精确极分解版 Muon 不收敛。本文正好补上"有限 Newton–Schulz 改变了什么"这一问句的答案。
  • Jiang 等(2026a)的 Pion/Leon:靠高斯扰动或双曲平滑显式改造学习器获得非光滑保证;本文显示 Muon 原生的有限迭代自带平滑功能,复杂度的主项 ρ⁻¹ε⁻³ 与两者持平。
  • Kim & Oh(2026):分析有限 Newton–Schulz 但视为逼近误差,随机光滑情形中间项为 r²σ²/ε²;本文改进为 rσ²/ε²(r 为较小矩阵维数)。
  • 谱映射推广工作(Softsign 等光滑松弛、Muonp 分数谱幂、DynMuon 动态谱整形等):本文第 4 节的一般理论给出任意满足 Assumption 4.1 的谱映射获得平稳点保证的充分条件,附录 F 把 Softsign 类松弛作为实例覆盖。
  • O2NC 框架本身:Cutkosky 等引入,Zhang & Cutkosky、Ahn & Cutkosky 发展出折扣变体。本文使用的折扣 O2NC 与动量参数 β 天然同构,是分析带 β 动量的 Muon 的正确工具。

三、问题定义

优化问题:min L(W) = E[ℓ(W; ζ)],W ∈ R^{m×n} 为矩阵参数。假设 L 可微、下有界、Γ-Lipschitz(Frobenius 范数),随机梯度 oracle 无偏且二阶矩有界,噪声方差 σ²。不假设光滑性(即梯度不必 Lipschitz)。

由于非光滑目标下经典梯度范数平稳性不可达(Zhang 等、Kornowski & Shamir 的下界),采用 (ρ, ε)-平稳性判据:在 W 的 ρ-邻域(算子范数球内)找一个分布 p,使其期望梯度的核范数不超过 ε。直觉是允许邻近点的梯度相互抵消——这是 Lipschitz 非光滑目标下唯一现实的平稳性概念。

被分析的算法即论文中 Algorithm 1:

  • 动量更新 M_t = βM_{t-1} + (1-β)G_t;
  • 归一化 Y = M_t / G_op(固定常数归一化);
  • q 步 Newton–Schulz:Y ← (15/8)Y − (5/4)Y YᵀY + (3/8)(Y Yᵀ)²Y;
  • 沿 X_{t+1} = −DY 前进。

在奇异值层面,一步迭代是 f(x) = (15/8)x − (5/4)x³ + (3/8)x⁵,q 步后为 h_q = f∘q,原点处斜率 A = 15/8。关键问题:q 取多少,能保证收敛到 (ρ, ε)-平稳点,梯度调用次数是多少?

四、问题解法

解法核心是把 Muon 看作在线学习器,套用折扣 O2NC 框架,然后证明其折扣 regret 有界。分四步:

第一步:折扣 O2NC 转换。 每轮让在线学习器选增量 X_t,在 W_{t-1} 与 W_t 连线段上随机取点查询梯度(微积分基本定理保证随机点梯度内积的期望恰等于函数值变化),从而把目标下降问题化为带折扣因子 β 的在线线性优化。Jiang 等的引理 3.1(本文推论)表明:平稳性误差 ≤ 常数/T + 期望折扣 regret/T + 噪声项。剩下的全部工作就是控制 Muon 学习器的折扣 regret。

第二步:识别学习器结构。 精确极分解版 Muon 恰是算子范数球上的 FTL(追随领导者),可能线性 regret——这解释了它为何不收敛。而有限 Newton–Schulz 版的动作 X_t = −D·H_{h_q}(M/G_op) 可以写成某个"平滑谱势" Φ̃ 的梯度,即梯度预测算法(GBPA)。对偶地,它等价于带谱正则子的 FTRL(定理 5.7):q=0 时正则子退化为球上的二次 Frobenius 正则子(类似 OMD),q→∞ 时正则子在球上衰减为零、退化为 FTL。深度 q 就是正则化强度的旋钮。

第三步:惩罚–稳定性分解(技术核心)。 定理 4.2 把一般谱映射 h 的折扣 regret 分解为:

  • 惩罚项 ∝ √r·C·Δ(h)/(1-β):平滑势与核范数势的间隙,Δ(h) = ∫(1−h) 是对极映射的逼近误差;
  • 稳定性项 ∝ Lip(h)·Γ²/C:沿动量轨迹累计的 Bregman 散度,由映射的 Lipschitz 常数控制。

关键引理 5.2 给出 Newton–Schulz 的定量刻画:Lip(h_q) = A^q 精确成立,Δ(h_q) ≤ A^{−q},两者随 q 反向几何变化。这是对 h≥1 截断后积分估计得到的,且对任意 Taylor 截断阶 κ 都成立(引理 D.1)。

第四步:平衡取深度。 两项相乘在 q = O(log(1/ε)) 处平衡,得次线性折扣 regret(定理 5.1:E[Reg] ≤ (1+2A)DΓ√(r/(1-β))),再经转换得平稳点保证。此外附录 F 证明对任何满足假设的谱映射都有 Δ(h) ≥ 1/(2·Lip(h)),即这一权衡是本质的,不是 Newton–Schulz 的产物;而 h_q 满足 Δ ≤ 1/Lip,达到该下界的两倍以内,近乎最优。

五、评估指标与实验证据

本文是理论文章,主结果以 oracle 复杂度形式给出,并与先前工作逐项对照;附录 G 提供合成非光滑非凸目标上的数值验证。

非光滑非凸((ρ, ε)-平稳性)复杂度对比:

方法平滑机制极分解计算梯度 oracle 复杂度
精确极分解 Muon无精确极因子折扣 O2NC 框架不覆盖(可能不收敛)
Pion(Jiang 等)高斯扰动精确极因子O(max{ν²‖Q‖²∗ΔL/(ρε³), ν²‖Q‖²∗/ε², νrG/ε})
Leon(Jiang 等)双曲平滑精确极因子O(max{‖Q‖²∗ΔL/(ρε³), ‖Q‖²∗/ε², rG/ε})
本文(定理 5.3)有限 NS,q=O(log(1/ε))NS 迭代步O(max{r(Γ+σ)²ΔL/(ρε³), r(Γ+σ)²/ε²})

主项 ρ⁻¹ε⁻³ 与 Pion/Leon 持平,且 Pion 的 Monte Carlo 实现每轮要算 k=T 个扰动极因子样本才能保持该界,本文则每轮只跑 q≈log(1/ε) 步多项式迭代。

光滑非凸复杂度对比(定理 5.6,随机设置):

参考确定性随机极分解计算
Kovalev (2025)O(LopΔL/ε²)max{LopΔL/ε², √rσ/ε, r^{3/2}σ³/ε³, rσ²LopΔL/ε⁴}精确
Shen 等 (2026)O(LopΔL/ε²)max{LopΔL/ε², r²σ⁴LopΔL/(ε²·…), rσ²LopΔL/ε⁴}精确
Kim & Oh (2026)χ²q·LopΔL/ε²max{χ²qLopΔL/ε², χ²q·r²σ²/ε², χ⁴q·rσ²LopΔL/ε⁴}有限 NS(视为误差)
本文O(LopΔL/ε²)max{LopΔL/ε², rσ²/ε², rσ²LopΔL/ε⁴}有限 NS

确定性 ε⁻² 匹配 Carmon 等的下界;随机 ε⁻⁴ 匹配 Arjevani 等的下界;中间项比 Kim & Oh 改进一个 r 因子,且不含随 q 恶化的因子 χq(在他们的框架里 χq→1 需要 q 双指数逼近精度)。

数值实验(附录 G,合成各向异性非光滑非凸目标,d=20,N=100): 学习率 0.05 下,精确 SVD 极分解版 Muon 与最深 q=10 持续在高损失值附近震荡(不稳定);最浅 q=0 稳定但缓慢;中间深度 q=2 和 q=5 既快又稳,定性印证惩罚–稳定性权衡。Pion 稳定但每步要算约 10 个扰动极因子,墙钟时间明显偏慢。

六、效果优势的根源解释

因果链可以这样建立:

方法差异(有限深度 vs 精确极分解)→ 机制变化(更新映射从不连续变为 Lipschitz,惩罚项与稳定性项可在有限 q 处平衡)→ 指标提升(从"折扣 O2NC 框架不覆盖/可能线性 regret"变为匹配最优 oracle 复杂度)。

逐步拆解:

  1. 不连续是病根。 精确极映射把每个正奇异值都映射为 1——在奇异值 0 处发生跳变,映射不连续(Lipschitz 常数无穷大)。作为在线学习器它是 FTL:完全跟随历史累积梯度,对环境波动毫无缓冲,Parshakova 等的反例正是利用了这种脆弱性。
  2. 有限迭代意外地完成了"正则化"。 h_q 在 [0,1] 上是连续递增的 Lipschitz 映射,Lip = A^q 有限。此时 Muon 学习器变成带平滑谱势的 GBPA/FTRL——正则子把"领导者"的激进动作往回拉,提供 FTL 没有的稳定性。q 越小正则越强(越稳定但越保守,惩罚项大);q 越大越接近 FTL(逼近好但震荡风险高)。
  3. 权衡定量且近乎最优。 惩罚项 ∝ Δ(h_q) ≤ A^{−q} 随 q 几何衰减,稳定性项 ∝ Lip(h_q) = A^q 随 q 几何增长,两曲线在 q = O(log(1/ε)) 相交。更深刻的是附录 F 的下界:任何谱映射都逃不开 Δ ≥ 1/(2·Lip),所以"逼近精度换稳定"不是 Newton–Schulz 的偶然属性,而是谱更新族的普适规律;Newton–Schulz 把常数做到 2 倍以内。
  4. 理论解释了工程实践。 实际部署中 Muon 只跑几步 NS 就够用——本文的 q = O(log(1/ε)) 随精度仅对数增长,与"少量迭代即可"的经验一致。此前这套配置只能被解释为"算力预算下的妥协",现在则获得了正面角色:它是收敛性本身的来源。

需要诚实指出的边界(作者在第 6 节自述):分析对象与部署版 Muon 仍有差距——本文用预先已知的常数 G_op 归一化(部署版用数据依赖的 Frobenius 范数归一化,可能破坏尺度条件)、用经典 Taylor 系数(部署版用经验调优系数)、在随机中间点查梯度(部署版在当前点查梯度)。

七、必要知识反推

要真正读懂本文,需要反推补齐以下知识模块:

  1. 矩阵范数对偶与极分解:算子范数与核范数的对偶关系 sup_{‖X‖op≤D}⟨S, X⟩ = D‖S‖*(在 D·polar(S) 处取到)是全文的出发点——它把"球上最优线性优化"与"核范数次梯度"绑在一起,也是 Muon 动作可行域取算子范数球的理由。
  2. 在线学习 regret 与 FTL/GBPA/FTRL 三部曲:FTL 无正则可线性 regret;GBPA 玩"势函数的梯度";凸势下 GBPA = Fenchel 对偶正则子的 FTRL。理解这套语言才能看懂"Muon 是伪装的 FTRL"。
  3. 折扣 O2NC 转换:为什么在连线段随机点查梯度能无光滑性地估计函数值变化(微积分基本定理 + 期望);折扣因子 β 如何与动量参数共用;(ρ, ε)-平稳性为何是 Lipschitz 目标下的正确目标。
  4. 奇异值函数演算:Lewis 的可分奇异值函数凸性、梯度公式(∇Φ̃ = H_h)、Andersson 等的奇异值映射 Lipschitz 估计——引理 4.3、4.6 的技术底座。
  5. Bregman 散度与惩罚–稳定性框架:FTRL 分析的经典分解(Shalev-Shwartz、McMahan 教科书级内容),本文的创新在于按动量序列而非累积梯度序列分解,从而拿到确定性光滑情形最优的 O(1/ε²)。
  6. 非光滑非凸复杂度版图:Goldstein 型平稳性、ρ⁻¹ε⁻³ 最优界(Pion/Leon 所在)、光滑情形 Carmon/Arjevani 下界——没有这张地图就看不出本文结果"匹配最优"的分量。

八、通用性灵感

即便不研究优化器理论,本文也有若干可迁移的思想:

  1. “近似误差"可能是"正则化”。 一个组件在理论框架里被当作待消除的误差源时,换个理论框架它可能恰是保证稳定性的功臣。工程实践中大量"不精确"的实现(截断、量化、早停)都可能自带隐式正则效应,值得用正面视角重审。
  2. 逼近–稳定权衡是普适规律。 本文证明了谱映射族上 Δ·Lip ≥ 1/2 的下界:想更贴近理想算子就必须牺牲对输入扰动的鲁棒性。这与数值分析中精度–稳定权衡、机器学习中偏差–方差权衡同构,遇到"要不要更精确"的决策时先想想稳定性代价。
  3. 对数深度即够。 q = O(log(1/ε)) 意味着精度每高一个数量级只需多几步迭代——这种"对数代价"结构在实践上等于免费。设计迭代式算法时可以主动寻找此类结构。
  4. 在线学习视角统一优化器。 Adam 是 FTRL in disguise、schedule-free SGD、Muon 是谱正则 FTRL——把优化器当作在线学习器分析是近年富有生产力的范式,适合作为进入优化理论研究的切入路径。
  5. 保留原生组件做理论。 Pion/Leon 路线通过加组件获得保证,本文路线通过理解原生组件获得保证。后者产出的理论对工程实践的约束更少、解释力更强——做系统研究时优先考虑"理解现有系统"而非"改造系统适配理论"。