Muon with Finite Newton-Schulz 精读:有限迭代不是误差,而是收敛的功臣
Muon 已被用于 Kimi K2、GLM-4.5 等前沿模型训练,其核心是用几步 Newton-Schulz 迭代近似动量的正交化。此前的理论要么把这一迭代换成精确极分解,要么把有限深度当作需要控制的逼近误差。本文反转视角:通过折扣在线到非凸转换框架证明,有限 Newton-Schulz 恰恰是让 Muon 在非光滑非凸目标上收敛的平滑机制。深度 q 调节惩罚项与稳定性项的权衡,取 q=O(log(1/ε)) 即可得到匹配最优界的平稳点复杂度,而精确极分解版 Muon 反而可能不收敛。