领读Kimi K3技术报告:一个清华架构博士眼中的注意力谱系与「有效scaling」

一集面向技术读者的Kimi K3技术报告领读播客,嘉宾孙宇涛(清华计算机系博士生、上海创智学院pre-doc,研究方向LLM架构与预训练)从K3出发串联起十多篇前作,把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加,讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design,MLA+QK-norm式门控的稳定性逻辑,Latent MoE对通信开销的削减,以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推;后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论:大模型架构没有本质创新了,K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率,而把size做work才是真创新。

August 26, 2026 · 1 min

特修斯之船:Kimi K3如何把Transformer的零件全部换掉,还能逼近前沿

月之暗面K3是首个达到3T级别的开放权重模型,其47页技术报告揭示了一种"特修斯之船"式的架构哲学:注意力改成了线性+全局混合(KDA+MLA),残差变成了深度方向的Attention,FFN变成压缩空间的稀疏专家,甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3:线性注意力在2.8T规模上实现了6.3倍解码加速,Quantile Balancing路由是3T稳定训练的关键之一,MOPD让九个领域专家模型高效合板,而KDA(Kernel Development Agent)证明RSI已在kernel优化领域高速运转。核心判断:权重只是一次训练的产物,环境才是能反复产出下一代权重的护城河。

August 6, 2026 · 1 min