基于晚点聊LateTalk「详解 Kimi K3:强到冲击 Anthropic 估值的模型什么样?」完整转写整理。嘉宾:赵晨阳(RadixArc创始成员、SGLang核心贡献者,从Infer角度解读)、曾志远(华盛顿大学CS博士生二年级,从算法角度解读)。主持人:曼奇。两位嘉宾均为清华大学计算机系本科同系同届。
先说结论:这艘船的零件全换了,但它还叫Transformer
K3是首个将总参数推到接近3T(万亿级)的开放权重模型,支持百万级上下文。但真正让硅谷研究者震动的不只是"又大了一号",而是K3几乎对Transformer的每个部件都做了替换:注意力机制从Full Attention换成了KDA(Kimi Delta Attention,线性注意力)与MLA(全局注意力)的三比一混合;残差连接被改成了深度方向的Attention Residuals;FFN变成了压缩空间里的稀疏MoE专家;甚至连位置编码都几乎被删除——不再使用RoPE或任何显式的位置编码。
曾志远用了一个精准的比喻:这几年的开源模型几乎把每一种可能的部件组合都尝试过,可以称其为"忒修斯之船"——船板换过了,甲板换过了,龙骨甚至都换过了,但这艘船的船名始终没变。Attention机制就是AI研究领域的那艘特修斯之船,它只规定了一个接口——用可微模块反复混合序列上的信息——至于你拿什么算子混合、残差如何连接、FFN的形状是什么,这些部件的可组合性远比我们想象的好。
这个发现对行业的启示是:我们不需要把Full Attention和Linear Attention理解成二选一的关系。Hybrid Architecture(混合架构)确实是一个非常有前景的方向,K3已经在2.8T规模上有效证明了这一点。
架构:线性注意力在3T规模上的"有效证明"
K3架构的整体思路是让语言模型在处理信息时,信息在不同方向的流动更加高效。核心设计有三个层面:
序列方向:K3用KDA(线性注意力)和MLA(全局注意力)的混合结构。大约四分之三的层使用更低成本的KDA来处理上下文,周期性地保留全局MLA。具体配比是3:1——每三层KDA加一层Gated MLA,模型最后一层也一定是MLA。这个比例并非理论推导,而是Kimi Linear在48B小模型上做ablation实验得出的经验值:3:1和1:1在验证集上效果相近,但1:1复用更多注意力层意味着推理成本更高。K3直接将这套设计从48B放大了约60倍到接近3T。
深度方向:K3使用了Attention Residuals,让后面的层可以选择性地读取前面层的表示。传统的残差连接是所有前层输出直接相加,随着模型变深,新写入的信息会被稀释。Attention Residuals的做法是把普通Attention"旋转90度"——正常Attention是在Token之间做匹配,Attention Residuals则是在层之间做选择,每层有一个可学习的Pseudo Query,和当前Token在不同深度的表示做匹配,决定从哪些更浅的层读取信息。这个方案与DeepSeek V4使用的MHC(多头残差流)追求的效果相似但路线不同:MHC像深度方向的RNN,信息通过固定大小的状态层层传递;Attention Residuals像深度方向的Attention,可以直接跨层读取。从理论上限看,Attention Residuals的表达力更高,但K3实际采用的是Block Attention Residual(分块后再在块间做Attention),并非理论上最完整的Full版本。
位置编码的取舍:K3没有使用显式的位置编码。这对于训练百万级上下文模型来说是一个重要简化——如果用RoPE,扩展上下文时需要调整RoPE的base或做插值(如YaRN),而KDA内部的递归状态更新、gating和decay机制本身对顺序敏感,已经隐式编码了位置和时近性信息。赵晨阳从Infer角度补充了一个实际好处:K3的MLA层完全不用加位置编码,外推到百万token时非常自然流畅。
赵晨阳此前在晚点聊解读DeepSeek V4时曾判断"线性注意力的理论优势需要几代真实大模型的验证"。这次他坦诚更新:K3毫无疑问是对线性注意力路线的一个有效证明——一个2.8T的主线模型,支持百万token,不使用RoPE,这些都是实打实的工程验证。
遗忘问题与效率账本:6.3倍解码加速是怎么来的
线性注意力的核心代价是"遗忘":它把任意长的历史压进一个固定大小的递归状态,特别早或特别细节的信息可能被覆盖。曾志远指出,KDA虽然在delta rule、channel-wise forget gate、retention factor下界等设计上更聪明地管理有限记忆,但本质上并没有消除容量瓶颈。K3真正解决百万上下文遗忘问题的答案在于Hybrid结构——每三层KDA加入一层Gated MLA,MLA提供对所有历史Token的全局交互,模型不需要KDA把每个细节都压在递归状态里。
效率提升则是惊人的。赵晨阳分享了SGLang团队为K3设计推理栈时的实际数字:69层KDA给一个请求分配的历史信息大小基本固定在54MB,不论上下文多长;24层MLA则为每个Token额外分配27KB,百万上下文的MLA开销约27GB。如果是全注意力架构,69层同样会产生几十GB的额外存储。KDA和MLA的组合节省的存储进一步反映到KV Cache的搬运成本上,赵晨阳引用Kimi Linear论文的数据:在同规模模型下,线性注意力为主的混合架构在百万Token全上下文量级的解码速度是全注意力架构的6.3倍。
这种效率优势在长程Agentic Coding场景中体现得最为明显——如果每个请求消耗上百GB的KV Cache,最强大的HBM也撑不住几十个并发。赵晨阳判断:任何一个能在百万上下文水平上把KV Cache Transfer成本、Prefill一次成本、Routing成本压下来的架构,大概率都是异构的。
路由创新:Quantile Balancing为什么是3T稳定训练的关键
K3作为MoE(混合专家)模型,每个Token需要在896个路由专家中选择16个——这是一种非常极端的稀疏激活。专家负载均衡(Expert Load Balancing)直接关系到训练能否稳定进行:如果某些专家被选中太少,无法充分发挥参数容量;如果某些专家过热,对Infra也不友好。
DeepSeek V3曾提出用bias update替代传统的auxiliary loss来做负载均衡——给路由分数加一个偏置项,过热就调低,过冷就调高,且偏置只影响选专家的机制,不需要额外loss改变训练目标。但V3的bias更新是固定步长的,只知道方向(过热还是过冷),不知道程度。
K3提出的Quantile Balancing(分位数路由均衡)更进一步:它直接利用路由分数的分布来估计需要调整多少。具体做法是观察每个Token排在第17名(即门槛)的分数,然后对每个专家观察它在整个batch里距离门槛的差值分布,根据这些"分位数"直接算出一个新的bias,使得相对于当前这批门槛,大约有16/896(均衡比例)的Token会选择这个专家。新的bias在当前步算出,下一步直接使用,不再需要像V3那样逐步调整、调步长超参数。曾志远认为,对于接近1000个专家、只选16个的极端稀疏配置,这种更精细的路由均衡应该是K3能成功scale到3T的重要因素之一。
优化器:从Muon到Per-Head Muon
K3使用了Muon优化器的进一步改进——Per-Head Muon。Muon的核心是在用动量更新参数之前,先做一次近似正交化,避免更新只集中在少数几个主导方向上。问题是传统Muon把多头注意力的所有head放在一起正交化,而每个head在计算逻辑上是独立的——如果某些head的scale更大,就会主导整个矩阵的更新方向。
Per-Head Muon的做法是对每个注意力头单独做一次正交化,让不同head在更新时的scale更加均衡。K3的技术报告提到,Per-Head Muon在他们的设定下能让训练动态更加平衡,改善大规模训练的稳定性。曾志远补充,实现难点不在算法本身(直接reshape成多个head block做并行处理即可),而在于大规模训练中QKV经常被融合和切分,优化器状态分散在不同GPU rank上,必须保证每个head在算法计算上的逻辑边界不被打散,同时高效重建完整block、合并小矩阵避免通信开销和kernel launch问题。
主持人提出了一个前瞻性问题:构造新的优化器改进这件事,AI自己能不能做?曾志远认为这天然适合auto research——目标明确(收敛更快、loss更低、更稳定),指标清晰,pipeline结构化。更深层的问题是:能否让AI agent研究如何设计小规模proxy experiment,使结论能更好地generalize到真正的大规模训练。如果这个问题做好了,可以大大加速整个优化器研究乃至架构研究的迭代——因为用最少的资源做一次可靠验证,是模型开发的核心能力。
后训练:先分后合的MOPD与蒸馏的技术定义
K3的后训练策略是先训练九个领域专家模型,然后通过MOPD(Multi-Teacher On-Policy Distillation,多教师在线蒸馏)合并成一个模型。为什么不直接联合训练?曾志远解释了核心逻辑:
不同领域的研发过程需要解耦。通用推理、Coding Agent、通用Agent等不同团队,他们的数据、环境、奖励策略、训练设置甚至harness都不一样。如果把所有东西混进一次大的联合RL,合板时的技术压力非常大——每个团队已经work的方案要强行统一,迭代速度会被拖慢。MOPD让每个小团队专注把自己的领域模型训到最好,最后只合模型不合方案。
MOPD已成为近一年的主流后训练recipe,MiniMax V2、DeepSeek V4、NVIDIA NeMo Transverter 3 Ultra以及K3都采用了这条路线。曾志远指出,MOPD之所以不太会写成论文,是因为它更像是"避免了一条很麻烦的路径",而不是一个clean的研究问题——对比方案(不做MOPD的joint training)的setup太复杂了。但这不影响它在业界的传播,前沿实验室之间这类方法的归属信息流通很快。
关于"蒸馏"的技术定义,曾志远做了清晰的区分:蒸馏从技术上始终是教师模型向学生模型传递能力,最经典的用法是压缩模型。但在MOPD中,蒸馏的目的不是压缩,而是合板——从同一个foundation模型出发,训练出不同领域/不同推理强度的教师模型,再传回一个统一的学生模型。实现上,On-Policy Distillation是让学生自己生成轨迹,教师对轨迹打分提供密集奖励信号;而大众语境中更常说的蒸馏是Off-Policy的——教师预先生成固定答案,学生在离线数据上做模仿学习。两者在算法层面有本质区别,效果也取决于具体场景。
KDA的另一重含义:Kernel Development Agent与RSI的现实边界
在K3的技术报告中,KDA除了指Kimi Delta Attention,还有一层含义——Kernel Development Agent(内核开发智能体)。K3的早期checkpoint已经在承担大量kernel优化工作。陈阳所在的SGLang团队也在高强度做类似的事情:他们有顶尖的kernel工程师,只需要一个强大的AI来放大他对kernel的理解。
Kernel之所以成为RSI(递归自进化)率先运转的领域,是因为它恰好满足了三个条件:reward准确(性能和正确性容易验证)、reward便宜(跑一次硬件就行,不太需要人工成本)、难以作弊(作弊方式有限,且K3团队专门设计了惩罚恶意CUDA Graph重放和打表缓存的检测)。陈阳判断:在有验证器的领域,RSI的循环已经在高速运转——这不意味着模型开始自进化,但在有限的、清晰的边界内完成持续改进,这已经在发生。至于整体的RSI,仍是一个非常远的挑战。
曾志远从评测角度补充:RSI真正缺的不完全是模型,而是evaluation、是harness。数学和编程之所以在2025年成为验证RSI的焦点,是因为它们更容易评测。但即便是Coding,现在的进展也会放慢——从写一道LeetCode题(容易评测)到给一个巨大仓库加新功能(很难评测),评测难度已经显著上升。
开源的真正护城河:权重是一次性的,环境是流水线
K3开源了权重、Mooncake、Flash-KDA、Agent Eve等基础设施,但RL的Environment、用于自我演化的知识图谱任务系统、以及专家Merge的原始checkpoint都没有开放。赵晨阳提出了一个关键的判断框架:
权重是一次训练的产物,但环境是能够反复复用、并且产出下一代权重的流水线。 我们得到了K3的权重,全世界都可以得到这代模型的智能,但仍旧没有得到怎么造出下一代智能模型的这条流水线。
开放权重只是缩小了顶尖闭源模型和开源模型之间的能力差距,但迭代速度差距是否会缩小是另一回事。如果顶尖闭源实验室三个月发一个checkpoint而开源模型需要六个月,这个能力差距不在权重本身,而在环境、验证和算力——这三者已经超出了权重。
赵晨阳还指出了开源不可逆的物理本质:权重一旦发布就是一串可以被批量复制的文件,社区会做镜像、做量化、做微调,衍生版本数量会指数级增长,下架根本不成立。这有点像三体——地球的坐标一旦广播出去就不可能收回来。
推理工程:前缀复用、投机采样与训推一致性
前缀复用的挑战
语言模型推理有一个非常普遍的技术叫前缀复用:不同用户请求的公共前缀不需要重复计算。K3的技术报告提到,一个典型的coding场景可能带有40万token的前缀是共用的,真正要计算的增量可能只有4000token,前缀命中与否的计算量会差出好几个数量级。
但K3的Hybrid KDA架构让前缀复用难度提高了。传统KV Cache是只增不减的,而KDA会在前缀树上驻留一块为每个token反复覆盖读写的固定大小缓存——像一块反复擦写的白板,而不是只往后写的笔记本。赵晨阳分享了SGLang团队借鉴操作系统原语(copy-on-write、snapshot、donate)来安全共享这块可变状态的做法。
投机采样的状态存档
KDA架构对投机采样(Speculative Decoding)也带来了独特挑战。投机采样用小模型猜测一批token、大模型一口气验证,验证不通过时大模型需要回退到验证前的状态。普通Attention只需"撕掉后几页",但KDA需要对每个token的递进状态做原地重写。SGLang团队的解法是不存状态、只存每一步状态的极小投影(约1KB),回退时从上一个checkpoint出发重放——像象棋复盘只记棋子的移动而不记整个棋盘。赵晨阳提到,Kimi K3的技术报告也独立提出了类似设计。
训推一致性与FP4量化
K3从SFT阶段就开始做QAT(量化感知训练),采用FP4精度,并在RL采样阶段和training阶段使用同一套量化方案。赵晨阳解释了为什么这很重要:如果训练时是BF16、推理时是NVFP4,两者给出的token概率有细微差别,这就构成了一种off-policyness——策略梯度优化的前提(正在优化的策略就是产生数据的策略)被破坏了,对于MoE模型甚至可能导致灾难性崩溃。K3的做法是让训练和推理阶段尽可能契合,这是RL infra领域的一贯认知,但实现非常难,需要维护庞大的infra和kernel team。赵晨阳评价:Kimi的infra技术非常领先。
Agent Eve的设计哲学:更好的隔离,更宽的能力边界
K3开源的Agent Eve强化学习环境体现了Kimi团队的一个设计理念:通过更好的技术隔离来放宽模型的能力边界。一般做法是为了安全去限制模型能力、用更好的隔离锁死模型。而K3团队的做法是反过来——用Firecracker micro VM替代容器runtime,让沙盒更安全(一个agent崩溃不影响其他沙盒),从而让模型获得更高的系统权限。
另外两个值得关注的工程实践:
Partial Route解决长尾问题:强化学习采样中,一个batch的16个request里可能有一两条特别长的(比如调外卖mock接口返回不稳定等了一分钟),会极大阻塞整个batch。K3继承了Kimi K1.5提出的partial route做法——不必等所有轨迹都结束,一定比例完成后就拿来训练,未完成的缓存到下一轮。这背后有深厚的统计学支撑,也需要保存历史采样的KV Cache避免重新long prefill。
Harness组合避免过拟合:K3的训练管道把agent harness表示成可配置、可组合的模块(工具接口、system prompt、上下文管理策略、skills、memory),用复杂策略模拟组合各种主流agent harness。这避免了模型overfit到某一个harness——训练时学会订美团就不会用饿了么的问题,对人类来说很愚蠢,但模型训练不加限制很容易出现。
KDA(Kernel Development)对芯片产业的影响
K3技术报告提到,他们已为"alternative vendor"(推测为国产芯片公司)的GPU写了kernel。赵晨阳指出,kernel development agent对整个芯片产业有本质推动——以前国产芯片团队想在模型发布当天support新AI模型有困难,但最近摩尔线程通过MuAS-SGLang生态在极短时间内成功支持了Kimi K3。
主持人问这是否会影响英伟达的统治地位。赵晨阳认为KDA(Kernel Development Agent)对英伟达之外的厂商和英伟达自己都有价值,但目前这些kernel优化主要集中在CUTLASS层面,如果下一代DSL(如Tensor Core Gen Five)出现,KDA还需要时间来泛化上去。他补充:很难说Kimi Delta Attention和Kernel Development Agents哪一个更伟大,这两个KDA都很牛。
行业展望:代差仍在,平台期会来
关于开源何时超过闭源,曾志远的判断比较审慎:一般来说OpenAI、Anthropic内部最强的模型比已发布模型还要强半代到一代。现在最强开源模型的目标是追平已发布的最强闭源模型,但闭源实验室接下来可能放出的是他们内部已经有的更强模型。所以在未来五个月内,这个趋势不太会有明显变化——开源和闭源之间仍有一个代差。
关于梁文锋说"下一代模型的标志是持续学习",曾志远认为核心问题在于缺少衡量持续学习进展的方式:它不是零或一的状态,而是零到一之间的某个阶段,我们需要先做出完备的评测,才能讨论现在的模型离目标还有多远。陈阳则补充:他更希望模型能够对任何系统都做有效优化,但即便Kernel这个最容易验证的领域,模型泛化都还需要额外训练,这反过来暴露了现在模型泛化性没有想象中那么好,实现RSI仍有距离。
对于未来走势,嘉宾们倾向于认为会有平台期出现,但突破不一定是巨大的范式性突破,更多是在执行层面把一些问题解决后上一个台阶。陈阳直言:最近半年其实没有很本质的突破性进展,只是在一个平台上做得更高一点——当然,这个"更高一点"带给普通用户的体验已经很不一样了。
K3真正留给行业的启示或许不在于某个具体的技术改进,而在于它用一种"特修斯之船"的方式证明了Transformer架构的可组合性远超想象——你可以换掉注意力、换掉残差、换掉FFN、删掉位置编码,只要每个部件解决的问题是对的,组合起来就能scale到前沿水平。与此同时,权重只是这张蓝图的一个快照,真正的竞争已经从"谁的模型更强"转向了"谁能更快地用环境、数据和算力产出下一代权重"。K3开放了权重,但没有开放流水线——这才是中国开源模型团队需要清醒认识到的差距所在。