<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Kimi K3 on MessageDaily</title><link>https://inkeast.github.io/MessageDaily/tags/kimi-k3/</link><description>Recent content in Kimi K3 on MessageDaily</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Wed, 26 Aug 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://inkeast.github.io/MessageDaily/tags/kimi-k3/index.xml" rel="self" type="application/rss+xml"/><item><title>领读Kimi K3技术报告：一个清华架构博士眼中的注意力谱系与「有效scaling」</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</link><pubDate>Wed, 26 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-26-kimi-k3-tech-report-architecture-lead-read/</guid><description>一集面向技术读者的Kimi K3技术报告领读播客，嘉宾孙宇涛（清华计算机系博士生、上海创智学院pre-doc，研究方向LLM架构与预训练）从K3出发串联起十多篇前作，把KDA线性注意力的每一项公式还原成RetNet→Mamba→DeltaNet→Gated DeltaNet的历史叠加，讲清channel-wise衰减、low-rank dk与BF16 tile的kernel co-design，MLA+QK-norm式门控的稳定性逻辑，Latent MoE对通信开销的削减，以及Quantile Balancing如何用线性规划一步求出负载均衡bias。预训练侧K3反潮流回归cosine decay、在混合注意力里用NoPE让长上下文免调参外推；后训练侧on-policy蒸馏成为多teacher多reward的「多模型合板」方案。嘉宾的暴论：大模型架构没有本质创新了，K3最核心的变量是size——2.8T总参、百B激活、K2的2.5倍scaling效率，而把size做work才是真创新。</description></item><item><title>从DeepSeek到Kimi K3，中国开源模型如何逼出黄仁勋的'开源联盟'</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</link><pubDate>Thu, 13 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-13-ai-open-source-deepseek-kimi-huangrenxun/</guid><description>DeepSeek V4 Pro登场，中国开源模型连续逼近前沿能力，迫使黄仁勋牵头组建美国&amp;quot;开放安全AI联盟&amp;quot;，Sam Altman、Sundar Pichai等闭源掌门人罕见支持。这期硅谷101系统拆解了AI&amp;quot;开源&amp;quot;到底开的是什么——从七步训练流程到Open Weights与Open Source的本质区别，以及许可证之争、开源公司如何赚钱、闭源阵营的安全担忧与商业焦虑。</description></item><item><title>特修斯之船：Kimi K3如何把Transformer的零件全部换掉，还能逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</link><pubDate>Thu, 06 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-06-kimi-k3-tech-report-deep-dive/</guid><description>月之暗面K3是首个达到3T级别的开放权重模型，其47页技术报告揭示了一种&amp;quot;特修斯之船&amp;quot;式的架构哲学：注意力改成了线性+全局混合（KDA+MLA），残差变成了深度方向的Attention，FFN变成压缩空间的稀疏专家，甚至连位置编码都几乎被删掉。RadixArc创始成员赵晨阳和华盛顿大学博士生曾志远分别从Infer和算法两条线拆解K3：线性注意力在2.8T规模上实现了6.3倍解码加速，Quantile Balancing路由是3T稳定训练的关键之一，MOPD让九个领域专家模型高效合板，而KDA（Kernel Development Agent）证明RSI已在kernel优化领域高速运转。核心判断：权重只是一次训练的产物，环境才是能反复产出下一代权重的护城河。</description></item><item><title>何谓蒸馏？硅谷如何看中国开放模型逼近前沿</title><link>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</link><pubDate>Sat, 01 Aug 2026 00:00:00 +0000</pubDate><guid>https://inkeast.github.io/MessageDaily/posts/2026-08-01-%E4%BD%95%E8%B0%93%E8%92%B8%E9%A6%8F%E7%A1%85%E8%B0%B7%E5%A6%82%E4%BD%95%E7%9C%8B%E4%B8%AD%E5%9B%BD%E5%BC%80%E6%94%BE%E6%A8%A1%E5%9E%8B%E9%80%BC%E8%BF%91%E5%89%8D%E6%B2%BF/</guid><description>月之暗面K3开源权重发布震动硅谷，开源模型首次在多项能力上追平甚至超越最强闭源前沿模型。两位嘉宾——前Hugging Face开源生态负责人王铁镇和TinyFace联合创始人TJ——深度拆解了&amp;quot;蒸馏&amp;quot;争议的技术真相、中国开源模型为何成本更低、Kimi License商业模式对闭源实验室估值体系的冲击，以及开源模型安全之争的真正焦点。核心判断：没有开源，才是这个时代最不安全的事情。</description></item></channel></rss>