先说结论
2026年,“蒸馏"成了大模型行业最热也最不能公开谈论的话题:所有人都在关注,没人愿意上节目承认做过。《晚点聊LateTalk》这期没有请一线从业者,而是由晚点编辑部的高宏浩(代班主持)与曼奇两人,基于近期与多家公司从业者、研究员的访谈信息,把蒸馏的定义、历史、操作细节、法律灰域、反制手段和行业影响完整摊开。这期节目最重要的价值不在"谁蒸了谁”——这件事没人能拿出完整证据——而在于它讲清了三件事:蒸馏是一套有真实门槛的复杂系统工程,不是逐字抄作业;它处在违反用户协议但未必构成侵权的灰色地带,且领先方已经从"看结果"转向"看过程"的反制;而对字节这类拒绝蒸馏的公司来说,最大的代价不是技术落后,而是组织与人才的激励结构被改变。文末还抛出了一个比蒸馏更大的问题:当最强模型对多数任务已经"够用",智能的供给与需求如何匹配,才是真正动摇数百亿美元训练商业模式的问题。
蒸馏到底在蒸什么:从"抄答案"到 Agent 轨迹
曼奇给了一个尽量精确的定义:典型蒸馏是你先有一堆问题,去问一个很强的教师模型(节目反复以 Claude 为例,转写疑似"Fable"即指 Claude),得到提问与回答构成的数据对,再用这些数据训练自己的学生模型,让学生的输出行为不断逼近教师,两者差异越来越小。
主持人的"抄答案"类比被曼奇部分接受、部分纠正。相似之处在于:蒸馏前学生模型可能答不好甚至不会答,教师模型给出精妙的推理过程和结果,学生照着学,学多了甚至会泛化出类似的思考方式。但关键差别是,这仍是一个真实的训练过程——主要用在后训练和中训练阶段,要消耗算力、要把数据放进模型训练,中间有方法、技巧和工程劳动。用节目的话说:“它虽然是抄作业,但是有门槛的抄作业”。
而且被"抄"的东西本身在进化。推理模型(OpenAI O 系列之后)让数据对不再是简单的"题目+答案",中间多出了完整的推理过程;Agent 兴起后进一步扩展为轨迹蒸馏:教师模型在真实环境里(代码库、终端、编辑器、编译器、单元测试等一整套让 Agent 跑起来的条件与系统)完整做完一个任务的全过程,都可以成为学生模型学习的原料。教师模型甚至可以三件套全包——造题目(一般先有真实题目再改写扩增)、造环境(强模型本身有 coding 能力,可以构造环境系统)、造轨迹(自己在环境里把任务做一遍)。
节目特意澄清了一个常见误区:并非训练中用到更强模型的数据或输出就叫蒸馏。比如只用强模型来评估自己模型在环境里任务完成得怎么样,那不算蒸馏,但确实属于"利用闭源模型的输出来提升优化自己的模型"——而这一点已经足够触发领先方的用户协议条款:Anthropic、OpenAI、Google DeepMind 的协议都写明,模型输出不能用于训练,更宽泛的版本是"不能利用我的服务提升和优化与你竞争的模型"。曼奇强调,哪怕某些行为不是蒸馏,在领先闭源方看来也已经违约。
为什么是现在:O1 与 DeepSeek R1 两个节点,加上 K3 这根导火索
蒸馏方法本身早已有之,为什么 2025 年之后规模骤增?曼奇给出两个技术节点和一个行业背景。
第一个节点是 2024 年 9 月 OpenAI 发布 O1。它带来两个变化:其一,揭示了后训练阶段做大规模强化学习可以让模型学到推理策略,而蒸馏本来就主要用在后训练,这让蒸馏的投入回报比上升;其二,测试时扩展——在推理阶段给模型更多算力、生成更长的思维链也能持续提升性能。思维链是模型使用阶段的产出,用户理论上可以看到(即便被隐藏也能通过手段还原),它变成了更好的蒸馏原料。曼奇纠正主持人的说法:这不是"发现了漏洞",方法一直都在,只是能蒸的原料变丰富了。
第二个节点是 2025 年 1 月 DeepSeek R1 发布,技术报告同时放出六个蒸馏小模型——四个 Qwen2.5 底座、两个 Llama3 底座,全部以 R1 为教师。曼奇指出,这本来就是蒸馏最初的主流目的:压缩而非追赶——把大模型的能力压进小模型,降低成本、提高速度,服务手机、汽车、机器人这类端侧算力有限、对延时敏感的场景。他回忆第一次长时间和人讨论蒸馏,是采访自动驾驶公司毫末(转写为"豪末")CEO 顾伟浩:云端训练的大模型要通过蒸馏、剪枝、量化塞进车上算力有限的英伟达 Orin 芯片。千问也是压缩式蒸馏的重度使用者——每次开源的尺寸都很多。
压成的另一面就是变强——压缩与变强本是一体两面。真正的导火索在 2026 年:Google 今年二月发文称"观测到去年开始蒸馏等偷取 IP 的行为变多";Anthropic、OpenAI、Google DeepMind 从 2026 年初开始在公开文章和给美国政府的公开信中频繁提及中国公司蒸馏他们。更重要的背景是中国开源模型明显逼近闭源,K3 在美国引起大量讨论和争议,是里程碑事件(节目提到此前第 177 期专门聊过)。规模变大、开源逼近、中美同时关注,蒸馏被推上风口浪尖。
张一鸣的禁令:技术判断之下的组织账
节目中最有信息量的部分是字节的反例。晚点此前报道,张一鸣在 Seed 内部会上罕见露面并明确表态:不允许字节做蒸馏,且字节在相当长时间内确实没做。曼奇提醒严谨性:罕见的有人不蒸馏,不代表其他人都蒸馏——Anthropic、OpenAI、Google DeepMind 的点名也没有展示完整证据。
张一鸣的理由被节目归纳为三点:一,蒸馏短期改善表现,但本质是复制 Claude 已有的能力,继续做下去最多逼近、无法超越;二,他希望从更底层维度构建 AGI 壁垒——多数从业者也不认为蒸馏是长期壁垒;三,一个较强的表态:即使不蒸馏意味着技术上短暂落后于国内竞争对手,也不用这个捷径。
但据曼奇了解,Seed 2.1(六月发布)“应该用了一些蒸馏手段”——也就是说,禁令是在那之后、内部激烈讨论后做出的明确决定,而非从头到尾的洁癖。此前两三年字节确实基本不蒸馏。
“蒸馏只能逼近不能超越"在技术上是否成立?曼奇采访过的从业者大部分认为不是绝无可能——学生超过教师是一个开放的研究课题。可优化的方向包括多教师蒸馏(博采众长,训好了是能力,训不好是风险),在合并不同方向专家能力的后训练中已经在用多教师思路;也有研究显示在特定任务上学生可以局部超过教师,只是不代表整体更强。
真正让"难以超越"成立的,是组织和人的激励。蒸馏经济、低成本,更关键是有确定性。当组织把重心放在确定性高的路径上,那些做长期探索、走不确定路线的项目和人,就得不到足够的资源和认可——顶尖研究员需要创新研究能被鼓励、被看到的环境。曼奇在极客上的留言区看到一条评论,被他反复引用:“张一鸣可能不是最懂技术的,但他大概率是最懂人性的。“此外蒸馏还有技术内伤:学生可能学到教师的错误和不良表现,行为贴近教师,毛病也一起继承。
节目里还有个耐人寻味的注脚:自张一鸣明确表态后,有一些人想离开 Seed——个体的职业生命有限,希望最宝贵的几年里做出代表作、所在团队至少做出中国最强的模型。这个选择完全个人化,但也真实存在。字节的应对动作是本周(节目时点)被报道的组织调整:从六月起重组数据团队,成立与 Seed、Flow 平行的一级部门"AI 数据和安全”,负责人王英磊(Adam 王,曾在 TikTok 负责直播,向文佳和 Alex 汇报过)。曼奇认为这指向一个明确方向:字节要自建不依赖 OpenAI、Anthropic 等外部闭源模型的数据能力。
谁在蒸:公开点名、行为指纹与 2880 万次交互
主持人问 DeepSeek、Kimi、智谱、千问四家"谁最可疑”,曼奇拒绝推测,只梳理了公开信息:Anthropic 二月点名 DeepSeek、Kimi、MiniMax 三家;六月给美国国会的信中点名千问,称其疑似与 Claude 有 2880 万次交互,“有史以来发现的规模最大的蒸馏攻击”。OpenAI 则称 DeepSeek 有疑似蒸馏行为。智谱反而是唯一没有被美国公司公开点名的。随后阿里全集团禁用 Claude——曼奇认为这未必与被点名直接相关:中国用户本就不能用 Claude,这更多是合规表态和数据安全考虑(不希望内部 AI 使用流经外部模型),但它确实发生在中美模型竞争的大语境里。
怎么判断一个模型是否蒸馏过?流传最广的"模型自称是 GPT"其实不靠谱。2024 年 11 月有研究测了 27 个中外模型、设计 77 个问题研究身份混淆:GPT-4 会说自己是 GPT-3,Gemini Pro 会说自己是百度文心,字节 Seed 会说自己是 GPT。论文结论是身份混淆既难判断训练数据来源,更不能说明蒸馏。更合理的方式是比较输出分布与整体行为是否接近(说话方式、输出格式、拒绝方式、代码风格),但这需要很大的量,问一两次"很像"证明不了任何事。曼奇反问:你想判断这件事,是因为你预设了蒸馏不好——对普通用户毫无影响;但对投资人、二级市场、求职选公司的人,它是一个关于"蒸馏长期是否有利于研发团队"的技术判断。
蒸馏的反制也从结果检测转向过程检测。Anthropic 称已建立识别蒸馏流量的分类器和行为指纹系统,能发现跨账号协同、重复提问、套取思维链的行为;同时加强对教育、研究、创业公司账号的身份认证——这正好卡住蒸馏的前置环节:运营高质量真实用户。国内头部模型若依赖蒸馏,还多一层合规隐患:千问、Kimi 目前都不在美国实体清单上,一旦被 OpenAI 发现大规模异常使用,可能招致清单风险。“要想人不知,除非己莫为”——总有痕迹。
蒸馏的真正门槛:账号、管线与"自己蒸自己"的坑
如果所有公司都能"狠狠地蒸”,竞争力差在哪?曼奇认为每家薄弱环节不同,但他展开讲了几个有难度的环节。
账号与用户运营。 需要稳定高频访问领先模型的账号,以及真实高质量的用户数据来源。行业里有种做法:建(或接入稳定的第三方)中转站,让有真实需求、能提出高质量问题的用户——高校理工科学生、研究者、高级程序员——通过中转站使用 GPT/Claude。真实提问只是种子,围绕它再做扩增和改写。这既是运营工作也有技术部分。风险在于中转站自己也可能是坑:有某家模型用中转站蒸数据,结果发现蒸出来的是自己的模型——自己在蒸自己(中转站在领先模型里掺入了"你不想用的模型")。
数据管线。 从真实用户任务里筛选、过滤、去重,用模型扩增改写、纠错,控制数据的形式与配比,再让整个系统低成本、稳定地跑起来——这决定大规模操作的效果与效率。曼奇总结:蒸馏是一个复杂的系统工程,如果非要说抄作业,那也是抄的过程极其复杂的作业。
隐藏蒸馏行为同样困难。主持人设想了三条路,逐一被拆解:不用 API、直接下载开源权重模型(比如 K3 接近 3T、V4 1.6T)在自家机房生成几亿条数据,外部几乎无法发现?曼奇回应:部署这么大的模型本身需要可观算力,持续跑数据电费也高,政府层面反而比较容易监测(黄仁勋七月下旬的采访也被问过这个话题);从多个教师模型各拿一点数据再筛选重写?对闭源厂商藏不住——大规模高频调用 API 的异常行为在过程中就会被看到,“它不是从结果发现,而是从过程发现”;买第三方数据公司的数据算不算蒸馏?曼奇区分了两个层面:只要让学生模型逼近更强模型的输出,技术上就是蒸馏;法律上、用户协议层面则有很多操作空间,若未来美国出台更严厉限制,还会牵涉政府层面的博弈,不再单纯是技术问题。
学生能否超越教师:一个开放问题与"各领风骚几个月"
蒸馏的好处直接明了:低成本、高确定性地接近更强性能。但超越教师之后呢?主持人问"成为 frontier 模型是否等于创新",曼奇把问题还原为"靠蒸馏能不能变成世界第一":如果学了最好的教师还超过了它,按当前评测标准确实可能第一——这在技术上是开放问题;但能不能持续第一,取决于创新能力。
现实是"各领风骚几个月"。Anthropic 今年上半年曾持续领先几个月,最近因 K3、Grok 4.6(节目时点昨天刚发)等密集发布,显得开源非常接近闭源——但曼奇提醒两点:其一,现在还没有真正追平;其二,拉长到半年维度,中间有几个月 Anthropic 和 OpenAI 是明显领先的。现在的格局可能是领先者"跳一步"、追赶者跟上、再"跳一步"的循环。
后发者却确实有阶段性优势:用更新的数据、更强的模型来蒸,与领先者的差距能缩到几个月甚至更短。这可以接受吗?曼奇给出的框架取决于你怎么看 AGI 的到来方式:如果 OpenAI、Anthropic 讲的"自进化"成立——用 AI 优化 AI、自动化程度越来越高、加速度越来越大——那么率先达到某种状态就非常重要,今天几个月的时间差,到了另一个状态后可能就不再容易被蒸馏抹平;反过来说,如果自进化叙事不成立,紧跟策略就够用。这是本期节目埋下的一条重要分岔。
双标之辩与那条真正的红线
“原罪"的说法被曼奇明确反对:蒸馏是灰色地带——违反用户协议基本确定,但违反协议不等于法律侵权,且协议本身写得过宽,历史也太短,缺乏判例。他愿意划的红线很低:明显违反全球通行法律的做法不可接受,比如用黑客手段侵入他方系统、破解思维链——这是底线。
至于中国公司常说的"双标”,曼奇的回答比站队更细。Anthropic 那种从盗版图书网站下书确实构成侵权(2025 年已就 15 亿美元集体诉讼达成和解,案情是下载盗版书且未付费);但两家行为不完全一样——中国公司用账号蒸数据,至少是付了钱的。更有意思的是那个"回旋镖":加州法院有判例认为买了书再训模型不构成侵权(美国是案例法,后续案件会参照)。那么按同样逻辑,其他公司用 Anthropic 的产出来提升自己的模型,是否构成侵权?曼奇认为这是很有意思的开放法律问题。
三年后蒸馏会像爬虫一样无法阻止,还是被 frontier lab 用账号体系、模型设计、法律手段禁止掉?曼奇先拒绝看三年——“AI 已经不知道变了多少轮”,36 个月太远。可以确定的是博弈会持续:你有手段、我反制、我再找新手段。蒸馏本身有很多现实约束——成本、可监测性、合规风险——不会肆无忌惮蔓延;行业对蒸馏的高度依赖也只是阶段性状态,它只是众多可组合方法中的一个。
比蒸馏更大的问题:智能的"够用了"
节目最后升维到一个问题:如果蒸馏越来越容易,投入几百亿美元训练 frontier model 的商业模式会不会根本改变?短期市场预期是 Anthropic、OpenAI 估值受影响,甚至有人认为冲击 IPO 进程。但曼奇提醒这是"此时此刻的切面":马斯克在 Grok 4.6 发布后回复称 Grok 4.7 会超过所有现有模型,但也补了句 Anthropic 的下一个模型可能非常强——闭源公司可能有未展示的后手。
更明确的冲击在商业逻辑层面。V4、Grok 4.6 都是高性价比模型,那张著名的"斩杀线"图里,其下方与右侧区域的模型都被斩杀。真正的问题是:对很多任务来说,目前这批最强的模型已经很够用了。曼奇近期见一位做生产力应用的公司创始人,对方估计用户的十个任务里有八个能被 DeepSeek V4 Flash 解决——Flash 非常便宜、速度也快(Pro 当时还未正式发布)。这至少会改变很多定价策略。
再往下挖,是智能供给与需求的匹配问题。节目此前在姚顺雨(转写为"姚胜宇")那期讨论过:从 coding 向白领市场扩散时,对智能需求的规模和节奏并没有那么快——甚至要打问号。一位与曼奇交流较多的投资人在想:大家之前都说 coding 比视频生成大,万一错了呢?错的可能性就藏在"很多白领工作上,现在的模型已经够用"——杀鸡焉用牛刀,屠龙刀没有用武之地。曼奇自己也经历了从悲观(当时只用模型做 deep research)到上头(用 ChatGPT Codex 的 work 功能能干很多以前干不了的事)再到冷却(仔细想,每天高频手搓工具的需求确实会降下来)的完整周期。他的结论是:这可能是比蒸馏更大的问题——蒸馏之外,很多人已经在想智能的供给和需求接下来如何匹配,规模上、节奏上都是未知数。
结语
这期节目没有嘉宾,却可能是关于蒸馏最诚实的一次公开讨论:承认信息来自二手访谈、承认无法指认谁在蒸、承认所有判断都可能被下一个模型发布推翻。它留下的可观察指标很清楚——看字节的"AI 数据和安全"部门能不能走出不依赖蒸馏的路径;看 Anthropic 的行为指纹系统能把"2880 万次"这类攻击压下去多少;看蒸馏相关的法律判例会不会出现;以及最重要的,看"够用了"的智能供给会不会先于 AGI,把 frontier model 的商业模式改写。至于个人层面,曼奇那句框架值得留下:蒸馏只是控制板上的一个旋钮,对公司如此,对观察这个行业的人也是如此——真正该盯着的,是旋钮背后那套自进化的叙事是否成立。