Home
avatar

YEYUbaka

模型「蒸馏」到底是什么?从 Kimi K3 被指控说起

7 月 24 日,美国白宫科技政策办公室主任克拉齐奥斯公开指控:月之暗面的 Kimi K3 是靠”蒸馏”Anthropic 的闭源模型 Fable 5 开发出来的。结果被时间线当场打脸——Fable 5 于 6 月 9 日发布,K3 于 7 月 16 日发布,间隔仅一个多月,而 K3 早在四五月份就已开始内测。美国网友调侃:中国人想必拥有时光机了。

指控本身是场闹剧,但它把”蒸馏”这个词推到了聚光灯下。蒸馏到底是什么?为什么它能成为一个政治化的指控?这背后又有哪些真实存在的灰色地带? 这篇借 K3 事件,把这个概念彻底讲清楚。

事件回顾:一个站不住脚的指控

先还原事件本身。7 月 24 日,美国白宫科技政策办公室主任克拉齐奥斯声称,月之暗面通过蒸馏美国闭源模型 Fable 5 开发了 Kimi K3。

但这个指控有几个硬伤:

指控要点事实
K3 是蒸馏 Fable 5 得来的Fable 5 于 6/9 发布,K3 于 7/16 发布,K3 早在四五月份已内测
蒸馏需要时间一个多月完成”蒸馏 + 训练 + 内测”在工程上不可能
Fable 5 可以被蒸馏Fable 5 有强力安全护栏,且发布仅 3 天就禁止境外 IP 访问
蒸馏能产出 2.8T 模型蒸馏通常是”大教小”,用 Fable 5 蒸馏出 2.8T 的 K3 逻辑上就反了

知名程序员 Teknium 讽刺说:Anthropic 公司抄走了他开源平台的内容来开发 Fable。开源博主翁德雷直言:Anthropic”蒸馏”了全人类。巧合的是,当天美联社披露 Anthropic 因抄袭数据支付了 15 亿美元和解金。

美国网友:中国人想必拥有时光机了,除非有时光机,否则指控根本不可能成立。 —— 连 Grok 都这么认为

蒸馏的定义:大模型教小模型

抛开闹剧,蒸馏(Distillation)本身是 AI 领域一个正经且重要的技术。它的核心思想是:让一个大模型(教师)教一个小模型(学生)。

原理大致是:

  1. 教师模型对训练数据给出输出——不只是最终的正确答案,还有每个候选答案的”概率分布”(软标签)
  2. 这些软标签里包含教师的”思考痕迹”:比如一个图像分类模型认为某张图 70% 是猫、25% 是狗、5% 是兔子——这种细微差别比”它就是猫”信息量大得多
  3. 学生模型用这些软标签作为训练目标,学习教师的知识
教师模型(大)───→ 软标签(概率分布)───→ 学生模型(小)
      ↑                                        ↑
  训练数据                               学习"思考痕迹"

这样做的好处:学生模型可以用远小于教师的参数量,逼近教师的性能。经典案例是 BERT 时代,用 12 层的小 BERT 蒸馏 24 层的大 BERT,性能损失很小,速度却快得多。

注意关键词:蒸馏是”大教小”。用一个小模型去蒸馏出一个更大的模型,这在技术上不成立——这也是 K3 指控最荒谬的地方之一。

常见的几种”蒸馏”

日常讨论中,“蒸馏”其实被用在了几个不同的场景,经常被混为一谈:

类型做什么典型场景
知识蒸馏(KD)大模型教师教小模型学生,迁移”思考痕迹”模型压缩、端侧部署
数据蒸馏用大模型生成/筛选高质量训练数据数据增强、小模型训练
蒸馏攻击通过 API 反复调用闭源模型,提取其能力竞争性逆向工程
输出模仿对齐闭源模型的输出风格部分开源模型的”对齐”实践

前两种是正经技术,第三种是被指责的对象,第四种是灰色地带。

蒸馏攻击的具体做法是:把闭源模型的 API 当老师,让它生成海量输入输出对,再用这些数据训练自己的模型。这是 OpenAI、Anthropic 等服务条款明确禁止的行为,也是”蒸馏”成为指控词汇的由来。

为什么指控站不住脚:三个硬伤

除了时间线,这个指控还有三个技术硬伤:

第一,参数量级不对。 K3 是 2.8T 总参数的模型。即便 Fable 5 再强,用它蒸馏出 2.8T 参数的模型,也违背蒸馏”大教小”的基本逻辑——你要蒸馏出一个更大的模型,得先有一个更大的教师。

第二,安全护栏。 Fable 5 有强力安全护栏,发布 3 天就禁止境外 IP 访问。蒸馏攻击需要大量 API 调用,境外 IP 被禁的情况下,技术上就堵死了这条路。

第三,时间窗口。 一个多月的间隔里要完成”调用 → 收集数据 → 训练 2.8T 模型 → 内测”,这在整个行业都没有先例。K3 早在四五月份已内测,比 Fable 5 发布还早——除非有时光机。

现实中的灰色地带:争议在哪

指控很荒谬,但”蒸馏”确实存在真实的争议。问题不在技术本身,而在于什么算合理借鉴,什么算侵权

现实情况是:AI 公司的训练数据里,几乎都包含其他 AI 模型的输出。Anthropic 自己也被披露支付了 15 亿美元和解金,因为其数据包含从开源平台抄袭的内容——讽刺的是,指控 K3 蒸馏的美国公司,自己刚因”蒸馏”被曝光。

蒸馏在业界普遍存在。真正的争议不在”有没有蒸馏”,而在”蒸馏了谁的数据、用在了什么地方、是否合规”。

这个问题的本质,和更早的版权争议一脉相承:大模型吃了整个互联网的数据,谁能分清哪些是”学习”,哪些是”抄袭”?

总结

回到开头的问题:

  • 蒸馏是什么:大模型教小模型的技术,核心是迁移”软标签”里的思考痕迹
  • 有哪几种:知识蒸馏(压缩)、数据蒸馏(增强)、蒸馏攻击(逆向工程)、输出模仿(灰色地带)
  • K3 指控为什么荒谬:时间线矛盾、参数量级反了、安全护栏堵死了路

下次再看到”某某模型是蒸馏的”这种新闻,先问三个问题:谁是大模型谁是学生?时间线够不够?数据来源合规吗? 三个问题一问,大部分指控的成色就清楚了。


参考来源:

AI 科技 大模型 Kimi 开源 概念科普 2026