Home
avatar

YEYUbaka

Kimi K3 跨过 2T 门槛:国产大模型重写前沿竞争剧本

2026 年 7 月第三周,国产大模型连出两件大事:7 月 16 日月之暗面发布 2.8T 参数的 Kimi K3,7 月 19 日阿里预告 2.4T 的 Qwen3.8-Max-Preview。一周之内,两家国产模型跨过 2 万亿参数门槛——这是开源模型第一次真正站到与顶尖闭源模型同等的位置上。

先说结论:2T 的价值不在数字本身,而在”受限算力下仍能扩大模型容量”这件事被证明可行了。 这篇文章拆开 K3 的技术选择、市场冲击和定价信号,看看中国模型如何重写前沿竞争的剧本。

事件回顾:一周内两家国产模型越过 2T

7 月 16 日,月之暗面发布 Kimi K3——2.8T 总参数、100 万 Token 上下文、原生视觉能力,官方称它是”全球首个开源 3T 级模型”。在 Artificial Analysis 的智能评分中排第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol;在 Arena AI 的 Code Arena 前端编程榜上排名第一,这也是开源模型第一次把闭源模型压下去。

三天后,阿里千问预告 Qwen3.8-Max-Preview,2.4T 参数,阿里称”除了 Fable 5 之外最强的模型”。值得注意的是,这是 Qwen 旗舰线闭源两代之后重新走回开源路线。

两个模型参数总量超过 5 万亿,前后不到 72 小时。这意味着什么?万亿级 MoE 架构的训练,在国内已经不是”探索阶段”,而是能稳定输出的”成熟阶段”。

K3 的技术选择:896 个专家只激活 16 个

K3 最核心的技术点,是它的稀疏 MoE 架构:

项目数值
总参数2.8T
专家数量896 个
每次推理激活16 个
上下文窗口100 万 Token
相对 K2 的扩展效率提升约 2.5 倍

每次推理只激活 896 个专家中的 16 个,约 1.8% 的专家池。稀疏 MoE 的核心思想,是把”总容量”和”单次计算”拆开——模型记住的东西可以很多,但每次回答问题只动用一小部分算力。

支撑这套架构的是几个自研技术:

  • Kimi Delta Attention(KDA):混合线性注意力机制,为扩展注意力提供高效基础,也让长上下文推理成本大幅下降
  • Attention Residuals(AttnRes):不再把所有信息均匀累积,而是跨深度选择性检索表征
  • Stable LatentMoE:让 896 专家在 2.8T 规模下稳定训练,Quantile Balancing 直接从 router 分位数推导专家分配,去掉敏感的超参数

更实际的意义在于:在高端芯片受限的情况下,靠改底层架构、优化算法,照样能把模型能力往前推。 过去两年,从 DeepSeek 到 Kimi,国产模型一直在回答”算力不够怎么办”——答案就是在算法和架构上把每一分算力用到位。

市场冲击:4700 亿美元蒸发与 1.4TB HBM

K3 发布后,资本市场先给出了反应。

新思科技(Synopsys)和铿腾电子(Cadence)当天都跌超 12%,美股 AI 板块 72 小时蒸发约 4700 亿美元。导火索是 K3 展示的一项能力:48 小时连续运行,完全靠自己的智能体,从零完成一颗芯片的设计、优化和验证——用开源 EDA 工具和 Nangate 45nm 工艺库,全程无人工干预。芯片面积 4mm²、集成 146 万个标准单元、100MHz 时序收敛。虽然这不是能量产的芯片,但”开源大模型进入硬核工业设计”的方向已经清晰。

另一层冲击在算力预期。AP 报道,市场担心更高效的中国模型会削弱美国 Lab 和芯片公司的定价逻辑;美银测算,K3 单个服务实例仍需约 1.4TB HBM,但中国在电力、人工、土地等基础设施成本上有约 1.5-2 倍优势。

“工程效率没有消灭算力差距,却把它压缩成了更短的模型代差。” —— 腾讯科技《AI领域一周观察 07.20-07.26》

定价信号:K3 不打低价牌

K3 没有延续”国产模型必须极低价”的打法。官方 API 定价:未缓存输入 3/百万Token,输出3 / 百万 Token,输出15 / 百万 Token。

上线仅 48 小时,K3 就逼近现有集群算力上限——月之暗面暂停了 C 端新订阅,并把通用会员与 Kimi Code 会员拆分,分别配置算力。

前沿模型进入第一梯队后,就自有它的定价体系权限,而非单纯跟随标准利润率。稀缺带来的溢价,这个经济规律在模型上也成立。 —— 腾讯科技《AI领域一周观察 07.20-07.26》

配合 KDA 前缀缓存技术(官方称代码工作负载缓存命中率超 90%),月之暗面敢在 2.8T 规模上以有竞争力的价格提供服务。

下一道门槛:单次激活参数

2T 解决了”总容量”问题,下一道门槛是单次激活参数

7 月 23 日流出的梁文锋投资者交流会纪要中,他判断美国前沿模型可能已激活约 800B 参数,而国内主力仍在几十 B 量级;DeepSeek 下一步希望把激活参数提高到 150-250B。

换句话说:2T 证明中国团队已经能管理巨大的稀疏容量,下一轮更昂贵的竞争,是让每个 Token 调动更多有效参数。

结语

这个月应该被记录下来的,不是参数数字本身,而是国产开源模型第一次真正站到了跟顶尖闭源模型同等的位置上

当然差距依然存在——K3 官方也承认,整体体验与 Claude Fable 5、GPT-5.6 Sol 仍有明显差距。北京邮电大学王小捷教授的看法很务实:

参数可以堆,但模型能不能在真实世界里持续稳定地发挥作用,那才是真正的考验。

从 OpenRouter 的数据看,开源模型处理的 Token 占比已从今年 1 月的 34% 涨到 6 月的 65%,全球 API 调用月消耗量前五名全部是开源模型。开源生态不再是闭源模型的备选,它正在成为主流本身。


参考来源:

AI 科技 Kimi 月之暗面 开源 大模型 2026