首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >2.8万亿参数的 Kimi K3,到底堆了什么?

2.8万亿参数的 Kimi K3,到底堆了什么?

作者头像
乐小野
发布2026-07-23 13:12:15
发布2026-07-23 13:12:15
1500
举报

2.8 万亿这个数字,这两天在 AI 圈被反复引用。月之暗面在 7 月 17 日放出 Kimi K3 的同时,直接把它标成全球首个开放 3T-class 模型。同一天,马斯克先在相关报道下留了句” Impressive“,转头就在 X 上宣布 xAI 正在训练 2 万亿参数的 Grok 4.6,称「可能超越 Kimi」。月之暗面的回应很简短,微博 @ElonMusk 发了一条「欢迎加入 2 万亿+俱乐部」。

参数竞赛看起来又升级了。

📌 一句话先讲明白 Kimi K3 把 MoE 稀疏度压到约 1.8%(896 个专家激活 16 个),用 KDA 把长上下文 KV 缓存从线性膨胀改成固定状态,再叠加原生视觉和 2026-07-27 前开源权重。月之暗面赌的不是「参数最大」,而是「用一套工程架构把大模型的使用成本打下来」。


🧭 Kimi K3 定位分析

月之暗面给 Kimi K3 的官方定义是 open frontier intelligence。翻译成产品语言,就是「开放的前沿基础模型」。关键在「开放」这两个字。

Kimi K2 时期,月之暗面的长文本能力已经做出了辨识度。K3 的升级路线很清晰,参数规模从千亿级直接跳到 2.8 万亿,上下文窗口拉到 100 万 token,同时加入原生视觉理解。更重要的是,完整权重会在 7 月 27 日前发布,并开放商用。

这件事的意义要放在行业里看。OpenAI、Anthropic、Google 的前沿模型都是闭源 API 路线,DeepSeek 开源但参数规模不在同一档。Kimi K3 如果按承诺开源,会成为当前参数最大的开放权重模型之一,直接挑战「闭源才能做 frontier」的默认假设。

💡 工程要点 月之暗面选了一条和 OpenAI 相反的路:用开源权重换生态位,再用长上下文和多模态建立产品差异化。参数规模是这张牌的门面。


⚙️ 2.8T 参数?:Stable LatentMoE

Kimi K3 的 2.8 万亿参数不是稠密堆出来的。它用的是 Stable LatentMoE,总专家数 896,每个 token 只激活 16 个。稀疏度大约 1.8%。

稠密模型每 forward 一次要调动全部参数,训练和推理成本都随参数量线性涨。MoE 把参数切成很多专家,让模型在保持总容量的同时,每次推理只调用一小部分。问题是专家路由容易不稳定,常见专家坍塌、负载不均、训练抖动。

月之暗面在 K3 里加了几个稳定器:

  • Quantile Balancing直接按路由分数的分位数分配专家,去掉需要人工调的启发式超参
  • Attention Residuals (AttnRes)把传统残差的均匀求和改成对前序各层输出的 Softmax 注意力,让深层信号不容易衰减
  • Per-Head Muon把 Muon 优化器按注意力头独立应用,提升收敛稳定性
  • SiTUSigmoid Tanh Unit,增强激活值控制 从原文看,架构设计比较新颖:

我们简化下推断:

⚠️ 限制 MoE 的稀疏激活能降低单次推理成本,但模型总参数量还是 2.8T。部署时显存占用不会比同规模稠密模型低多少,只是计算量被压缩了。这也就是说,单机 still 放不下,必须走分布式推理。


🔍 KDA 注意力:长上下文的真正解法

Kimi 系列最大的标签一直是长文本。K3 把上下文窗口推到 100 万 token,并拿出了 Kimi Delta Attention (KDA)。

标准 Transformer 的自注意力复杂度是 O(n²),上下文越长,KV 缓存膨胀越厉害。100 万 token 的情况下,传统注意力几乎不可行。KDA 的做法是引入固定大小的递归状态,把 KV 缓存从随序列长度线性增长,变成一个可控的常量。

具体架构上,K3 采用 3:1 的混合布局:每 4 层里,3 层用 KDA 线性注意力,1 层保留 Gated MLA 全局注意力。线性注意力负责快速扫描长序列,全局注意力负责捕捉远距离的关键依赖。两者交替,既保证效率,又不完全牺牲精度。

官方表述:在 100 万 token 上下文中,解码速度最高提升 6.3 倍。在 BrowseComp 这类需要长上下文浏览的任务上,K3 做到了 90.4。

总结如下图:

🎯 takeaway KDA 不是让模型「记得更多」,而是让长序列推理的内存和计算成本变得可接受。没有这一点,100 万 token 上下文就只是 PR 数字。


🖼️ 原生视觉与多模态

K3 的另一个升级是原生视觉理解。官方说法是可以同时理解文本、图像和视频。这里的「原生」区别于后期拼接的视觉编码器方案,指视觉信号从模型底层就融入同一套表示空间。

这个选择的技术影响在于,多模态任务不需要单独的 CLIP 或 ViT 编码器做桥接,端到端训练可以减少模态对齐的损耗。但代价是训练数据、训练稳定性和算力消耗都会显著增加。

从应用场景看,原生视觉对 Kimi 的产品线很关键。月之暗面在 C 端有 Kimi 智能助手,B 端有 API 服务。100 万 token 上下文 + 原生视觉,让它可以一次性吞下整本 PDF、一整个代码仓库、一段长视频,然后做跨模态推理。这比单纯的聊天机器人更有商业价值。


🏭 开源+商用:月之暗面的牌桌

月之暗面宣布 7 月 27 日前发布完整权重,并开放商用。这件事比参数数字更值得关注。

当前的前沿模型格局里,OpenAI 和 Anthropic 坚持闭源 API,Google 半开半闭,Meta 的 Llama 开放权重但 Frontier 级别仍有差距。Kimi K3 开源,会是第一个真正达到 frontier 规模、同时开放权重和商用的模型。

在马斯克宣布 Grok 4.6 参战的时间点,开源是月之暗面最有效的差异化标签。

📅 同期对照 马斯克 7 月 18 日宣布 Grok 4.6 训练中的同一天,Kimi K3 已经公布了开源时间表。两家公司的竞争不只是模型能力,更是「开放 vs 封闭」的路线之争。


⚖️ 跟 Claude Fable 5 / GPT 5.6 Sol 还差多少

官方技术博客列出了不少 benchmark。K3 在 DeepSWE、Terminal-Bench 2.1、FrontierSWE、SWE Marathon、PostTrain Bench 等代码任务上表现突出,在 OfficeQA Pro、BrowseComp、MMMU-Pro 等任务上也有竞争力。

但技术博客也诚实给出定位:整体仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但优于其他参测模型。

维度

Kimi K3

Claude Fable 5

GPT 5.6 Sol

公开参数量

2.8T

未公开

未公开

上下文窗口

1M token

200K

1M

权重开放

是(7.27 前)

原生视觉

代码 benchmark

整体 frontier 排名

第三左右

领先

领先

⚠️ 硬伤 截至官方发布时,还没有第三方机构对 Kimi K3 做独立复测。所有 benchmark 成绩都来自月之暗面自己的技术博客。开源权重发布后,社区复测会给出更真实的答案。


❓ 几个还没看清楚的点

第一,开源许可协议到底是什么。月之暗面说开放商用,但还没公布具体 license。是类似 Llama 的有限商用许可,还是更宽松的 Apache/MIT,会直接影响企业采用意愿。

第二,2.8T 模型的实际部署成本。 sparse activation 降低了单次计算量,但模型总权重仍然巨大。普通云厂商要部署 K3,需要多少张 GPU、什么样的网络拓扑、推理延迟能否接受,都还是未知数。

第三,KDA 的泛化能力。线性注意力在长文本上效率优势明显,但在需要精细长距离依赖的任务上是否会出现信息损失,需要更多独立评测。


✍️ 写在最后

Kimi K3 的发布,把 2026 年大模型竞争的焦点重新拉回到两个老问题:规模与开放。

参数规模上,2.8T 已经是当前公开的最大模型之一。但更值得关注的是它怎么实现这个规模,MoE 稀疏化、KDA 线性注意力、量化感知训练,这些工程选择都是为了在可控成本下堆出能力。

开放路线上,月之暗面用「开源权重 + 商用许可」直接挑战闭源阵营。马斯克的 Grok 4.6 也是 2T 级别,但 xAI 大概率不会开源。K3 如果按时间表开放,至少在「最大开放模型」这个标签上能占住位置。

真正的胜负不在发布当天,而在权重开放后的 30 天。社区能不能跑起来、云厂商愿不愿接、开发者能不能基于它做出产品,这些才是检验 K3 成色的标准。


References

  1. Moonshot AI. Kimi K3 Tech Blog: Open Frontier Intelligence. 2026-07-17. https://www.kimi.com/blog/kimi-k3
  2. HuggingFace. Kimi K3 Model Overview: 2.8T Parameters, MXFP4 Quantization. 2026. https://huggingface.co/blog/ResterChed/kimi-k3-model-overview-mxfp4-quantization-open-wei
  3. MarkTechPost. Moonshot AI Releases Kimi K3: A 2.8 Trillion Parameter Open MoE Model With Kimi Delta Attention and 1M Context. 2026-07-16. https://www.marktechpost.com/2026/07/16/moonshot-ai-releases-kimi-k3-a-2-8-trillion-parameter-open-moe-model-with-kimi-delta-attention-and-1m-context/
  4. 腾讯开发者社区. Kimi K3 技术解析:全球首个 3 万亿参数开源模型架构详解. 2026-07. https://developer.cloud.tencent.com/article/2711349
  5. 搜狐科技. 马斯克「宣战」Kimi?月之暗面回应. 2026-07-21. https://www.sohu.com/a/1052614212_313745
  6. 新浪财经. 月之暗面喊话马斯克:欢迎加入「2万亿+」俱乐部. 2026-07-21. https://finance.sina.com.cn/tech/roll/2026-07-21/doc-iniippiq4856204.shtml
  7. 电子工程专辑. 月之暗面 Kimi K3 正式发布,2.8 万亿参数登顶全球最大开源模型. 2026-07-17. https://www.eet-china.com/news/202607173308.html
  8. 环球网. Kimi K3 火了,月之暗面回应争议:并非蒸馏复刻现有模型. 2026-07-22. https://www.jwview.com/jingwei/html/07-22/680355.shtml
本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-22,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 石化人工智能 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
目录
  • 🧭 Kimi K3 定位分析
  • ⚙️ 2.8T 参数?:Stable LatentMoE
  • 🔍 KDA 注意力:长上下文的真正解法
  • 🖼️ 原生视觉与多模态
  • 🏭 开源+商用:月之暗面的牌桌
  • ⚖️ 跟 Claude Fable 5 / GPT 5.6 Sol 还差多少
  • ❓ 几个还没看清楚的点
  • ✍️ 写在最后
  • References
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档