2.8 万亿这个数字,这两天在 AI 圈被反复引用。月之暗面在 7 月 17 日放出 Kimi K3 的同时,直接把它标成全球首个开放 3T-class 模型。同一天,马斯克先在相关报道下留了句” Impressive“,转头就在 X 上宣布 xAI 正在训练 2 万亿参数的 Grok 4.6,称「可能超越 Kimi」。月之暗面的回应很简短,微博 @ElonMusk 发了一条「欢迎加入 2 万亿+俱乐部」。

参数竞赛看起来又升级了。
📌 一句话先讲明白 Kimi K3 把 MoE 稀疏度压到约 1.8%(896 个专家激活 16 个),用 KDA 把长上下文 KV 缓存从线性膨胀改成固定状态,再叠加原生视觉和 2026-07-27 前开源权重。月之暗面赌的不是「参数最大」,而是「用一套工程架构把大模型的使用成本打下来」。
月之暗面给 Kimi K3 的官方定义是 open frontier intelligence。翻译成产品语言,就是「开放的前沿基础模型」。关键在「开放」这两个字。
Kimi K2 时期,月之暗面的长文本能力已经做出了辨识度。K3 的升级路线很清晰,参数规模从千亿级直接跳到 2.8 万亿,上下文窗口拉到 100 万 token,同时加入原生视觉理解。更重要的是,完整权重会在 7 月 27 日前发布,并开放商用。
这件事的意义要放在行业里看。OpenAI、Anthropic、Google 的前沿模型都是闭源 API 路线,DeepSeek 开源但参数规模不在同一档。Kimi K3 如果按承诺开源,会成为当前参数最大的开放权重模型之一,直接挑战「闭源才能做 frontier」的默认假设。
💡 工程要点 月之暗面选了一条和 OpenAI 相反的路:用开源权重换生态位,再用长上下文和多模态建立产品差异化。参数规模是这张牌的门面。
Kimi K3 的 2.8 万亿参数不是稠密堆出来的。它用的是 Stable LatentMoE,总专家数 896,每个 token 只激活 16 个。稀疏度大约 1.8%。
稠密模型每 forward 一次要调动全部参数,训练和推理成本都随参数量线性涨。MoE 把参数切成很多专家,让模型在保持总容量的同时,每次推理只调用一小部分。问题是专家路由容易不稳定,常见专家坍塌、负载不均、训练抖动。
月之暗面在 K3 里加了几个稳定器:

我们简化下推断:

⚠️ 限制 MoE 的稀疏激活能降低单次推理成本,但模型总参数量还是 2.8T。部署时显存占用不会比同规模稠密模型低多少,只是计算量被压缩了。这也就是说,单机 still 放不下,必须走分布式推理。
Kimi 系列最大的标签一直是长文本。K3 把上下文窗口推到 100 万 token,并拿出了 Kimi Delta Attention (KDA)。
标准 Transformer 的自注意力复杂度是 O(n²),上下文越长,KV 缓存膨胀越厉害。100 万 token 的情况下,传统注意力几乎不可行。KDA 的做法是引入固定大小的递归状态,把 KV 缓存从随序列长度线性增长,变成一个可控的常量。
具体架构上,K3 采用 3:1 的混合布局:每 4 层里,3 层用 KDA 线性注意力,1 层保留 Gated MLA 全局注意力。线性注意力负责快速扫描长序列,全局注意力负责捕捉远距离的关键依赖。两者交替,既保证效率,又不完全牺牲精度。
官方表述:在 100 万 token 上下文中,解码速度最高提升 6.3 倍。在 BrowseComp 这类需要长上下文浏览的任务上,K3 做到了 90.4。
总结如下图:

🎯 takeaway KDA 不是让模型「记得更多」,而是让长序列推理的内存和计算成本变得可接受。没有这一点,100 万 token 上下文就只是 PR 数字。
K3 的另一个升级是原生视觉理解。官方说法是可以同时理解文本、图像和视频。这里的「原生」区别于后期拼接的视觉编码器方案,指视觉信号从模型底层就融入同一套表示空间。
这个选择的技术影响在于,多模态任务不需要单独的 CLIP 或 ViT 编码器做桥接,端到端训练可以减少模态对齐的损耗。但代价是训练数据、训练稳定性和算力消耗都会显著增加。
从应用场景看,原生视觉对 Kimi 的产品线很关键。月之暗面在 C 端有 Kimi 智能助手,B 端有 API 服务。100 万 token 上下文 + 原生视觉,让它可以一次性吞下整本 PDF、一整个代码仓库、一段长视频,然后做跨模态推理。这比单纯的聊天机器人更有商业价值。
月之暗面宣布 7 月 27 日前发布完整权重,并开放商用。这件事比参数数字更值得关注。
当前的前沿模型格局里,OpenAI 和 Anthropic 坚持闭源 API,Google 半开半闭,Meta 的 Llama 开放权重但 Frontier 级别仍有差距。Kimi K3 开源,会是第一个真正达到 frontier 规模、同时开放权重和商用的模型。
在马斯克宣布 Grok 4.6 参战的时间点,开源是月之暗面最有效的差异化标签。
📅 同期对照 马斯克 7 月 18 日宣布 Grok 4.6 训练中的同一天,Kimi K3 已经公布了开源时间表。两家公司的竞争不只是模型能力,更是「开放 vs 封闭」的路线之争。
官方技术博客列出了不少 benchmark。K3 在 DeepSWE、Terminal-Bench 2.1、FrontierSWE、SWE Marathon、PostTrain Bench 等代码任务上表现突出,在 OfficeQA Pro、BrowseComp、MMMU-Pro 等任务上也有竞争力。
但技术博客也诚实给出定位:整体仍落后于 Claude Fable 5 和 GPT 5.6 Sol,但优于其他参测模型。
维度 | Kimi K3 | Claude Fable 5 | GPT 5.6 Sol |
|---|---|---|---|
公开参数量 | 2.8T | 未公开 | 未公开 |
上下文窗口 | 1M token | 200K | 1M |
权重开放 | 是(7.27 前) | 否 | 否 |
原生视觉 | 是 | 是 | 是 |
代码 benchmark | 强 | 强 | 强 |
整体 frontier 排名 | 第三左右 | 领先 | 领先 |
⚠️ 硬伤 截至官方发布时,还没有第三方机构对 Kimi K3 做独立复测。所有 benchmark 成绩都来自月之暗面自己的技术博客。开源权重发布后,社区复测会给出更真实的答案。
第一,开源许可协议到底是什么。月之暗面说开放商用,但还没公布具体 license。是类似 Llama 的有限商用许可,还是更宽松的 Apache/MIT,会直接影响企业采用意愿。
第二,2.8T 模型的实际部署成本。 sparse activation 降低了单次计算量,但模型总权重仍然巨大。普通云厂商要部署 K3,需要多少张 GPU、什么样的网络拓扑、推理延迟能否接受,都还是未知数。
第三,KDA 的泛化能力。线性注意力在长文本上效率优势明显,但在需要精细长距离依赖的任务上是否会出现信息损失,需要更多独立评测。
Kimi K3 的发布,把 2026 年大模型竞争的焦点重新拉回到两个老问题:规模与开放。
参数规模上,2.8T 已经是当前公开的最大模型之一。但更值得关注的是它怎么实现这个规模,MoE 稀疏化、KDA 线性注意力、量化感知训练,这些工程选择都是为了在可控成本下堆出能力。
开放路线上,月之暗面用「开源权重 + 商用许可」直接挑战闭源阵营。马斯克的 Grok 4.6 也是 2T 级别,但 xAI 大概率不会开源。K3 如果按时间表开放,至少在「最大开放模型」这个标签上能占住位置。
真正的胜负不在发布当天,而在权重开放后的 30 天。社区能不能跑起来、云厂商愿不愿接、开发者能不能基于它做出产品,这些才是检验 K3 成色的标准。