2026 年 7 月 16 日,月之暗面正式发布了 Kimi K3。7 月 27 日晚,完整模型权重、47 页技术报告以及三项关键基础设施技术同步开放。2.8 万亿总参数、MoE 架构、896 个专家中每次激活 16 个、100 万 Token 上下文窗口、原生视觉理解能力——这一组数字背后,是一个关于“大模型继续变大时架构该怎么改”的工程答案。
本文从技术角度拆解 Kimi K3 的核心设计,聊聊它解决了什么问题、留下了什么挑战,以及开发者如何接入。
一、参数规模:2.8T 总参数,104B 激活参数
Kimi K3 采用混合专家架构,总参数 2.8 万亿,内部共有 896 个路由专家,每个 Token 选择其中 16 个,同时调用 2 个共享专家,实际激活参数约 1042 亿。相比上一代 Kimi K2(1.04 万亿总参数、326 亿激活参数),K3 的总容量扩大至近 2.7 倍,单次计算调用的参数也增长了两倍以上。
稀疏比例达到约 56 倍——这意味着绝大部分参数在每次推理时并不参与计算。MoE 的核心逻辑就是“总参巨大、激活精简”:用海量参数承载知识容量,用稀疏激活控制计算成本。896 个专家中只激活 16 个,相当于一家巨型图书馆每次只打开 16 个书架。
但这种设计把复杂性从算法层转移到了基础设施层:更多专家意味着更困难的跨卡调度,需要专门的通信库来平衡专家负载。月之暗面因此同步开源了 MoonEP——一套面向超大规模 MoE 的高性能专家并行通信库。
二、三项核心架构变化
技术报告显示,Kimi K3 采用了三项核心架构设计:Kimi Delta Attention(KDA)、Attention Residuals(AttnRes)以及 Stable LatentMoE 框架。这三项改动分别处理 Transformer 在序列、深度和宽度上的扩展问题。
2.1 KDA:用固定大小的递归状态替代 KV Cache
传统 Transformer 的注意力机制需要保存历史 Token 的 Key 和 Value。上下文越长,KV Cache 越大。100 万 Token 下,传统 Attention 的计算量呈平方级增长。
KDA 的做法是将随序列长度增长的 KV 缓存替换为固定大小的循环状态。模型不会完整保留每个 Token,而是在处理过程中持续更新一份压缩记忆——序列继续增长,这份状态不会按同等比例膨胀。
但压缩记忆会损失细节。全注意力保存的是原始档案,KDA 保存的更像一份持续更新的摘要。所以 Kimi K3 没有完全替换,而是在每个模块中按 3:1 的比例混合 KDA 和 Gated MLA。KDA 负责低成本地维护长期状态,MLA 定期重新检查完整上下文以检索精确信息。模型共 93 层,其中 69 层为 KDA 注意力层,24 层为 Gated MLA 层。
官方数据显示,KDA 将 KV Cache 压缩了 75%,长文本解码速度最高提升 6.3 倍。
2.2 Attention Residuals:解决深层信息稀释
常规模型中,每一层的输出通过残差连接与输入相加后逐层传递。网络越深,早期提取的信息越容易被后续 93 层计算稀释。
Attention Residuals 允许每一层选择性检索前面所有层的表征。相当于给模型装了一条快速通道,让早期的重要信息更直接地影响后续计算。每 12 层插入一次。
2.3 Stable LatentMoE:让 896 个专家稳定工作
MoE 训练中最常见的问题是路由不稳定:少数专家过载、大部分专家闲置。Kimi K3 的 Stable LatentMoE 通过 SiTU-GLU 激活函数和 Quantile Balancing 机制来抑制数值波动、均衡专家负载。路由器在 3584 维的隐空间上运行。
这套机制让模型在极高的稀疏度下仍能稳定训练,无需额外的辅助损失函数来强制负载均衡。
三、性能表现
根据技术报告和第三方评测,Kimi K3 的综合智能水平进入全球第一梯队。在 Program Bench 上得分 77.8%,超过 GPT-5.6 Sol 的 77.6%;在 Terminal-Bench 2.1 上得分 88.3%,接近 GPT-5.6 Sol 的 88.8%;在 SWE-Marathon 上以 42.0% 领先于 Claude Fable 5。
在前端代码评测中,K3 在 7 个细分领域拿下 6 个第一。视觉编码器 MoonViT-V2 从零开始通过下一 Token 预测训练,未使用 SigLIP 等对比预训练初始化,视觉评测结果与基线相当。
月之暗面称,上述架构和工程改进共同带来了约 2.5 倍于 Kimi K2 的整体缩放效率提升。
四、开源与部署门槛
7 月 27 日晚,Kimi K3 的完整权重上传至 Hugging Face,采用 Modified MIT 许可证。同时开源的三项 Infra 技术——MoonEP(通信)、FlashKDA(算子)、AgentEnv(沙箱)——把训练链路上的关键拼图一次性补齐。
但开源不等于人人能跑。MXFP4 量化后权重约 594GB。生产级推理通常需要 64 张以上 H100 组成的超节点,硬件成本百万美元起步。单张 RTX 4090 连一个专家模块都塞不下。K3 的自托管在当下仍是头部云厂商和大型科研机构的游戏。
不过,开源当天已有数十家 AI 基础设施厂商宣布 Day 0 适配。腾讯云 ADP、阿里云百炼、国家超算互联网等平台均上线了 K3 的调用通道。开发者不需要自己买显卡,通过云厂商的 API 就能用上 2.8 万亿参数的基座。
K3 的官方 API 定价为:缓存命中输入 2 元/百万 Token、缓存未命中输入 20 元/百万 Token、输出 100 元/百万 Token。借助 Mooncake 分离式推理架构,编程场景的缓存命中率超过 90%,实际输入成本约为标准价格的四分之一。这是国产旗舰模型首次以“能力定价”而非“低价抢市场”的策略进入市场。
五、接入实践:统一接口的价值
对于需要快速验证或跨模型对比的团队,接入链路本身也值得关注。K3 提供 OpenAI 兼容的 API 接口,现有基于 OpenAI SDK 的应用可以相对平滑地切换。但实际迁移中,不同模型的参数映射、超参调优、错误处理逻辑仍有差异。
通过 4SAPI 这类大模型 API 中转站平台,可以在同一个调用体系内切换 Kimi K3、Claude Opus 5、DeepSeek 等多个模型。这对于需要同时对比不同模型在同一任务上的表现、或在不同模型之间做 A/B 测试的场景尤其实用——不需要为每个模型单独维护一套接入代码,可以在同一套测试框架下完成横向对比。中转层同时提供统一的鉴权方式、协议转换和流量调度能力。
当然,中转层本身会引入额外的延迟和计费维度,具体选型需要结合团队的网络环境和预算结构来评估。
六、小结
Kimi K3 的技术主线,是把原本会随规模不断膨胀的计算和状态,改造成可以压缩、可以调度、可以暂停和恢复的结构。它不是简单把 Kimi K2 放大了接近 3 倍,而是在重新设计大模型怎样保存信息、怎样调用计算资源。
KDA 解决了序列变长后 KV Cache 膨胀的问题;Attention Residuals 解决了网络变深后信息稀释的问题;Stable LatentMoE 解决了专家数量增加后路由不稳定的问题。三项改动分别对应 Transformer 在三个维度上的扩展瓶颈。
对于工程团队来说,K3 的价值不仅在于 2.8 万亿这个数字,更在于它展示了当模型大到一定程度时,架构必须跟着改,而不只是堆参数。开源权重给了社区研究的机会,云厂商的 Day 0 适配给了开发者使用的通道——剩下的事情,就是在自己的业务上跑一遍,看它到底好不好用、贵不贵、能不能落地。




