Kimi K3 全面开源:2.8万亿参数、百万上下文, 月之暗面这次放了什么大招
7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEP、FlashKDA、AgentEnv 三项核心基础设施。这是全球首个被完整开放的 3 万亿参数级别模型——2.8 万亿总参数、100 万 token上下文、约 1.56TB Hugging Face 下载体积,上线半小时内登顶趋势榜第一。
面向模型选型决策者、AI 开发者与企业法务,本文将回答三件事:① 从 7 月 16 日 API 首发到 7 月 27 日权重开放仅 11 天,开放权重(open weight)与媒体口中的「开源」有何本质区别;② KDA、AttnRes、Per-Head Muon 等架构创新及三项 Infra 技术如何支撑百万上下文;③ 与 GPT-5.6、Claude 的独立基准对比、商用许可两道门槛,以及 API / 自部署的六步实操路径。数据截止 2026-07-28。
01 11 天从 API 首发到全面开放权重:时间线与核心痛点
这次权重开放距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。关键节点如下:
- 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,权重尚未公开。
- 7 月 17 日:行业密集分析架构;新华社报道称其为「目前全球参数最大的开源模型」。
- 7 月 22–23 日:中美「模型蒸馏」争端升级。白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「工业化蒸馏」;美国财政部长 Scott Bessent 表示将考虑制裁及实体清单限制。详见 K3 蒸馏门全解。
- 7 月 27 日晚 23 点:完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源)。
- 7 月 28 日:中国商务部公开回应,指责美方「AI 霸权主义」;国内媒体跟进报道开源细节。
开发者与企业用户当前面临的核心痛点:
- 语义混淆:媒体普遍称「开源」,但月之暗面官方始终使用 open weight,训练数据与完整训练代码并未公开。
- 许可不确定性:K3 许可证不再自称 Modified MIT,新增 Model-as-a-Service 收入门槛与规模展示门槛,法务需重新评估。
- 部署门槛极高:2.8T 参数、896 专家规模决定自部署需 64 卡以上超节点,个人开发者几乎无法本地运行。
- 基准数据分歧:厂商自报与独立第三方复测差异大,需优先引用 Vals AI、Artificial Analysis 等中立数据。
月之暗面官方材料从未使用「open source」,一直采用「open weight」表述——这与国内媒体翻译存在语义落差,也是企业合规审查的第一道关卡。
02 Kimi K3 核心参数一览与三大架构创新
| 项目 | 参数 |
|---|---|
| 总参数量 | 2.8 万亿(2.8T) |
| 激活参数量 | 约 1040 亿 |
| 架构类型 | 混合专家模型(MoE) |
| 专家配置 | 896 个路由专家,每 token 激活 16 个(另有共享专家) |
| 注意力机制 | Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA) |
| 上下文窗口 | 100 万 token |
| 多模态能力 | 原生视觉理解(ViT-V2,27 层) |
| 权重格式 | MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练) |
| 权重体积 | 约 1.56TB(Hugging Face) |
| License | 自定义许可证(官方称 open weight,非 open source) |
Kimi Delta Attention(KDA):逐通道精细遗忘
传统 Gated DeltaNet 使用标量级遗忘门,整段记忆共用同一衰减系数。KDA 改为逐通道门控:每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。KDA 采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,大幅降低长序列 KV Cache 开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合,是支撑 100 万 token 上下文的核心。
Attention Residuals(AttnRes):选择性残差聚合
传统残差连接逐层均匀累加,深层网络中早期层信息易被稀释。AttnRes 改为依据输入动态聚合前面所有层的输出,每层仅新增一个 RMSNorm 和一个伪查询向量,参数开销可忽略,却带来约 25% 训练效率提升,代价不到 2%。伪查询向量初始化为零,训练初期等价于均匀平均。
Per-Head Muon 与 Stable LatentMoE
Per-Head Muon 让每个注意力头独立优化,收敛路径更自适应。MoE 层拥有 896 个路由专家,每 token 激活 16 个(稀疏度约 1.8%),配合 Quantile Balancing 均衡策略与 MoonEP 通信库,从数学上证明冗余专家数理论上界,保证负载均衡可行性。
03 三大开源 Infra:MoonEP、FlashKDA、AgentEnv
月之暗面没有只发权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施一并开源,这也是本次发布在开发者社区获得较高评价的重要原因。
| 技术 | 定位 | 关键能力 |
|---|---|---|
| MoonEP | 超大规模细粒度 MoE 高性能通信库 | 临时复制过载专家,保证每计算节点均等 token 数;证明冗余专家数理论上界,负载不均衡时仍维持高通信效率 |
| FlashKDA | 基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源) | NVIDIA H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端,无需改代码 |
| AgentEnv | 与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM) | 面向大规模并行 Agent RL 训练;checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据,尚未第三方独立复现) |
这不只是「甩权重」,而是整套工程能力的公开——对想复现 MoE 训练路径的研究团队而言,价值不亚于权重本身。
04 跑分对比:Kimi K3 vs GPT-5.6、Claude、GLM-4.5
不同机构、不同评测框架数字差异较大,以下优先引用独立第三方复测数据。
| 模型 | 分数 | 发布日期 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Artificial Analysis 智能指数(max 推理档):Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(约 57,全球第 3、开源模型第 1)、GLM-5.2(51)、DeepSeek V4 Pro(44)。
Kimi K3 是开源 3T 级模型中综合能力最强的一个,但成本并非最优——每任务约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜 60%,但比 GLM-5.2(约 $0.47/任务)更贵。简单说:开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。
| Token 类型 | 价格 |
|---|---|
| 输入(缓存命中) | $0.30 |
| 输入(缓存未命中) | $3.00 |
| 输出(含推理过程) | $15.00 |
Mooncake 分离式推理架构在典型编程工作负载上缓存命中率可达 90% 以上,实际大部分调用成本更接近 $0.30 档,而非 $3 表头价格。
05 开放权重许可解读、六步接入与可引用数据
许可证是本次发布争议最大、也最值得企业用户仔细阅读的部分。两道此前 K2 系列都没有的商业门槛:
- Model-as-a-Service 收入门槛:若被许可方运营 MaaS 业务,且连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议。
- 规模展示门槛:若产品月活超过 1 亿,或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样。
对绝大多数中小团队而言,两道门槛几乎不会被触发,可正常商用;但若商业计划是「拿 K3 开和月之暗面竞争的模型服务」,第一道门槛是法务重点红线。
六步立即接入 Kimi K3:
- 网页零门槛试用:访问 kimi.com,注册账号即可在线调用 K3。
- 申请 API Key:在 platform.moonshot.ai 创建密钥并充值。
- 配置 OpenAI 兼容客户端:设置
base_url="https://api.moonshot.ai/v1",模型 ID 为kimi-k3。 - 发送首条测试请求:用短 prompt 验证连通性与延迟。
- OpenRouter 备选:调用
moonshotai/kimi-k3,目前已有 7 家服务商上线,定价大多与官方一致。 - 评估自部署可行性:权重已在 Hugging Face 开放(约 1.56TB),官方建议 64 卡以上超节点;个人开发者更现实的路径是 API 或第三方托管。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "分析这段代码的潜在 bug..."}]
)
可引用硬核数据(来源:Moonshot 官方、Vals AI、Artificial Analysis,2026-07-28):
- 总参数量:2.8 万亿,全球首个完整开放的 3T 级模型
- MoE 稀疏度:896 专家 / 激活 16 个 = 1.8% 激活率
- 权重体积:约 1.56TB(Hugging Face),上线 30 分钟登顶趋势榜第一
- SWE-bench Verified:独立复测 93.4%,开源模型阵营领先
- Artificial Analysis 指数:约 57,全球第 3、开源第 1
- FlashKDA 加速:H20 上 prefill 1.72–2.22 倍于基线
- API 缓存命中价:$0.30/M 输入,编程场景命中率 90%+
- 自部署门槛:官方建议 64 卡以上超节点集群
06 常见问题、中美 AI 竞赛背景与生产环境收束
Q:Kimi K3 真的是开源模型吗?
A:严格来说不是。它属于「开放权重」模型:权重、技术报告和部分 Infra 工具公开,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。
Q:Kimi K3 可以免费商用吗?
A:可以,绝大多数商业场景不受限制。但若运营 MaaS 业务且年收入超 2000 万美元,或月活超 1 亿/月收入超 2000 万美元,需满足许可证特定条款。
Q:需要多少显卡才能自己部署?
A:官方建议 64 卡以上超节点,个人和大部分企业更现实的方式是官方 API 或 OpenRouter 等第三方平台。
Q:性能到底强不强?
A:开源模型阵营综合能力最强,Artificial Analysis 全球第 3;但成本高于 GLM-5.2,属于「天花板最高、非性价比最优」。
Q:K3 和 K2 有什么区别?
A:K3 参数规模约为 K2.5 的 3 倍,新增 AttnRes 和 Per-Head Muon,上下文与多模态大幅提升;许可证新增 MaaS 收入门槛,商业限制比 K2 更细化。
Kimi K3 的开源节点并非孤立事件。它卡在 WAIC 2026 窗口期,叠加正在升级的中美「模型蒸馏」争端——权重开源前几天美方指控月之暗面「工业化蒸馏」Anthropic 模型,中国商务部 7 月 28 日公开回应。三天后,阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。
纯 API 调用虽可快速接入 K3,但面临长上下文 Agent 在共享 VPS 上内存不足、多轮 coding 流水线缺乏 7×24 稳定宿主,以及1.56TB 权重自部署需超算集群三大隐性成本。对于需要持续运行 Kimi Code 类 Agent、整库分析与 MCP Server 的生产环境,JEXCLOUD 多区域裸金属 Mac是更优解:独占 Apple Silicon 统一内存、无超卖抖动、launchd 常驻 Agent 网关,120 秒交付。节点与价格见 JEXCLOUD 定价页。