AI Agent 开放权重 2026.07.28

Kimi K3 全面开源:2.8万亿参数、百万上下文, 月之暗面这次放了什么大招

7 月 27 日晚 23 点左右,月之暗面(Moonshot AI)正式发布 Kimi K3 完整模型权重与技术报告,并同步开源 MoonEPFlashKDAAgentEnv 三项核心基础设施。这是全球首个被完整开放的 3 万亿参数级别模型——2.8 万亿总参数、100 万 token上下文、约 1.56TB Hugging Face 下载体积,上线半小时内登顶趋势榜第一。

面向模型选型决策者、AI 开发者与企业法务,本文将回答三件事:① 从 7 月 16 日 API 首发到 7 月 27 日权重开放仅 11 天,开放权重(open weight)与媒体口中的「开源」有何本质区别;② KDA、AttnRes、Per-Head Muon 等架构创新及三项 Infra 技术如何支撑百万上下文;③ 与 GPT-5.6、Claude 的独立基准对比、商用许可两道门槛,以及 API / 自部署的六步实操路径。数据截止 2026-07-28。

01 11 天从 API 首发到全面开放权重:时间线与核心痛点

这次权重开放距离 Kimi K3 在 kimi.com 和 API 端首发,只过去了 11 天。关键节点如下:

  • 7 月 16 日夜(WAIC 2026 前夜):Kimi K3 在 kimi.com、Kimi Work、Kimi Code 及 Kimi API 首发,权重尚未公开。
  • 7 月 17 日:行业密集分析架构;新华社报道称其为「目前全球参数最大的开源模型」。
  • 7 月 22–23 日:中美「模型蒸馏」争端升级。白宫科技顾问 Michael Kratsios 指控月之暗面对 Anthropic Fable 模型进行「工业化蒸馏」;美国财政部长 Scott Bessent 表示将考虑制裁及实体清单限制。详见 K3 蒸馏门全解
  • 7 月 27 日晚 23 点:完整权重、技术报告发布;MoonEP、AgentEnv 开源(FlashKDA 此前已开源)。
  • 7 月 28 日:中国商务部公开回应,指责美方「AI 霸权主义」;国内媒体跟进报道开源细节。

开发者与企业用户当前面临的核心痛点:

  • 语义混淆:媒体普遍称「开源」,但月之暗面官方始终使用 open weight,训练数据与完整训练代码并未公开。
  • 许可不确定性:K3 许可证不再自称 Modified MIT,新增 Model-as-a-Service 收入门槛与规模展示门槛,法务需重新评估。
  • 部署门槛极高:2.8T 参数、896 专家规模决定自部署需 64 卡以上超节点,个人开发者几乎无法本地运行。
  • 基准数据分歧:厂商自报与独立第三方复测差异大,需优先引用 Vals AI、Artificial Analysis 等中立数据。

月之暗面官方材料从未使用「open source」,一直采用「open weight」表述——这与国内媒体翻译存在语义落差,也是企业合规审查的第一道关卡。

02 Kimi K3 核心参数一览与三大架构创新

Kimi K3 核心参数一览
项目 参数
总参数量2.8 万亿(2.8T)
激活参数量约 1040 亿
架构类型混合专家模型(MoE)
专家配置896 个路由专家,每 token 激活 16 个(另有共享专家)
注意力机制Kimi Delta Attention(KDA)+ 门控多头潜在注意力(Gated MLA)
上下文窗口100 万 token
多模态能力原生视觉理解(ViT-V2,27 层)
权重格式MXFP4 权重 + MXFP8 激活(SFT 阶段起量化感知训练)
权重体积约 1.56TB(Hugging Face)
License自定义许可证(官方称 open weight,非 open source)

Kimi Delta Attention(KDA):逐通道精细遗忘

传统 Gated DeltaNet 使用标量级遗忘门,整段记忆共用同一衰减系数。KDA 改为逐通道门控:每个特征维度拥有独立衰减率,某些特征长期保留、另一些快速遗忘。KDA 采用 chunkwise 的 Diagonal-Plus-Low-Rank(DPLR)公式实现线性时间递归,大幅降低长序列 KV Cache 开销。K3 将 KDA 与少量全局注意力层(Gated MLA)交替混合,是支撑 100 万 token 上下文的核心。

Attention Residuals(AttnRes):选择性残差聚合

传统残差连接逐层均匀累加,深层网络中早期层信息易被稀释。AttnRes 改为依据输入动态聚合前面所有层的输出,每层仅新增一个 RMSNorm 和一个伪查询向量,参数开销可忽略,却带来约 25% 训练效率提升,代价不到 2%。伪查询向量初始化为零,训练初期等价于均匀平均。

Per-Head Muon 与 Stable LatentMoE

Per-Head Muon 让每个注意力头独立优化,收敛路径更自适应。MoE 层拥有 896 个路由专家,每 token 激活 16 个(稀疏度约 1.8%),配合 Quantile Balancing 均衡策略与 MoonEP 通信库,从数学上证明冗余专家数理论上界,保证负载均衡可行性。

03 三大开源 Infra:MoonEP、FlashKDA、AgentEnv

月之暗面没有只发权重文件,而是把支撑 K3 训练效率与稳定性的三项关键基础设施一并开源,这也是本次发布在开发者社区获得较高评价的重要原因。

三大开源基础设施技术对比
技术 定位 关键能力
MoonEP超大规模细粒度 MoE 高性能通信库临时复制过载专家,保证每计算节点均等 token 数;证明冗余专家数理论上界,负载不均衡时仍维持高通信效率
FlashKDA基于 NVIDIA CUTLASS 的 KDA 高性能算子(此前已开源)NVIDIA H20 上 prefill 比 flash-linear-attention 基线快 1.72–2.22 倍;可作为 chunk_kda 直接替代后端,无需改代码
AgentEnv与 KVCache.ai 联合开发的 Agent 沙箱(Firecracker microVM)面向大规模并行 Agent RL 训练;checkpoint 延迟低至 133ms、恢复 49ms、内存超分最高 6.5 倍(官方数据,尚未第三方独立复现)

这不只是「甩权重」,而是整套工程能力的公开——对想复现 MoE 训练路径的研究团队而言,价值不亚于权重本身。

04 跑分对比:Kimi K3 vs GPT-5.6、Claude、GLM-4.5

不同机构、不同评测框架数字差异较大,以下优先引用独立第三方复测数据。

SWE-bench Verified(独立复测,Vals AI,截至 2026 年 7 月)
模型 分数 发布日期
Claude Opus 597%2026-07-24
GPT-5.6 Sol96.2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393.4%2026-07-16
Qwen3.7-Max79.4%2026-05-19
DeepSeek-V476.2%2026-04-23

Artificial Analysis 智能指数(max 推理档):Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(约 57,全球第 3、开源模型第 1)、GLM-5.2(51)、DeepSeek V4 Pro(44)。

Kimi K3 是开源 3T 级模型中综合能力最强的一个,但成本并非最优——每任务约 $0.95,比 Claude Fable 5(约 $2.4/任务)便宜 60%,但比 GLM-5.2(约 $0.47/任务)更贵。简单说:开源阵营能力天花板最高,而非性价比最优。K3 目前在 Arena.ai Frontend Code Arena 榜单排名第一。

Kimi K3 官方 API 定价(每百万 token)
Token 类型 价格
输入(缓存命中)$0.30
输入(缓存未命中)$3.00
输出(含推理过程)$15.00

Mooncake 分离式推理架构在典型编程工作负载上缓存命中率可达 90% 以上,实际大部分调用成本更接近 $0.30 档,而非 $3 表头价格。

05 开放权重许可解读、六步接入与可引用数据

许可证是本次发布争议最大、也最值得企业用户仔细阅读的部分。两道此前 K2 系列都没有的商业门槛:

  • Model-as-a-Service 收入门槛:若被许可方运营 MaaS 业务,且连续 12 个月累计收入超过 2000 万美元,须与月之暗面另行签署商业协议。
  • 规模展示门槛:若产品月活超过 1 亿,或月收入超过 2000 万美元,须在界面显著展示「Kimi K3」字样。

对绝大多数中小团队而言,两道门槛几乎不会被触发,可正常商用;但若商业计划是「拿 K3 开和月之暗面竞争的模型服务」,第一道门槛是法务重点红线。

六步立即接入 Kimi K3:

  1. 网页零门槛试用:访问 kimi.com,注册账号即可在线调用 K3。
  2. 申请 API Key:在 platform.moonshot.ai 创建密钥并充值。
  3. 配置 OpenAI 兼容客户端:设置 base_url="https://api.moonshot.ai/v1",模型 ID 为 kimi-k3
  4. 发送首条测试请求:用短 prompt 验证连通性与延迟。
  5. OpenRouter 备选:调用 moonshotai/kimi-k3,目前已有 7 家服务商上线,定价大多与官方一致。
  6. 评估自部署可行性:权重已在 Hugging Face 开放(约 1.56TB),官方建议 64 卡以上超节点;个人开发者更现实的路径是 API 或第三方托管。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "分析这段代码的潜在 bug..."}]
)

可引用硬核数据(来源:Moonshot 官方、Vals AI、Artificial Analysis,2026-07-28):

  • 总参数量:2.8 万亿,全球首个完整开放的 3T 级模型
  • MoE 稀疏度:896 专家 / 激活 16 个 = 1.8% 激活率
  • 权重体积:约 1.56TB(Hugging Face),上线 30 分钟登顶趋势榜第一
  • SWE-bench Verified:独立复测 93.4%,开源模型阵营领先
  • Artificial Analysis 指数:约 57,全球第 3、开源第 1
  • FlashKDA 加速:H20 上 prefill 1.72–2.22 倍于基线
  • API 缓存命中价:$0.30/M 输入,编程场景命中率 90%+
  • 自部署门槛:官方建议 64 卡以上超节点集群

06 常见问题、中美 AI 竞赛背景与生产环境收束

Q:Kimi K3 真的是开源模型吗?
A:严格来说不是。它属于「开放权重」模型:权重、技术报告和部分 Infra 工具公开,但训练数据和完整训练代码没有公开,不符合 OSI 标准下的「开源」定义。

Q:Kimi K3 可以免费商用吗?
A:可以,绝大多数商业场景不受限制。但若运营 MaaS 业务且年收入超 2000 万美元,或月活超 1 亿/月收入超 2000 万美元,需满足许可证特定条款。

Q:需要多少显卡才能自己部署?
A:官方建议 64 卡以上超节点,个人和大部分企业更现实的方式是官方 API 或 OpenRouter 等第三方平台。

Q:性能到底强不强?
A:开源模型阵营综合能力最强,Artificial Analysis 全球第 3;但成本高于 GLM-5.2,属于「天花板最高、非性价比最优」。

Q:K3 和 K2 有什么区别?
A:K3 参数规模约为 K2.5 的 3 倍,新增 AttnRes 和 Per-Head Muon,上下文与多模态大幅提升;许可证新增 MaaS 收入门槛,商业限制比 K2 更细化。

Kimi K3 的开源节点并非孤立事件。它卡在 WAIC 2026 窗口期,叠加正在升级的中美「模型蒸馏」争端——权重开源前几天美方指控月之暗面「工业化蒸馏」Anthropic 模型,中国商务部 7 月 28 日公开回应。三天后,阿里巴巴发布 24 万亿参数的 Qwen3.8-Max-Preview,国产大模型竞争正式进入「3T 俱乐部」阶段。

纯 API 调用虽可快速接入 K3,但面临长上下文 Agent 在共享 VPS 上内存不足多轮 coding 流水线缺乏 7×24 稳定宿主,以及1.56TB 权重自部署需超算集群三大隐性成本。对于需要持续运行 Kimi Code 类 Agent、整库分析与 MCP Server 的生产环境,JEXCLOUD 多区域裸金属 Mac是更优解:独占 Apple Silicon 统一内存、无超卖抖动、launchd 常驻 Agent 网关,120 秒交付。节点与价格见 JEXCLOUD 定价页