Kimi K3 全面開源:2.8萬億參數、百萬上下文,月之暗面這次放了什麼大招
2026 年 7 月 27 日,月之暗面(Moonshot AI)依承諾在 Hugging Face 正式釋出 Kimi K3 完整 2.8 萬億(2.8T)開放權重——距 7 月 16 日 API 上線僅 11 天。這是全球首個可下載的超 2T 級開源權重模型,配合 1040 億(104B)啟用參數、100 萬 token 上下文與原生視覺,標誌中國 AI 開源生態從「低價換市場」邁向「挑戰智慧前沿」。
面向 AI 開發者、基礎設施工程師與模型選型決策者,本文將回答三件事:① 從 API 到權重的 11 天時間線、規格與 KDA / AttnRes / Stable LatentMoE 架構;② SWE-bench Verified 93.4%、Artificial Analysis 指數約 57 的基準解讀,以及「開放權重非開源」的授權門檻;③ 七步接入/自架指南、中美蒸餾爭議背景,以及與 K3 蒸餾門、7 月 16 日深度評測的銜接。資料截至 2026-07-28。
01 Kimi K3 全面開源:11 天從 API 到權重釋出了什麼?
一句話定義:2026 年 7 月 27 日,月之暗面正式開放 Kimi K3 完整權重——2.8T 總參數、稀疏 MoE 架構下 896 個專家 / 每次推理啟用 16 個(啟用參數約 104B)、100 萬 token 上下文。這是迄今參數規模最大的可下載開源權重,也是首個突破 2 萬億門檻的開放模型。
關鍵時間線:
- 2026-07-16:API 與 Kimi.com 悄然上線 K3,無大型發布會;
- 2026-07-17 至 20 日:WAIC 2026 世界人工智慧大會,K3 成中國 AI 陣營焦點;
- 2026-07-24 至 25 日:白宮指控 K3 蒸餾 Claude、獨立研究者發現 K3 自稱 Claude——詳見本站蒸餾門全解;
- 2026-07-27:Hugging Face 釋出完整 MXFP4 權重,同步 vLLM / SGLang 推理支援;
- 距 API 上線僅 11 天,外部研究者終於可獨立驗證架構與跑分。
開發者當前面臨的核心痛點:
- 權重空窗期:7 月 16 日至 27 日僅能透過 API 試用,無法審計模型內部行為或做私有化微調;
- 自架硬體門檻:完整權重推理需 64+ GPU 超節點,遠超一般企業算力預算;
- 授權模糊地帶:「開放權重」≠「開源」,$2000 萬 MaaS 營收門檻與 1 億 MAU 歸屬條款讓商用合規複雜化;
- 地緣合規風險:中美蒸餾爭議疊加,企業選型需同時評估技術與供應鏈;
- 競品追趕:阿里 Qwen3.8-Max-Preview 同期發布,開源賽道不再是一家獨大。
11 天的權重空窗,讓 K3 在「強到可疑」的質疑聲中完成了 API 搶佔;7 月 27 日的釋出,則把驗證球踢回開源社群——是工程創新,還是蒸餾產物,權重會說話。
02 KDA / AttnRes / LatentMoE 與 MoonEP 基礎設施
Kimi Delta Attention(KDA)
傳統 Full Attention 在長上下文下 KV 快取記憶體呈平方級成長。KDA 是混合線性注意力機制,以 3:1 比例交替線性層與全注意力層,KV 快取記憶體減少高達 75%,百萬 token 解碼速度提升 6.3 倍。
Attention Residuals(AttnRes)
AttnRes 改造殘差連接,引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵,訓練效率提升約 25%,額外計算開銷不足 2%。
Stable LatentMoE 與 Per-Head Muon
K3 共 896 個專家,每次推理啟用 16 個(稀疏度 1.8%),啟用參數約 104B。配套技術如下:
| 技術 | 作用 |
|---|---|
| Quantile Balancing | 從路由器得分分位數推導專家分配,消除啟發式超參 |
| Per-Head Muon | 針對每個注意力頭獨立最佳化,使大規模訓練更自適應 |
| Sigmoid Tanh Unit(SiTU) | 改進激活函數控制 |
| Gated MLA | 提升注意力選擇性 |
MoonEP、FlashKDA 與 AgentEnv 推理基礎設施
月之暗面同步開源推理棧三件套,支撐 K3 在 Agent 場景下的低延遲部署:
- MoonEP:Expert Parallelism 通訊最佳化框架,降低 MoE 跨節點 All-to-All 開銷;
- FlashKDA:KDA 算子的 CUDA/Triton 融合實作,長上下文解碼吞吐提升可觀;
- AgentEnv:標準化 Agent 工具呼叫與沙箱執行環境,對接 Kimi Code 類 coding agent 工作流。
綜合架構創新,K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍——這解釋了為何 2.8T 級模型能在 11 天內從 API 過渡到可部署權重。
03 SWE-bench Verified 93.4% 與「開放權重非開源」授權解讀
| 基準測試 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Qwen3.8-Max-Preview | DeepSeek V4 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified | 93.4% | ~95% | 未單獨公布 | ~88% | 80.6% |
| Program Bench | 77.8 | 76.8 | 77.6 | 74.2 | 63.7 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 28.5 | 13.0 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 85.1 | 82.7 |
| Artificial Analysis Index v4.1 | ~57 | 59.9 | 58.9 | 54.2 | 48.6 |
| GPQA-Diamond | 93.5 | 92.6 | 94.1 | 91.8 | 91.2 |
解讀重點:
- SWE-bench Verified(93.4%):測量真實 GitHub 倉庫 Bug 修復,K3 在開源權重中位居前列,逼近閉源 Fable 5;
- SWE Marathon(42.0):持續長程式碼任務第一,最接近真實「寫程式碼數小時」場景;
- Artificial Analysis Index(~57):綜合智慧指數排名第四,緊隨 Fable 5 與 GPT-5.6 Sol;
- Qwen3.8-Max-Preview:阿里同期發布,SWE-bench 約 88%,在開源陣營形成直接競爭。
上述為 Moonshot 自報資料,各模型使用不同推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。7 月 27 日權重釋出後,獨立第三方復現仍在進行中。
授權條款:開放權重 ≠ 開源
K3 採 Modified MIT 授權,關鍵限制如下:
| 條款 | 內容 | 影響對象 |
|---|---|---|
| 開放權重 | 釋出 MXFP4 權重 + 推理程式碼 | 研究、微調、私有化部署 |
| 非完整開源 | 未公開訓練程式碼與完整資料集 | 無法從零復現訓練 |
| $20M MaaS 門檻 | 年 MaaS 營收超過 2000 萬美元需聯繫 Moonshot 取得商用授權 | 大型雲端 MaaS 供應商 |
| 1 億 MAU 歸屬 | 月活超過 1 億的產品需標註「Powered by Kimi K3」 | 超級 App 與平台型產品 |
04 API 定價對比與七步接入/自架指南
| 模型 | 快取命中輸入 | 輸入($/M) | 輸出($/M) | 上下文 |
|---|---|---|---|---|
| Kimi K3 | $0.30 | $3.00 | $15.00 | 1M |
| Claude Sonnet 5 | — | $3.00 | $15.00 | 200K |
| Claude Opus 5 | — | $5.00 | $25.00 | 200K |
| GPT-5.5 | — | $5.00 | $30.00 | 400K |
| DeepSeek V4 Pro | $0.145 | $1.74 | $3.48 | 128K |
| Qwen3.8-Max-Preview | — | $2.50 | $10.00 | 256K |
K3 標準價與 Claude Sonnet 5 持平($3/$15),但上下文為 5 倍;程式設計場景快取命中率超 90%,實際有效輸入成本可降至約 $0.55/M。三檔定價:$0.30(快取命中)/ $3(標準輸入)/ $15(輸出)每百萬 token。
七步立即接入 Kimi K3:
- 網頁/App 零門檻試用:造訪 kimi.com,Google 帳號註冊,K3 預設最大推理力度執行。
- 申請 API Key:在 platform.kimi.ai 建立金鑰並儲值。
- 設定 OpenAI 相容客戶端:設定
base_url="https://api.moonshot.ai/v1",模型 ID 為kimi-k3。 - 發送首條測試請求:用短 prompt 驗證連通性與延遲。
- OpenRouter 備選:已有 OpenRouter 帳號可直接呼叫
moonshotai/kimi-k3,官方定價無加價。 - 下載權重並評估自架:從 Hugging Face 拉取 MXFP4 權重,搭配 vLLM/SGLang + MoonEP;完整 FP 推理需 64+ GPU 超節點,量化版門檻略低但仍需企業級叢集。
- 審查授權合規:若計劃以 MaaS 形式對外提供 K3 推理,確認年營收是否觸及 $2000 萬門檻及 MAU 歸屬要求。
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)
05 場景選型矩陣與可引用硬核數據
| 場景 | 推薦模型 | 原因 |
|---|---|---|
| 持續性長程式碼任務 | Kimi K3 | SWE Marathon 基準第一,上下文最長 |
| SWE-bench 級 Bug 修復 | Kimi K3 | SWE-bench Verified 93.4%,開源權重最高 |
| 複雜 Repo 級修 Bug | Claude Fable 5 | FrontierSWE 大幅領先 |
| 終端/工具鏈 Agent | GPT-5.6 Sol | Terminal Bench 領先 |
| 超長文件/多模態理解 | Kimi K3 | OmniDocBench 第一,原生視覺 + 1M |
| 成本敏感場景 | DeepSeek V4 Pro | 輸出僅 $3.48/M |
| 開源權重自部署 | Kimi K3 | 2.8T 最強開放權重,7/27 已釋出 |
| 合規優先、避開地緣風險 | Claude Opus 5 | Anthropic 生態,無蒸餾爭議 |
可引用硬核數據(Moonshot 官方,2026-07-27):
- 總參數量:2.8 萬億,全球最大開放權重,超越 DeepSeek V4 Pro(1.6T)近 75%
- 啟用參數:104B(896 專家 / 啟用 16 個 = 1.8% 激活率)
- SWE-bench Verified:93.4%,開源權重模型最高分之一
- Artificial Analysis Index:約 57 分,綜合智慧排名第四
- KDA 效率:KV 快取減 75%,百萬 token 解碼快 6.3 倍
- API 三檔定價:快取命中 $0.30 / 標準輸入 $3 / 輸出 $15 每百萬 token
- 自架門檻:完整 FP 推理需 64+ GPU 超節點;MXFP4 量化版搭配 MoonEP 可降低通訊開銷
- 釋出時間線:API(7/16)→ 權重(7/27),間隔僅 11 天
06 FAQ、中美蒸餾爭議與生產環境收束
Q:Kimi K3 是開源還是開放權重?
A:開放權重(Open Weight),非完整開源。Moonshot 釋出權重與推理程式碼,但未公開訓練程式碼與資料集。商用需遵守 Modified MIT;年 MaaS 營收超 $2000 萬或 MAU 超 1 億有額外條款。
Q:本地部署需要多少 GPU?
A:完整 FP 權重需 64+ 加速卡超節點;MXFP4 量化版門檻略低,但仍遠超消費級硬體。多數團隊應優先 API 或 OpenRouter。
Q:K3 真的蒸餾了 Claude 嗎?
A:截至 7 月 28 日仍是有爭議、未被最終證實的指控。7 月 27 日權重釋出後,社群可審計權重結構;但 Ryan Greenblatt 發現 K3 自稱 Claude 並吐出內部版本號的統計證據仍待解釋。詳見蒸餾門全解。
Q:K3 與 Qwen3.8-Max-Preview 怎麼比?
A:K3 參數 2.8T vs Qwen 約 1T+,SWE-bench Verified 93.4% vs ~88%,上下文 1M vs 256K;Qwen 定價更低($2.50/$10),適合成本敏感且不需極長上下文的場景。
Q:1M 上下文真的實用嗎?
A:整庫分析、長篇法律/科研文件、多輪 Agent 記憶場景價值顯著;K3 統一定價無長度附加費。
Q:WAIC 2026 對 K3 釋出有什麼影響?
A:WAIC 期間 K3 成中國 AI 旗艦展示,7 月 27 日按時釋出權重強化了「說到做到」的信譽——也讓全球開源社群首次能獨立驗證此前僅存在於 API 的跑分。
Kimi K3 全面開源不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE、MoonEP 代表真實工程創新;SWE-bench Verified 93.4% 與 Artificial Analysis 指數約 57 證明其在程式設計 Agent 賽道對標乃至超越部分閉源旗艦。11 天從 API 到權重的節奏,則向全球宣示:中國 AI 開源生態正從「低價換市場」轉向「挑戰智慧前沿」。
純 API 呼叫雖可快速接入 K3,但面臨長上下文 Agent 在共享 VPS 上記憶體不足、多輪 coding 流水線缺乏 7×24 穩定宿主,以及64 GPU 超節點自架成本動輒數百萬美元三大隱性成本。對於需要持續執行 Kimi Code 類 Agent、整庫分析與 MCP Server 的生產環境,JEXCLOUD 多區域裸機 Mac是更優解:獨占 Apple Silicon 統一記憶體、無超賣抖動、launchd 常駐 Agent 閘道,120 秒交付。節點與價格見 JEXCLOUD 定價頁。