AI Agent 開放權重 2026.07.28

Kimi K3 全面開源:2.8萬億參數、百萬上下文,月之暗面這次放了什麼大招

2026 年 7 月 27 日,月之暗面(Moonshot AI)依承諾在 Hugging Face 正式釋出 Kimi K3 完整 2.8 萬億(2.8T)開放權重——距 7 月 16 日 API 上線僅 11 天。這是全球首個可下載的超 2T 級開源權重模型,配合 1040 億(104B)啟用參數100 萬 token 上下文與原生視覺,標誌中國 AI 開源生態從「低價換市場」邁向「挑戰智慧前沿」。

面向 AI 開發者、基礎設施工程師與模型選型決策者,本文將回答三件事:① 從 API 到權重的 11 天時間線、規格與 KDA / AttnRes / Stable LatentMoE 架構;② SWE-bench Verified 93.4%、Artificial Analysis 指數約 57 的基準解讀,以及「開放權重非開源」的授權門檻;③ 七步接入/自架指南、中美蒸餾爭議背景,以及與 K3 蒸餾門7 月 16 日深度評測的銜接。資料截至 2026-07-28。

01 Kimi K3 全面開源:11 天從 API 到權重釋出了什麼?

一句話定義:2026 年 7 月 27 日,月之暗面正式開放 Kimi K3 完整權重——2.8T 總參數、稀疏 MoE 架構下 896 個專家 / 每次推理啟用 16 個(啟用參數約 104B)、100 萬 token 上下文。這是迄今參數規模最大的可下載開源權重,也是首個突破 2 萬億門檻的開放模型。

關鍵時間線:

  • 2026-07-16:API 與 Kimi.com 悄然上線 K3,無大型發布會;
  • 2026-07-17 至 20 日WAIC 2026 世界人工智慧大會,K3 成中國 AI 陣營焦點;
  • 2026-07-24 至 25 日:白宮指控 K3 蒸餾 Claude、獨立研究者發現 K3 自稱 Claude——詳見本站蒸餾門全解
  • 2026-07-27:Hugging Face 釋出完整 MXFP4 權重,同步 vLLM / SGLang 推理支援;
  • 距 API 上線僅 11 天,外部研究者終於可獨立驗證架構與跑分。

開發者當前面臨的核心痛點:

  • 權重空窗期:7 月 16 日至 27 日僅能透過 API 試用,無法審計模型內部行為或做私有化微調;
  • 自架硬體門檻:完整權重推理需 64+ GPU 超節點,遠超一般企業算力預算;
  • 授權模糊地帶:「開放權重」≠「開源」,$2000 萬 MaaS 營收門檻1 億 MAU 歸屬條款讓商用合規複雜化;
  • 地緣合規風險:中美蒸餾爭議疊加,企業選型需同時評估技術與供應鏈;
  • 競品追趕:阿里 Qwen3.8-Max-Preview 同期發布,開源賽道不再是一家獨大。

11 天的權重空窗,讓 K3 在「強到可疑」的質疑聲中完成了 API 搶佔;7 月 27 日的釋出,則把驗證球踢回開源社群——是工程創新,還是蒸餾產物,權重會說話。

02 KDA / AttnRes / LatentMoE 與 MoonEP 基礎設施

Kimi Delta Attention(KDA)

傳統 Full Attention 在長上下文下 KV 快取記憶體呈平方級成長。KDA 是混合線性注意力機制,以 3:1 比例交替線性層與全注意力層,KV 快取記憶體減少高達 75%,百萬 token 解碼速度提升 6.3 倍

Attention Residuals(AttnRes)

AttnRes 改造殘差連接,引入選擇性檢索——模型可跨越深度直接拉取更早層的高價值表徵,訓練效率提升約 25%,額外計算開銷不足 2%。

Stable LatentMoE 與 Per-Head Muon

K3 共 896 個專家,每次推理啟用 16 個(稀疏度 1.8%),啟用參數約 104B。配套技術如下:

Stable LatentMoE 配套技術一覽
技術 作用
Quantile Balancing從路由器得分分位數推導專家分配,消除啟發式超參
Per-Head Muon針對每個注意力頭獨立最佳化,使大規模訓練更自適應
Sigmoid Tanh Unit(SiTU)改進激活函數控制
Gated MLA提升注意力選擇性

MoonEP、FlashKDA 與 AgentEnv 推理基礎設施

月之暗面同步開源推理棧三件套,支撐 K3 在 Agent 場景下的低延遲部署:

  • MoonEP:Expert Parallelism 通訊最佳化框架,降低 MoE 跨節點 All-to-All 開銷;
  • FlashKDA:KDA 算子的 CUDA/Triton 融合實作,長上下文解碼吞吐提升可觀;
  • AgentEnv:標準化 Agent 工具呼叫與沙箱執行環境,對接 Kimi Code 類 coding agent 工作流。

綜合架構創新,K3 相較 Kimi K2 整體擴展效率提升約 2.5 倍——這解釋了為何 2.8T 級模型能在 11 天內從 API 過渡到可部署權重。

03 SWE-bench Verified 93.4% 與「開放權重非開源」授權解讀

K3 核心基準與競品對照(Moonshot 官方自報,2026-07-27)
基準測試 Kimi K3 Claude Fable 5 GPT-5.6 Sol Qwen3.8-Max-Preview DeepSeek V4 Pro
SWE-bench Verified93.4%~95%未單獨公布~88%80.6%
Program Bench77.876.877.674.263.7
SWE Marathon42.035.039.028.513.0
Terminal Bench 2.188.384.688.885.182.7
Artificial Analysis Index v4.1~5759.958.954.248.6
GPQA-Diamond93.592.694.191.891.2

解讀重點:

  • SWE-bench Verified(93.4%):測量真實 GitHub 倉庫 Bug 修復,K3 在開源權重中位居前列,逼近閉源 Fable 5;
  • SWE Marathon(42.0):持續長程式碼任務第一,最接近真實「寫程式碼數小時」場景;
  • Artificial Analysis Index(~57):綜合智慧指數排名第四,緊隨 Fable 5 與 GPT-5.6 Sol;
  • Qwen3.8-Max-Preview:阿里同期發布,SWE-bench 約 88%,在開源陣營形成直接競爭。

上述為 Moonshot 自報資料,各模型使用不同推理 harness(K3 用 Kimi Code,GPT 用 Codex,Claude 用 Claude Code)。7 月 27 日權重釋出後,獨立第三方復現仍在進行中。

授權條款:開放權重 ≠ 開源

K3 採 Modified MIT 授權,關鍵限制如下:

Kimi K3 授權與商用門檻
條款 內容 影響對象
開放權重釋出 MXFP4 權重 + 推理程式碼研究、微調、私有化部署
非完整開源未公開訓練程式碼與完整資料集無法從零復現訓練
$20M MaaS 門檻年 MaaS 營收超過 2000 萬美元需聯繫 Moonshot 取得商用授權大型雲端 MaaS 供應商
1 億 MAU 歸屬月活超過 1 億的產品需標註「Powered by Kimi K3」超級 App 與平台型產品

04 API 定價對比與七步接入/自架指南

API 定價與上下文視窗對比
模型 快取命中輸入 輸入($/M) 輸出($/M) 上下文
Kimi K3$0.30$3.00$15.001M
Claude Sonnet 5$3.00$15.00200K
Claude Opus 5$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$0.145$1.74$3.48128K
Qwen3.8-Max-Preview$2.50$10.00256K

K3 標準價與 Claude Sonnet 5 持平($3/$15),但上下文為 5 倍;程式設計場景快取命中率超 90%,實際有效輸入成本可降至約 $0.55/M。三檔定價:$0.30(快取命中)/ $3(標準輸入)/ $15(輸出)每百萬 token。

七步立即接入 Kimi K3:

  1. 網頁/App 零門檻試用:造訪 kimi.com,Google 帳號註冊,K3 預設最大推理力度執行。
  2. 申請 API Key:在 platform.kimi.ai 建立金鑰並儲值。
  3. 設定 OpenAI 相容客戶端:設定 base_url="https://api.moonshot.ai/v1",模型 ID 為 kimi-k3
  4. 發送首條測試請求:用短 prompt 驗證連通性與延遲。
  5. OpenRouter 備選:已有 OpenRouter 帳號可直接呼叫 moonshotai/kimi-k3,官方定價無加價。
  6. 下載權重並評估自架:從 Hugging Face 拉取 MXFP4 權重,搭配 vLLM/SGLang + MoonEP;完整 FP 推理需 64+ GPU 超節點,量化版門檻略低但仍需企業級叢集。
  7. 審查授權合規:若計劃以 MaaS 形式對外提供 K3 推理,確認年營收是否觸及 $2000 萬門檻及 MAU 歸屬要求。
kimi_k3_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "幫我分析這段程式碼..."}]
)

05 場景選型矩陣與可引用硬核數據

Kimi K3 vs 競品:按場景怎麼選?
場景 推薦模型 原因
持續性長程式碼任務Kimi K3SWE Marathon 基準第一,上下文最長
SWE-bench 級 Bug 修復Kimi K3SWE-bench Verified 93.4%,開源權重最高
複雜 Repo 級修 BugClaude Fable 5FrontierSWE 大幅領先
終端/工具鏈 AgentGPT-5.6 SolTerminal Bench 領先
超長文件/多模態理解Kimi K3OmniDocBench 第一,原生視覺 + 1M
成本敏感場景DeepSeek V4 Pro輸出僅 $3.48/M
開源權重自部署Kimi K32.8T 最強開放權重,7/27 已釋出
合規優先、避開地緣風險Claude Opus 5Anthropic 生態,無蒸餾爭議

可引用硬核數據(Moonshot 官方,2026-07-27):

  • 總參數量2.8 萬億,全球最大開放權重,超越 DeepSeek V4 Pro(1.6T)近 75%
  • 啟用參數104B(896 專家 / 啟用 16 個 = 1.8% 激活率)
  • SWE-bench Verified93.4%,開源權重模型最高分之一
  • Artificial Analysis Index:約 57 分,綜合智慧排名第四
  • KDA 效率:KV 快取減 75%,百萬 token 解碼快 6.3 倍
  • API 三檔定價:快取命中 $0.30 / 標準輸入 $3 / 輸出 $15 每百萬 token
  • 自架門檻:完整 FP 推理需 64+ GPU 超節點;MXFP4 量化版搭配 MoonEP 可降低通訊開銷
  • 釋出時間線:API(7/16)→ 權重(7/27),間隔僅 11 天

06 FAQ、中美蒸餾爭議與生產環境收束

Q:Kimi K3 是開源還是開放權重?
A:開放權重(Open Weight),非完整開源。Moonshot 釋出權重與推理程式碼,但未公開訓練程式碼與資料集。商用需遵守 Modified MIT;年 MaaS 營收超 $2000 萬或 MAU 超 1 億有額外條款。

Q:本地部署需要多少 GPU?
A:完整 FP 權重需 64+ 加速卡超節點;MXFP4 量化版門檻略低,但仍遠超消費級硬體。多數團隊應優先 API 或 OpenRouter。

Q:K3 真的蒸餾了 Claude 嗎?
A:截至 7 月 28 日仍是有爭議、未被最終證實的指控。7 月 27 日權重釋出後,社群可審計權重結構;但 Ryan Greenblatt 發現 K3 自稱 Claude 並吐出內部版本號的統計證據仍待解釋。詳見蒸餾門全解

Q:K3 與 Qwen3.8-Max-Preview 怎麼比?
A:K3 參數 2.8T vs Qwen 約 1T+,SWE-bench Verified 93.4% vs ~88%,上下文 1M vs 256K;Qwen 定價更低($2.50/$10),適合成本敏感且不需極長上下文的場景。

Q:1M 上下文真的實用嗎?
A:整庫分析、長篇法律/科研文件、多輪 Agent 記憶場景價值顯著;K3 統一定價無長度附加費。

Q:WAIC 2026 對 K3 釋出有什麼影響?
A:WAIC 期間 K3 成中國 AI 旗艦展示,7 月 27 日按時釋出權重強化了「說到做到」的信譽——也讓全球開源社群首次能獨立驗證此前僅存在於 API 的跑分。

Kimi K3 全面開源不是參數堆砌的面子工程——KDA、AttnRes、Stable LatentMoE、MoonEP 代表真實工程創新;SWE-bench Verified 93.4% 與 Artificial Analysis 指數約 57 證明其在程式設計 Agent 賽道對標乃至超越部分閉源旗艦。11 天從 API 到權重的節奏,則向全球宣示:中國 AI 開源生態正從「低價換市場」轉向「挑戰智慧前沿」。

純 API 呼叫雖可快速接入 K3,但面臨長上下文 Agent 在共享 VPS 上記憶體不足多輪 coding 流水線缺乏 7×24 穩定宿主,以及64 GPU 超節點自架成本動輒數百萬美元三大隱性成本。對於需要持續執行 Kimi Code 類 Agent、整庫分析與 MCP Server 的生產環境,JEXCLOUD 多區域裸機 Mac是更優解:獨占 Apple Silicon 統一記憶體、無超賣抖動、launchd 常駐 Agent 閘道,120 秒交付。節點與價格見 JEXCLOUD 定價頁