Claude Opus 5 發布與 Kimi K3「自稱 Claude」蒸餾門:本週 AI 兩大事件全解
2026 年 7 月最後一週,AI 圈同時上演兩件大事:Anthropic 於 7 月 24 日發布日常主力模型 Claude Opus 5,以半價逼近旗艦 Fable 5 的智慧水準;而 7 月 16 日剛發布的 Kimi K3 則陷入「蒸餾門」——白宮官員公開指控月之暗面竊取 Claude 能力,獨立研究者更發現 K3 會自稱是 Claude並吐出內部部署版本號。
面向模型選型開發者與企業 Tech Lead,本文將回答三件事:① Opus 5 的定價、基準與安全政策變化;② K3 蒸餾爭議從政治喊話到 Greenblatt 技術證據的全鏈路;③ 在「性價比戰爭」背景下,如何用六步框架在 Opus 5 與 K3 之間做理性決策。更早的 K3 架構與基準解讀可參考本站Kimi K3 深度評測。
01 本週 AI 兩大事件:開發者面臨的三重選型痛點
兩件事表面無關,實則都指向同一產業主題——「性價比」與「模型能力的真實來源」。
- 痛點一:旗艦太貴,日常任務用不上。Fable 5 能力頂尖,但 $10/$50 每百萬 token 的定價讓大量 coding agent 與自動化工作流難以規模化。
- 痛點二:開源模型「強到可疑」。K3 以 2.8T 參數、GPQA-Diamond 93.5% 對標閉源前沿,但完整權重直到 7 月 27 日才放出,外部無法獨立驗證。
- 痛點三:合規與供應鏈風險疊加。白宮指控涉及蒸餾與未授權晶片;Anthropic 早在 2 月就點名月之暗面 340 萬次異常 API 互動——企業選型不能再只看跑分。
Opus 5 用「半價逼近旗艦」回應性價比訴求;K3 用「開源 + 低價 + 少拒答」衝擊市場——爭議本質上是產業在問:你的低價,到底是工程最佳化換來的,還是「白嫖」別人模型換來的?
02 Claude Opus 5 發布:不是旗艦,但可能是最值得用的 Claude
2026 年 7 月 24 日(美國太平洋時間),Anthropic 正式發布 Claude Opus 5,並同步將其設為 Claude Max 預設模型,也是 Claude Pro 使用者可用的最強版本。模型 ID 為 claude-opus-5,可在 Claude API、AWS Bedrock、Google Vertex AI、Microsoft Foundry 呼叫。
- 定價不變:輸入 $5 / 百萬 tokens,輸出 $25 / 百萬 tokens,與 Opus 4.8 完全相同;Fast 模式速度約 2.5 倍,價格 2 倍。
- 上下文:100 萬 tokens(預設且唯一檔位);最大輸出 128K tokens;Thinking 預設開啟,Effort 參數控制思考量。
- Frontier-Bench v0.1:軟體工程任務超越所有模型,表現是 Opus 4.8 的兩倍以上,且單任務成本更低。
- CursorBench 3.2:max effort 檔位與 Fable 5 峰值相差僅 0.5%,成本僅為 Fable 5 的一半;high / xhigh / max 各檔「性價比」均超過市面所有模型。
- ARC-AGI 3:新穎問題解決得分是次優模型的3 倍。
- OSWorld 2.0:用不到 Fable 5 三分之一成本,超過 Fable 5 最佳成績。
- Zapier AutomationBench:端到端商業自動化通過率約為次優模型 1.5 倍;最低 effort 檔位通過任務數仍超過其他任何模型;Zapier 稱 Opus 5 在帳戶健康工作流上達到 100% 通過率,此前模型均未通過。
生命科學方面,結構生物學、有機化學、生物資訊學全面超過 Opus 4.8——光譜反推分子結構內部測試提升 10.2 個百分點,蛋白質序列變異功能預測提升 7.7 個百分點。企業客戶 Box 報告:資料分析工作流 +11%,盡職調查 +17%,整體準確率 +8%。
安全與對齊:Opus 5 是 Anthropic 迄今最對齊的模型——欺騙行為發生率最低,最不易被誘導濫用。但在網路安全攻擊、生物安全等「高風險雙用途能力」上故意未刷新前沿,該位置仍由受限發行的 Mythos 5 佔據。網路安全分類器比 Fable 5 寬鬆約 85%,可用於原始碼級漏洞發現,仍屏蔽二進位漏洞掃描、滲透測試與 exploit 生成。
資料留存:與歷代 Opus 一致,預設存取不強制資料留存;Fable 5 / Mythos 5 則要求接受 30 天資料留存政策——對合規敏感場景,Opus 5 可能是比 Fable 5 更實用的選擇。
Cursor 團隊評價:「Claude Opus 5 delivers near Fable 5 intelligence at Opus speed and cost. On CursorBench it's just under Fable 5 and has many of the same behaviors.」
03 Claude Opus 5 和 Fable 5 哪個好?對比決策矩陣
| 維度 | Claude Opus 5 | Claude Fable 5 |
|---|---|---|
| 輸入 / 輸出定價 | $5 / $25 每百萬 tokens | 約 $10 / $50 每百萬 tokens |
| 相對成本 | 約為 Fable 5 的一半 | 旗艦定價 |
| CursorBench 3.2(max) | 與 Fable 5 峰值相差 0.5% | 峰值基準 |
| 上下文視窗 | 100 萬 tokens | 100 萬 tokens |
| 資料留存 | 預設不要求 30 天留存 | 需接受 30 天資料留存 |
| Claude Max 預設 | 是(2026-07-24 起) | 否 |
| 雙用途風險能力 | 故意未達 Mythos 5 前沿 | 更強,但 Mythos 5 為受限頂 |
| 適用場景 | 日常 coding agent、自動化、合規敏感企業 | 極限推理、FrontierSWE 等頂配任務 |
如果你之前覺得 Fable 5 效果好但太貴,Opus 5 提供了「損失極小、成本減半」的替代方案——這也是 Anthropic 對當前 AI 價格戰最直接的回應。
04 Kimi K3 蒸餾門:白宮下場,專家質疑時間線
月之暗面於 2026 年 7 月 16 日發布 Kimi K3:總參數 2.8 萬億,全球首個「3T 級」開源模型;稀疏 MoE,896 專家中每 token 啟用 16 個(約等效 500 億啟用參數);100 萬 token 上下文 + 原生視覺;架構為 Kimi Delta Attention(KDA)+ Attention Residuals + Stable LatentMoE,相較 K2 訓練效率提升約 2.5 倍。完整權重承諾 7 月 27 日放出——爭議爆發時外部尚無法獨立驗證。
| 基準 | Kimi K3 | 備註 |
|---|---|---|
| GPQA-Diamond | 93.5% | 發布時開源模型最高分 |
| Terminal-Bench 2.1 | 88.3% | 落後 GPT-5.6 Sol 0.5 分 |
| BrowseComp | 91.2% | 發布時最高分 |
| Program Bench | 77.8% | 綜合最佳 |
| SWE Marathon | 42.0% | 綜合最佳 |
| DeepSearchQA (F1) | 95.0% | — |
2026 年 7 月 22–23 日,白宮科技政策辦公室(OSTP)主任 Michael Kratsios 在 X 發文,指控月之暗面透過「大規模、隱蔽的產業級蒸餾」竊取 Anthropic Fable 模型能力,並提到涉嫌使用未獲出口許可的 Nvidia GB300 晶片(可能經泰國伺服器間接取得)。財政部長 Scott Bessent 附和稱「在很多中國模型上發現了美國大模型的浮水印」,但未說明具體所指。
這並非空穴來風——2026 年 2 月 Anthropic 已公開指控月之暗面、DeepSeek、MiniMax 進行「產業級蒸餾攻擊」,稱識別出月之暗面超過 340 萬次異常 API 互動,「明顯偏離正常使用模式,反映刻意的能力提取」,並稱已透過請求元資料追蹤到部分行為與月之暗面高層相關。月之暗面從未正面確認或否認。
TechCrunch(7 月 23 日)採訪的多位獨立研究者普遍質疑「兩週內蒸餾出 K3」——Fable 5 面向公眾開放僅從 7 月 1 日起算,到 K3 發布僅 兩週:
「I don't think you get a model this strong and this quickly on the heels of Fable doing strictly distillation... Fable's only been publicly available since July 1st. You can't distill that much data, train a model, and release it in two weeks.」—— Braden Hancock,Laude Institute 研究員,Snorkel AI 共同創辦人
「Distillation is becoming less and less impactful over time as the Chinese models get closer to the frontier and the training regime shifts to reinforcement learning... if it were the case, everyone would be easily able to catch up to a GLM or a K3 by using its data for distillation. But we have not.」—— Nathan Lambert,Allen Institute for AI 研究員
產業背景:Elon Musk 曾在庭審中承認 xAI 訓練 Grok 時蒸餾過 OpenAI 模型,並稱這在業界很常見——「蒸餾」本身並不必然違法,核心在於「正常技術借鑑」與「隱蔽工業級竊取」的邊界如何界定。
05 Kimi K3 自稱是 Claude:Greenblatt 技術證據與可引用硬數據
本次事件最具技術含金量的角度:Redwood Research 首席科學家 Ryan Greenblatt 於 7 月 24 日前後發布統計分析(GitHub: rgreenblatt/which_claude_is_k3),對比多個模型在被問「你是誰」時的身份自認行為。
- 異常高頻自稱 Claude:Kimi K3 異常高比例自稱為 Claude,甚至吐出 Claude 官方內部部署 ID,如
claude-opus-4-5-20250929、claude-sonnet-4-5-20250929。 - 比真 Claude 還準:真實 Claude Sonnet 4.5 只會說「我是 Claude Sonnet 4.5」;Opus 4.5 甚至不會主動報出這類內部版本號——K3 報出的部署元資料比教師模型自己還準確。
- 逐代追新規律:K3 訊號鎖定「Claude 4.5 時代」(2025 年末),而非當前 Fable/Mythos 系列;上一代 K2 指向更早的 Claude Sonnet 4(2025 年中)。
- Greenblatt 解讀:更可能指向訓練資料混入了帶部署元資料標註的 Claude 資料(如 API 日誌或打標合成資料)——一種更具體、更難用「模仿對話風格」解釋的蒸餾形式。
- 重要澄清:Greenblatt 強調這不能直接證明蒸餾發生——身份混淆也可能來自資料污染、系統提示詞洩漏或公開資料集合樣本。
可引用硬核數據彙總(信源:Anthropic 官方、Moonshot 官方、Greenblatt 分析,2026-07-25):
- Opus 5 定價:輸入 $5 / 輸出 $25 每百萬 tokens,與 Opus 4.8 相同,約為 Fable 5 一半
- CursorBench 差距:Opus 5 max effort 與 Fable 5 峰值相差 0.5%
- K3 參數量:2.8T 總參數,896 專家 / 啟用 16 個,約 500 億啟用參數等效
- Anthropic 2 月指控:月之暗面 340 萬+ 異常 API 互動
- 權重開源:K3 完整權重計劃 2026-07-27 放出
- 時間線:Fable 5 公眾可用 7/1 → K3 發布 7/16 → 白宮指控 7/22–23 → Greenblatt 分析 7/24 → Opus 5 發布 7/24
Reddit r/LocalLLaMA 社群反應分裂:有人歡呼「開源與閉源差距縮短到幾天」;有人調侃「2.8T 參數幾乎沒人本地跑得動」;更務實的一派認為 K3 真正賣點是低價 + 少拒答,而非「打敗 Fable 5」。
06 六步模型選型指南、FAQ 與生產環境收束
把兩件事連起來看:當前 AI 競爭的主戰場是性價比——Opus 5 用半價逼近旗艦;K3 用開源 + 低價衝擊市場;蒸餾爭議則是對「能力來源」的公開攤牌。
- 明確工作負載類型:日常 coding agent / 商業自動化優先評估 Opus 5;極限 FrontierSWE 或深度推理仍看 Fable 5;超長上下文開源場景關注 K3(7/27 權重後)。
- 評估合規與資料留存:企業敏感資料場景,Opus 5 預設不要求 30 天留存是實質性優勢;Fable 5 / Mythos 5 需額外接受留存政策。
- 對比性價比硬指標:CursorBench 0.5% 差距 + 50% 成本節省——若你的 agent 以 Cursor / Claude Code 類工作流為主,Opus 5 可能是 2026 下半年預設升級選項。
- 等待 K3 獨立驗證:7 月 27 日權重放出前,K3 架構與跑分僅為「官方自評 + 外部猜測」;不建議在合規敏感生產環境押注未驗證模型。
- 納入供應鏈風險:蒸餾指控、晶片出口管制、政策層面限制討論——若業務涉及跨國合規或政府客戶,需在選型文件記錄 provenance 風險。
- 部署穩定宿主:無論 Opus 5 API 還是 K3 接入,7×24 Agent 閘道需要獨占算力與 launchd 常駐——避免共享 VPS 記憶體不足與長連線抖動。
Q:Claude Opus 5 比 Claude Fable 5 便宜多少?
A:相同 benchmark 檔位下 Opus 5 約為 Fable 5 一半($5/$25 vs 約 $10/$50 每百萬輸入/輸出 token),CursorBench 峰值相差不到 1%。
Q:Claude Opus 5 現在是 Claude Max 的預設模型嗎?
A:是的,2026 年 7 月 24 日發布當天起為 Claude Max 預設,也是 Claude Pro 最強可用版本。
Q:Kimi K3 真的蒸餾了 Claude 嗎?
A:截至本文發布仍有爭議。白宮指控缺乏公開證據;專家從時間線質疑兩週內深度蒸餾不現實;Greenblatt 發現的「K3 自稱是 Claude 並吐出內部版本號」是目前最具技術含量的間接證據,但不能直接證明蒸餾。
Q:Kimi K3 完整權重什麼時候能下載?
A:官方承諾 2026 年 7 月 27 日,本文發布時尚未放出。
純 API 呼叫雖可快速切換 Opus 5 或 K3,但生產 Agent 仍面臨共享雲主機超賣導致的長連線中斷、多模型 A/B 測試缺乏 7×24 穩定宿主,以及合規稽核要求獨占環境等隱性成本。對於需要持續執行 Claude Code / Kimi Code 類 Agent 的生產環境,JEXCLOUD 多區域裸金屬 Mac是更優解:獨占 Apple Silicon 統一記憶體、無超賣抖動、launchd 常駐閘道,120 秒交付。節點與價格見 JEXCLOUD 定價頁。