AI Agent 千問旗艦 2026.08.04

阿里Qwen3.8-Max發布:2.4萬億參數衝進Arena全球前五, 下週開源

阿里巴巴2026 年 8 月 3 日正式發布新一代旗艦大模型 Qwen3.8-Max(GA 全量可用),總參數 2.4 萬億、啟用 950 億100 萬 token 上下文,並同步上線 Agent 產品「千問辦公」。Arena 文本競技場(8 月 1 日快照)排名第 5(1496 分,標註 Preliminary),是前 8 名中唯一的非 Anthropic 模型。

面向模型選型者與 AI 開發者,本文將回答三件事:① 從 7 月 19 日預覽版到 8 月 3 日 GA 的兩週時間線與透明度痛點;② 核心跑分及與 Kimi K3DeepSeek V4 的橫向對比;③ 「Open-Source」標籤已掛出但權重尚未上線背後的爭議點,以及六步安全接入清單。數據截至 2026-08-04。

01 從預覽版到正式發布:兩週時間線與核心痛點

  • 7 月 16 日:月之暗面發布 Kimi K3(2.8 萬億參數,896 專家啟用 16 個),主打獨立評測與透明技術報告。
  • 7 月 19 日:Qwen3.8-Max 以預覽版開放,接入 Token Plan / Qoder / QoderWork,價格為預計正式價的 10%;未公布啟用參數、未提供跑分表,服務條款禁止自動化生產環境呼叫。
  • 7 月 27 日:Kimi K3 依承諾開源權重,上線 Hugging Face,並開源部分底層基礎設施。
  • 7 月 31 日:DeepSeek 發布 V4-Flash 正式版,在參數規模不變前提下,智慧體與程式碼類基準大幅超過 V4-Pro 預覽版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,發布完整跑分表,「千問辦公」同步上線;阿里港股當日漲約 7%,美股漲約 4.5%。
  • 預計 8 月 10 日前後(官方口徑「下週」):Qwen3.8-Max 及精簡版 Qwen3.8-27B 權重計畫登陸 Hugging Face 與 ModelScope,具體日期與開源協議截至發稿未公布。

開發者與企業用戶當前面臨的核心痛點:

  • 標籤超前:官網已標註「Open-Source」,但 Hugging Face / ModelScope 尚無對應倉庫與授權條款。
  • 跑分自測:PaperBench、OSWorld、SWE-bench Pro 等數據均來自阿里自建框架,第三方權威平台尚未復現 GA 版成績。
  • 預覽期透明度不足:7 月預覽版未披露啟用參數,多家獨立評測機構曾建議勿遷移生產系統。
  • 競品已開源:Kimi K3 與 DeepSeek V4 系列權重已公開,Qwen3.8-Max 仍只能透過 API 呼叫完整旗艦版。

在 Arena 文本競技場前 8 名中,Qwen3.8-Max 是唯一非 Anthropic 模型——但榜單條目標註為 Preliminary,且其餘跑分目前主要是廠商自測,「全球第一梯隊」仍需獨立驗證。

02 Qwen3.8-Max 核心數據一覽

Qwen3.8-Max 官方公布核心參數(2026-08-03 GA)
項目 數值
發布日期2026 年 8 月 3 日(GA)
總參數 / 啟用參數2.4 萬億 / 950 億
架構基於 Qwen3.5 的稀疏 MoE + 混合注意力
上下文視窗100 萬 token(思考模式約 98.3 萬,輸出上限 13.1 萬)
輸入模態文本 / 圖像 / 影片
API 定價(國際)輸入 $2/M,輸出 $6/M;隱式快取命中 $0.25,顯式快取寫入 $2.5、讀取 $0.17
國內定價(官方口徑)輸入 12 元/M,輸出 36 元/M,快取命中低至 1.5 元
Arena 文本(8/1 快照)第 5 名,1496 分(Preliminary);前 4 與第 6–8 均為 Anthropic
Arena 視覺第 2 名,僅次於 Claude Fable 5
PaperBench(阿里自測)93.0(較上代 +28.2)
OSWorld-Verified(阿里自測)86.1
SWE-bench Pro(阿里自測)67.7(低於 Fable 5 80.0、Opus 4.8 69.2)
HLE(阿里自測)43.6(旗艦中最低,Fable 5 53.3)
權重開源承諾「下週」,截至發稿未上線

表中帶「阿里自測」的數據來自官方發布材料,尚無 Artificial Analysis、Arena.ai 官方團隊等對 GA 版的獨立復現。

03 2.4 萬億參數背後:MoE 架構與 Agent 賣點拆解

為什麼是 MoE + 混合注意力? Qwen3.8-Max 延續 Qwen3.5 路線:總參數 2.4 萬億,每 token 僅啟用約 950 億,推理成本更接近千億級模型而非字面 2.4T。這也是 API 定價能壓到 $2/$6(低於 Claude Opus 5 $5/$25、Fable 5 $10/$50)的核心原因——用架構效率換價格競爭力。

reasoning_effort 三檔:提供 low / medium / xhigh(預設 xhigh),可透過原生 API 的 enable_thinking 或 Anthropic 相容介面的 reasoning.effort 調節速度與深度,是 Agent 場景的標配成本撥盤。

長程自主任務是本次 headline:阿里案例包括 16 天無人工介入編碼、500+ 步晶片設計優化,以及自建 RecreationBench(黑盒互動 + 視覺回饋還原真實應用)。部分過程記錄在 GitHub qwen-code-dev-bot/oh-my-cli,但並非完整第三方稽核。

生態卡位:同步接入「千問辦公」Agent 平台;API 相容 OpenAI 與 Anthropic 協議,可對接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具鏈,降低遷移摩擦。

  • 多模態輸入:文本 / 圖像 / 影片統一介面,視覺 Arena 排名第 2。
  • Agent 對標:千問辦公對標騰訊 WorkBuddy、Moonshot Kimi Work。
  • 消費端滲透:千問已作為 國行 Apple Intelligence 核心生成引擎,壓縮版在 iPhone 15+ 本地執行。

04 橫向對比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

旗艦大模型橫向對比(2026 年 8 月初)
模型 總/啟用參數 上下文 定價(入/出 $/M) 權重開源 獨立評測
Qwen3.8-Max2.4T / 950B1M$2 / $6未開源(承諾中)暫無 GA 復現
Kimi K32.8T / ~500B~1.05M$3 / $15已開源(7/27)AA 指數約 57.11
DeepSeek V4-Pro1.6T / 490B1M見官方表已開源SWE-bench Verified 80.6%
DeepSeek V4-Flash同 V4-Pro1M見官方表已開源9 項 Agent/程式碼超 V4-Pro
Claude Opus 5未公開1M$5 / $25閉源Arena 前列
Claude Fable 5未公開1M$10 / $50閉源Arena 文本第 1

易被忽略的細節:Kimi K3 公開約 500B 啟用參數,DeepSeek 公開 490B,而阿里在預覽期完全未披露啟用量,GA 才補充「950 億」——這是 7 月曾被點名「透明度不足」的原因之一。

唯一可比的獨立盲測(269 個檔案的真實架構設計任務):Kimi K3 83 分、Qwen3.8-Max 預覽版 80 分,屬同檔位互有勝負,而非全面碾壓。

阿里對比表腳註稱「Fable 5 結果可能涉及 fallback」——對競品跑分的隱性質疑,但自家測試方法論同樣未公開到可第三方復現程度。

05 「開源」標籤爭議、六步接入與可引用數據

本次發布最值得警惕的是資訊披露的時間差,而非單一跑分高低:

  • 標籤先於權重:qwen.ai 在 GA 當天已標「Open-Source」,倉庫與授權條款仍未公布。
  • 跑分均 vendor-run:含 QwenSWEBench、RecreationBench 等內部基準;Arena 1496 分仍為 Preliminary。
  • 預覽期禁令:7 月預覽版禁止自動化生產呼叫,且無 model card 與安全評估公開。
  • 權重落地待定:完整 2.4T 需資料中心級硬體;更現實路徑是 API 或等待 Qwen3.8-27B 開源版。

六步安全接入 Qwen3.8-Max:

  1. 開通 QwenCloud:在阿里雲 Model Studio / Qwen 官方控制台建立 API Key,確認 GA 模型 ID 與區域端點。
  2. 選擇相容協議:依現有工具鏈選 OpenAI 或 Anthropic 相容 base_url,避免重寫客戶端。
  3. 配置推理檔位:從 medium 起步驗證延遲,複雜 Agent 任務再升至 xhigh / enable_thinking
  4. 沙箱 A/B 對比:用自有業務 prompt 與 Kimi K3 / DeepSeek V4 盲測,勿僅憑廠商表遷移生產。
  5. 規劃權重路徑:關注 Hugging Face / ModelScope「下週」公告;本地完整版不現實則鎖定 Qwen3.8-27B。
  6. 接入 Agent 工具鏈:在 OpenClaw、Qoder、Claude Code 等宿主中替換 base URL,驗證長程任務穩定性。
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

可引用硬核數據(來源:阿里官方、Arena.ai 公開榜,2026-08-04):

  • 總參數 / 啟用:2.4T / 950B,MoE + 混合注意力
  • 上下文:1M token;思考模式輸入約 983K、輸出上限 131K
  • API 定價:$2/$6 per M token;快取命中 $0.25/M
  • Arena 文本:#5,1496 分(Preliminary,8/1 快照)
  • Arena 視覺:#2,僅次於 Fable 5
  • 獨立盲測:架構任務 K3 83 vs Qwen 預覽 80(同檔)
  • 資本市場:發布日港股 +7%、美股 +4.5%
  • 權重狀態:承諾 8/10 前後開源,發稿時未上線

06 常見問題、產業背景與生產環境收束

Q:Qwen3.8-Max 現在能直接用嗎?開源了沒有?
A:API 已可透過 QwenCloud 呼叫,相容 OpenAI / Anthropic 協議。權重尚未開源;官網「Open-Source」標籤描述的是意圖而非已發布 artifact,預計 8 月 10 日前後公布倉庫與協議。

Q:和 Kimi K3 誰更強?
A:無統一權威頭對頭。獨立盲測接近(83 vs 80);K3 優勢在已開源 + AA 指數;Qwen3.8-Max 優勢在更低 API 價與更強多模態。

Q:2.4 萬億意味著本地跑不了?
A:完整 checkpoint 需多節點資料中心。API 呼叫成本按 950B 啟用計費;個人開發者應等待 Qwen3.8-27B 開源版。

Q:阿里跑分能信嗎?
A:作參考勿作定論。等待 Artificial Analysis 等復測,或在自有場景 A/B。

Q:對普通用戶有何影響?
A:國行 Apple Intelligence 生成能力基於千問壓縮模型,iPhone 用戶將在系統層間接使用千問能力。

2026 年是萬億參數「擴產年」:DeepSeek V4-Pro(1.6T)、Qwen3.8-Max(2.4T)、Kimi K3(2.8T)接連登場,而 DeepSeek V4-Flash 證明不靠堆參數也能大幅提升 Agent 能力。阿里罕見承諾開源 Max 級權重,與 Kimi、DeepSeek 構成國產頭部「開放權重」格局;同期美國白宮 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 討論 Agent 網路安全測試框架——開源搶生態與監管收緊形成鮮明對照。

純 API 呼叫雖門檻低,但長程 Agent 在共享 VPS 上易遇記憶體抖動與長連線中斷多工具鏈並行缺乏 7×24 穩定宿主2.4T 權重自部署需超算叢集。對於需要持續執行 OpenClaw、Qoder 或 Claude Code 遠端閘道的生產環境,JEXCLOUD 多區域裸金屬 Mac是更優解:獨占 Apple Silicon 統一記憶體、無超賣頻寬抖動、launchd 常駐 Agent,120 秒交付。節點與價格見 JEXCLOUD 定價頁