AI Agent 千问旗舰 2026.08.04

阿里Qwen3.8-Max发布:2.4万亿参数冲进Arena全球前五, 下周开源

阿里巴巴2026 年 8 月 3 日正式发布新一代旗舰大模型 Qwen3.8-Max(GA 全量可用),总参数 2.4 万亿、激活 950 亿100 万 token 上下文,并同步上线 Agent 产品「千问办公」。Arena 文本竞技场(8 月 1 日快照)排名第 5(1496 分,标注 Preliminary),是前 8 名中唯一的非 Anthropic 模型。

面向模型选型者与 AI 开发者,本文将回答三件事:① 从 7 月 19 日预览版到 8 月 3 日 GA 的两周时间线与透明度痛点;② 核心跑分及与 Kimi K3DeepSeek V4 的横向对比;③ 「Open-Source」标签已挂出但权重尚未上线背后的争议点,以及六步安全接入清单。数据截止 2026-08-04。

01 从预览版到正式发布:两周时间线与核心痛点

  • 7 月 16 日:月之暗面发布 Kimi K3(2.8 万亿参数,896 专家激活 16 个),主打独立评测与透明技术报告。
  • 7 月 19 日:Qwen3.8-Max 以预览版开放,接入 Token Plan / Qoder / QoderWork,价格为预计正式价的 10%;未公布激活参数、未提供跑分表,服务条款禁止自动化生产环境调用。
  • 7 月 27 日:Kimi K3 按承诺开源权重,上线 Hugging Face,并开源部分底层基础设施。
  • 7 月 31 日:DeepSeek 发布 V4-Flash 正式版,在参数规模不变前提下,智能体与代码类基准大幅超过 V4-Pro 预览版。
  • 8 月 3 日:Qwen3.8-Max 正式 GA,发布完整跑分表,「千问办公」同步上线;阿里港股当日涨约 7%,美股涨约 4.5%。
  • 预计 8 月 10 日前后(官方口径「下周」):Qwen3.8-Max 及精简版 Qwen3.8-27B 权重计划登陆 Hugging Face 与 ModelScope,具体日期与开源协议截至发稿未公布。

开发者与企业用户当前面临的核心痛点:

  • 标签超前:官网已标注「Open-Source」,但 Hugging Face / ModelScope 尚无对应仓库与许可证。
  • 跑分自测:PaperBench、OSWorld、SWE-bench Pro 等数据均来自阿里自建框架,第三方权威平台尚未复现 GA 版成绩。
  • 预览期透明度不足:7 月预览版未披露激活参数,多家独立评测机构曾建议勿迁移生产系统。
  • 竞品已开源:Kimi K3 与 DeepSeek V4 系列权重已公开,Qwen3.8-Max 仍只能通过 API 调用完整旗舰版。

在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一非 Anthropic 模型——但榜单条目标注为 Preliminary,且其余跑分目前主要是厂商自测,「全球第一梯队」仍需独立验证。

02 Qwen3.8-Max 核心数据一览

Qwen3.8-Max 官方公布核心参数(2026-08-03 GA)
项目 数值
发布日期2026 年 8 月 3 日(GA)
总参数 / 激活参数2.4 万亿 / 950 亿
架构基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态文本 / 图像 / 视频
API 定价(国际)输入 $2/M,输出 $6/M;隐式缓存命中 $0.25,显式缓存写入 $2.5、读取 $0.17
国内定价(官方口径)输入 12 元/M,输出 36 元/M,缓存命中低至 1.5 元
Arena 文本(8/1 快照)第 5 名,1496 分(Preliminary);前 4 与第 6–8 均为 Anthropic
Arena 视觉第 2 名,仅次于 Claude Fable 5
PaperBench(阿里自测)93.0(较上代 +28.2)
OSWorld-Verified(阿里自测)86.1
SWE-bench Pro(阿里自测)67.7(低于 Fable 5 80.0、Opus 4.8 69.2)
HLE(阿里自测)43.6(旗舰中最低,Fable 5 53.3)
权重开源承诺「下周」,截至发稿未上线

表中带「阿里自测」的数据来自官方发布材料,尚无 Artificial Analysis、Arena.ai 官方团队等对 GA 版的独立复现。

03 2.4 万亿参数背后:MoE 架构与 Agent 卖点拆解

为什么是 MoE + 混合注意力? Qwen3.8-Max 延续 Qwen3.5 路线:总参数 2.4 万亿,每 token 仅激活约 950 亿,推理成本更接近千亿级模型而非字面 2.4T。这也是 API 定价能压到 $2/$6(低于 Claude Opus 5 $5/$25、Fable 5 $10/$50)的核心原因——用架构效率换价格竞争力。

reasoning_effort 三档:提供 low / medium / xhigh(默认 xhigh),可通过原生 API 的 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 调节速度与深度,是 Agent 场景的标配成本拨盘。

长程自主任务是本次 headline:阿里案例包括 16 天无人工介入编码、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒交互 + 视觉反馈还原真实应用)。部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整第三方审计。

生态卡位:同步接入「千问办公」Agent 平台;API 兼容 OpenAI 与 Anthropic 协议,可对接 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链,降低迁移摩擦。

  • 多模态输入:文本 / 图像 / 视频统一接口,视觉 Arena 排名第 2。
  • Agent 对标:千问办公对标腾讯 WorkBuddy、Moonshot Kimi Work。
  • 消费端渗透:千问已作为 国行 Apple Intelligence 核心生成引擎,压缩版在 iPhone 15+ 本地运行。

04 横向对比:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

旗舰大模型横向对比(2026 年 8 月初)
模型 总/激活参数 上下文 定价(入/出 $/M) 权重开源 独立评测
Qwen3.8-Max2.4T / 950B1M$2 / $6未开源(承诺中)暂无 GA 复现
Kimi K32.8T / ~500B~1.05M$3 / $15已开源(7/27)AA 指数约 57.11
DeepSeek V4-Pro1.6T / 490B1M见官方表已开源SWE-bench Verified 80.6%
DeepSeek V4-Flash同 V4-Pro1M见官方表已开源9 项 Agent/代码超 V4-Pro
Claude Opus 5未公开1M$5 / $25闭源Arena 前列
Claude Fable 5未公开1M$10 / $50闭源Arena 文本第 1

易被忽略的细节:Kimi K3 公开约 500B 激活参数,DeepSeek 公开 490B,而阿里在预览期完全未披露激活量,GA 才补充「950 亿」——这是 7 月曾被点名「透明度不足」的原因之一。

唯一可比的独立盲测(269 个文件的真实架构设计任务):Kimi K3 83 分、Qwen3.8-Max 预览版 80 分,属同档位互有胜负,而非全面碾压。

阿里对比表脚注称「Fable 5 结果可能涉及 fallback」——对竞品跑分的隐性质疑,但自家测试方法论同样未公开到可第三方复现程度。

05 「开源」标签争议、六步接入与可引用数据

本次发布最值得警惕的是信息披露的时间差,而非单一跑分高低:

  • 标签先于权重:qwen.ai 在 GA 当天已标「Open-Source」,仓库与许可证仍未公布。
  • 跑分均为厂商自测:含 QwenSWEBench、RecreationBench 等内部基准;Arena 1496 分仍为 Preliminary。
  • 预览期禁令:7 月预览版禁止自动化生产调用,且无 model card 与安全评估公开。
  • 权重落地待定:完整 2.4T 需数据中心级硬件;更现实路径是 API 或等待 Qwen3.8-27B 开源版。

六步安全接入 Qwen3.8-Max:

  1. 开通 QwenCloud:在阿里云 Model Studio / Qwen 官方控制台创建 API Key,确认 GA 模型 ID 与区域端点。
  2. 选择兼容协议:按现有工具链选 OpenAI 或 Anthropic 兼容 base_url,避免重写客户端。
  3. 配置推理档位:从 medium 起步验证延迟,复杂 Agent 任务再升至 xhigh / enable_thinking
  4. 沙箱 A/B 对比:用自有业务 prompt 与 Kimi K3 / DeepSeek V4 盲测,勿仅凭厂商表迁移生产。
  5. 规划权重路径:关注 Hugging Face / ModelScope「下周」公告;本地完整版不现实则锁定 Qwen3.8-27B。
  6. 接入 Agent 工具链:在 OpenClaw、Qoder、Claude Code 等宿主中替换 base URL,验证长程任务稳定性。
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

可引用硬核数据(来源:阿里官方、Arena.ai 公开榜,2026-08-04):

  • 总参数 / 激活:2.4T / 950B,MoE + 混合注意力
  • 上下文:1M token;思考模式输入约 983K、输出上限 131K
  • API 定价:$2/$6 per M token;缓存命中 $0.25/M
  • Arena 文本:#5,1496 分(Preliminary,8/1 快照)
  • Arena 视觉:#2,仅次于 Fable 5
  • 独立盲测:架构任务 K3 83 vs Qwen 预览 80(同档)
  • 资本市场:发布日港股 +7%、美股 +4.5%
  • 权重状态:承诺 8/10 前后开源,发稿时未上线

06 常见问题、行业背景与生产环境收束

Q:Qwen3.8-Max 现在能直接用吗?开源了没有?
A:API 已可通过 QwenCloud 调用,兼容 OpenAI / Anthropic 协议。权重尚未开源;官网「Open-Source」标签描述的是意图而非已发布 artifact,预计 8 月 10 日前后公布仓库与协议。

Q:和 Kimi K3 谁更强?
A:无统一权威头对头。独立盲测接近(83 vs 80);K3 优势在已开源 + AA 指数;Qwen3.8-Max 优势在更低 API 价与更强多模态。

Q:2.4 万亿意味着本地跑不了?
A:完整 checkpoint 需多节点数据中心。API 调用成本按 950B 激活计费;个人开发者应等待 Qwen3.8-27B 开源版。

Q:阿里跑分能信吗?
A:作参考勿作定论。等待 Artificial Analysis 等复测,或在自有场景 A/B。

Q:对普通用户有何影响?
A:国行 Apple Intelligence 生成能力基于千问压缩模型,iPhone 用户将在系统层间接使用千问能力。

2026 年是万亿参数「扩产年」:DeepSeek V4-Pro(1.6T)、Qwen3.8-Max(2.4T)、Kimi K3(2.8T)接连登场,而 DeepSeek V4-Flash 证明不靠堆参数也能大幅提升 Agent 能力。阿里罕见承诺开源 Max 级权重,与 Kimi、DeepSeek 构成国产头部「开放权重」格局;同期美国白宫 8 月 4 日召集 OpenAI、Anthropic、Google、Meta 讨论 Agent 网络安全测试框架——开源抢生态与监管收紧形成鲜明对照。

纯 API 调用虽门槛低,但长程 Agent 在共享 VPS 上易遇内存抖动与长连接打断多工具链并行缺乏 7×24 稳定宿主2.4T 权重自部署需超算集群。对于需要持续运行 OpenClaw、Qoder 或 Claude Code 远端网关的生产环境,JEXCLOUD 多区域裸金属 Mac是更优解:独占 Apple Silicon 统一内存、无超卖宽带抖动、launchd 常驻 Agent,120 秒交付。节点与价格见 JEXCLOUD 定价页