AI Agent 千問旗艦 2026.08.04

Alibaba Qwen3.8-Max公開:2.4TパラメータでArena世界上位5位、 来週オープンソース

阿里巴巴2026年8月3日に新世代旗艦大規模言語モデル Qwen3.8-Max(GAで全量利用可能)を正式公開しました。総パラメータ 2.4兆、アクティブ 9500億100万token コンテキストで、Agent製品「千問オフィス」も同時ローンチです。Arenaテキストアリーナ(8月1日スナップショット)で 第5位(1496点、Preliminary表記)、上位8位中唯一の非Anthropicモデルです。

モデル選定者とAI開発者向けに、本記事では三つの問いに答えます。① 7月19日プレビューから8月3日GAまでの2週間タイムラインと透明性の課題;② コアベンチマークKimi K3DeepSeek V4 との横断比較;③ 「Open-Source」ラベルが掲出済みだがウェイト未公開という論点と、六ステップ安全接続チェックリスト。データは2026-08-04時点です。

01 プレビューから正式公開まで:2週間のタイムラインと核心課題

  • 7月16日:Moonshot AIが Kimi K3 を公開(2.8Tパラメータ、896エキスパート中16をアクティブ化)、独立ベンチマークと透明な技術レポートを訴求。
  • 7月19日:Qwen3.8-Maxがプレビュー版で公開、Token Plan / Qoder / QoderWorkに接続、価格は正式版見込みの10%;アクティブパラメータ未公表、ベンチマーク表なし、利用規約で自動化生産環境呼び出しを禁止。
  • 7月27日:Kimi K3が約束どおりウェイトをオープンソース化、Hugging Faceに公開、一部基盤インフラも公開。
  • 7月31日:DeepSeekがV4-Flash正式版をリリース、パラメータ規模は据え置きながらエージェント・コード系ベンチマークでV4-Proプレビュー版を大幅に上回る。
  • 8月3日:Qwen3.8-Maxが正式GA、完全ベンチマーク表を公開、「千問オフィス」も同時ローンチ;阿里港股は当日約7%上昇、米株は約4.5%上昇。
  • 8月10日前後見込み(公式「来週」):Qwen3.8-Maxおよび軽量版Qwen3.8-27BのウェイトがHugging FaceとModelScopeに登場する計画、具体的日付とオープンソースライセンスは執筆時点で未公表。

開発者と企業ユーザーが直面する核心課題:

  • ラベルの先行:公式サイトに「Open-Source」表記済みだが、Hugging Face / ModelScopeに対応リポジトリとライセンスがない。
  • ベンダー自測スコア:PaperBench、OSWorld、SWE-bench Proなどは阿里独自フレームワーク由来、第三者権威プラットフォームによるGA版の再現は未実施。
  • プレビュー期の透明性不足:7月プレビュー版はアクティブパラメータを非開示、複数の独立評価機関が本番システムへの移行を推奨していなかった。
  • 競合は既にオープン:Kimi K3とDeepSeek V4シリーズのウェイトは公開済み、Qwen3.8-Maxフル旗艦版は依然API経由のみ。

Arenaテキストアリーナ上位8位のうち、Qwen3.8-Maxは唯一の非Anthropicモデルです——ただしエントリーはPreliminary表記で、他のスコアは主にベンダー自測。「世界トップクラス」には独立検証が必要です。

02 Qwen3.8-Max コアデータ一覧

Qwen3.8-Max 公式コアパラメータ(2026-08-03 GA)
項目 数値
公開日2026年8月3日(GA)
総/アクティブパラメータ2.4兆 / 9500億
アーキテクチャQwen3.5ベースのsparse MoE + ハイブリッドアテンション
コンテキストウィンドウ100万token(思考モード約98.3万、出力上限13.1万)
入力モダリティテキスト / 画像 / 動画
API価格(国際)入力 $2/M、出力 $6/M;暗黙キャッシュヒット $0.25、明示キャッシュ書込 $2.5、読取 $0.17
国内価格(公式)入力12元/M、出力36元/M、キャッシュヒット最低1.5元
Arenaテキスト(8/1スナップショット)第5位、1496点(Preliminary);上位4位と6–8位はすべてAnthropic
Arenaビジュアル第2位、Claude Fable 5に次ぐ
PaperBench(阿里自測)93.0(前世代比+28.2)
OSWorld-Verified(阿里自測)86.1
SWE-bench Pro(阿里自測)67.7(Fable 5 80.0、Opus 4.8 69.2を下回る)
HLE(阿里自測)43.6(旗艦中最低、Fable 5 53.3)
ウェイト公開「来週」約束、執筆時点で未公開

「阿里自測」表記のデータは公式発表資料由来で、Artificial AnalysisやArena.ai公式チームによるGA版の独立再現はまだありません。

03 2.4Tパラメータの裏側:MoEアーキテクチャとAgent訴求の分解

なぜMoE + ハイブリッドアテンションか? Qwen3.8-MaxはQwen3.5路線を継承し、総パラメータ2.4兆に対しトークンあたり約9500億のみアクティブ化、推論コストは字面の2.4Tより1000億級モデルに近い。これがAPI価格を$2/$6に抑える(Claude Opus 5 $5/$25、Fable 5 $10/$50より低い)核心理由——アーキテクチャ効率で価格競争力を獲得しています。

reasoning_effort三段階:low / medium / xhigh(デフォルトxhigh)を提供し、ネイティブAPIの enable_thinking またはAnthropic互換インターフェースの reasoning.effort で速度と深度を調整可能、Agentシーンの標準コストダイヤルです。

長期自律タスクが今回のヘッドライン:阿里の事例には16日間無人介入コーディング、500+ステップのチップ設計最適化、独自RecreationBench(ブラックボックス相互作用+視覚フィードバックで実アプリを再現)があります。一部過程はGitHub qwen-code-dev-bot/oh-my-cli に記録されていますが、完全な第三者監査ではありません。

エコシステム配置:「千問オフィス」Agentプラットフォームに同時接続;APIはOpenAIとAnthropicプロトコル互換で、Claude Code、Codex、Qoder CLI、Qwen Code、OpenClawなどのツールチェーンに接続可能、移行摩擦を低減します。

  • マルチモーダル入力:テキスト / 画像 / 動画を統一インターフェースで、ビジュアルArena第2位。
  • Agent比較:千問オフィスはTencent WorkBuddy、Moonshot Kimi Workと対標。
  • 消費者浸透:千問は 中国版Apple Intelligence のコア生成エンジンとして採用、圧縮版はiPhone 15+でローカル実行。

04 横断比較:Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

旗艦大規模モデル横断比較(2026年8月初頭)
モデル 総/アクティブ コンテキスト 価格(入/出 $/M) ウェイト公開 独立評価
Qwen3.8-Max2.4T / 950B1M$2 / $6未公開(約束中)GA再現なし
Kimi K32.8T / ~500B~1.05M$3 / $15公開済み(7/27)AA指数約57.11
DeepSeek V4-Pro1.6T / 490B1M公式表参照公開済みSWE-bench Verified 80.6%
DeepSeek V4-FlashV4-Pro同等1M公式表参照公開済み9項目Agent/コードでV4-Pro超
Claude Opus 5非公開1M$5 / $25クローズドArena上位
Claude Fable 5非公開1M$10 / $50クローズドArenaテキスト第1

見落とされがちな点:Kimi K3は約500Bアクティブを公開、DeepSeekは490Bを公開、阿里はプレビュー期にアクティブ量を一切非開示、GAで初めて「9500億」を補足——7月に「透明性不足」と指摘された理由の一つです。

唯一比較可能な独立盲測(269ファイルの実アーキテクチャ設計タスク):Kimi K3 83点、Qwen3.8-Maxプレビュー版80点、同クラスで互角、全面優位ではありません。

阿里の比較表脚注は「Fable 5の結果はfallbackを含む可能性」と競合スコアを暗に疑問視——ただし自社テスト手法も第三者再現可能なレベルでは公開されていません。

05 「オープンソース」ラベル論争、六ステップ接続と引用可能データ

今回の公開で最も警戒すべきは情報開示のタイムラグであり、単一スコアの高低ではありません:

  • ラベルがウェイトに先行:qwen.aiはGA当日に「Open-Source」表記、リポジトリとライセンスは未公表。
  • スコアはすべてvendor-run:QwenSWEBench、RecreationBenchなど内部ベンチマーク含む;Arena 1496点もPreliminary。
  • プレビュー期の禁止事項:7月プレビュー版は自動化生産呼び出しを禁止、model cardと安全評価も未公開。
  • ウェイト展開は未定:フル2.4Tはデータセンター級ハードウェアが必要;現実的な経路はAPIまたはQwen3.8-27Bオープン版を待つこと。

六ステップで安全にQwen3.8-Maxを接続:

  1. QwenCloudを開通:Alibaba Cloud Model Studio / Qwen公式コンソールでAPI Keyを作成し、GAモデルIDとリージョンエンドポイントを確認します。
  2. 互換プロトコルを選択:既存ツールチェーンに合わせOpenAIまたはAnthropic互換 base_url を選び、クライアントの書き直しを避けます。
  3. 推論段階を設定:mediumから始めてレイテンシを検証し、複雑なAgentタスクでxhigh / enable_thinking に引き上げます。
  4. サンドボックスA/B比較:自社ビジネスpromptでKimi K3 / DeepSeek V4と盲測し、ベンダー表だけで本番移行しないでください。
  5. ウェイト経路を計画:Hugging Face / ModelScopeの「来週」告知を注視;ローカルフル版が非現実的ならQwen3.8-27Bに絞ります。
  6. Agentツールチェーンに接続:OpenClaw、Qoder、Claude Codeなどのホストでbase URLを置換し、長期タスクの安定性を検証します。
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

引用可能なハードデータ(出典:阿里公式、Arena.ai公開ランキング、2026-08-04):

  • 総/アクティブパラメータ:2.4T / 950B、MoE + ハイブリッドアテンション
  • コンテキスト:1M token;思考モード入力約983K、出力上限131K
  • API価格:$2/$6 per M token;キャッシュヒット $0.25/M
  • Arenaテキスト:#5、1496点(Preliminary、8/1スナップショット)
  • Arenaビジュアル:#2、Fable 5に次ぐ
  • 独立盲測:アーキテクチャタスク K3 83 vs Qwenプレビュー 80(同クラス)
  • 資本市場:公開日に港股+7%、米株+4.5%
  • ウェイト状況:8/10前後公開を約束、執筆時点で未公開

06 よくある質問、業界背景と本番環境への収束

Q:Qwen3.8-Maxは今すぐ使えますか?オープンソース済みですか?
A:APIはQwenCloud経由で利用可能、OpenAI / Anthropicプロトコル互換です。ウェイトは未公開;公式サイトの「Open-Source」ラベルは意図を示すもので公開済みartifactではなく、8月10日前後にリポジトリとライセンスが公表される見込みです。

Q:Kimi K3とどちらが強いですか?
A:統一された権威ある直接対決はありません。独立盲測は接近(83 vs 80);K3の強みは公開済みウェイト+AA指数、Qwen3.8-Maxの強みは低いAPI価格とより強いマルチモーダルです。

Q:2.4兆はローカル実行不可を意味しますか?
A:フルcheckpointはマルチノードデータセンターが必要です。APIコストは950Bアクティブで課金;個人開発者はQwen3.8-27Bオープン版を待つべきです。

Q:阿里のスコアは信頼できますか?
A:参考に留め、結論としないでください。Artificial Analysisなどの再測定を待つか、自社シーンでA/Bしてください。

Q:一般ユーザーへの影響は?
A:中国版Apple Intelligenceの生成能力は千問圧縮モデルベースで、iPhoneユーザーはシステム層で間接的に千問能力を利用します。

2026年は兆パラメータの「拡産年」:DeepSeek V4-Pro(1.6T)、Qwen3.8-Max(2.4T)、Kimi K3(2.8T)が続々登場し、DeepSeek V4-Flashはパラメータを積まずにAgent能力を大幅向上させることを証明しました。阿里がMax級ウェイトのオープンソースを約束するのは異例で、Kimi、DeepSeekとともに中国トップの「オープンウェイト」格局を形成;同期して米ホワイトハウスは8月4日にOpenAI、Anthropic、Google、Metaを招集しAgentサイバーセキュリティテストフレームワークを議論——オープンソースによるエコシステム争奪と規制強化が鮮明な対比をなしています。

純API呼び出しは敷居が低い一方、長期Agentは共有VPS上でメモリジッターと長時間接続切断に直面しやすく、複数ツールチェーンの並行実行に7×24安定ホストが不足し、2.4Tウェイトの自社展開にはスーパーコンピュータクラスタが必要です。OpenClaw、Qoder、Claude Codeのリモートゲートウェイを継続稼働する本番環境には、JEXCLOUDマルチリージョン裸金属Macが最適解です:Apple Silicon統一メモリを独占、オーバーセル帯域ジッターなし、launchd常駐Agent、120秒デプロイ。ノードと価格は JEXCLOUD料金ページ をご覧ください。