AI Agent Qwen flagship 2026.08.04

Alibaba Qwen3.8-Max GA: 2,4T параметров в Arena top 5, веса обещали на следующей неделе

Alibaba 3 августа 2026 выкатила флагман Qwen3.8-Max в GA: 2,4 триллиона total params, 95B active, контекст 1M tokens, плюс Agent-платформа «Qwen Office». Arena text (снапшот 1 августа): #5, 1496 pts (Preliminary) — единственный non-Anthropic в top 8.

Для тех, кто выбирает модель или пилит AI-стек, разбираем три вещи: ① двухнедельный таймлайн от preview (19 июля) до GA и дыры в прозрачности; ② бенчмарки vs Kimi K3 и DeepSeek V4; ③ open-source лейбл без весов и чеклист из шести шагов. Данные на 2026-08-04.

01 От preview к GA: двухнедельный таймлайн и болевые точки

  • 16 июля: Moonshot релизит Kimi K3 (2,8T params, 896 experts, 16 active) с независимыми ревью и technical report.
  • 19 июля: Qwen3.8-Max preview через Token Plan / Qoder / QoderWork; цена 10% от ожидаемого GA; active params не раскрыты, бенчмарков нет; ToS запрещает automated production calls.
  • 27 июля: Kimi K3 weights на Hugging Face как обещали, часть infra тоже open.
  • 31 июля: DeepSeek V4-Flash GA; при тех же params сильный прирост на agent/code бенчмарках vs V4-Pro preview.
  • 3 августа: Qwen3.8-Max GA с полной таблицей бенчмарков, «Qwen Office» live; акции Alibaba HK +7%, US +4,5%.
  • ~10 августа (официально «на следующей неделе»): Qwen3.8-Max и Qwen3.8-27B планируются на Hugging Face и ModelScope — дата и лицензия на момент публикации неизвестны.

Текущие pain points для девов и enterprise:

  • Лейбл раньше артефакта: qwen.ai уже «Open-Source», но на Hugging Face / ModelScope нет репо и лицензии.
  • Vendor-run бенчмарки: PaperBench, OSWorld, SWE-bench Pro из внутреннего фреймворка Alibaba — независимой GA-репликации нет.
  • Preview без прозрачности: в июле active params не раскрывали; независимые тестеры советовали не тащить в прод.
  • Конкуренты уже open weight: Kimi K3 и DeepSeek V4 выложены; Qwen3.8-Max flagship только через API.

В Arena text top 8 Qwen3.8-Max — единственный non-Anthropic, но запись Preliminary, остальные скоры в основном vendor-run. «Первая лига» требует независимой верификации.

02 Ключевые цифры Qwen3.8-Max

Официальные параметры Qwen3.8-Max (GA 2026-08-03)
Параметр Значение
Дата релиза3 августа 2026 (GA)
Total / active params2,4T / 95B
АрхитектураSparse MoE на базе Qwen3.5 + hybrid attention
Контекст1M tokens (thinking mode ~983K input, output cap 131K)
Input modalitiesText / image / video
API pricing (international)Input $2/M, output $6/M; implicit cache hit $0,25, explicit cache write $2,5, read $0,17
Pricing China (official)Input 12 CNY/M, output 36 CNY/M, cache hit от 1,5 CNY
Arena text (snapshot 01.08)#5, 1496 pts (Preliminary); #1–4 и #6–8 — Anthropic
Arena vision#2, после Claude Fable 5
PaperBench (Alibaba internal)93,0 (+28,2 vs prev gen)
OSWorld-Verified (Alibaba internal)86,1
SWE-bench Pro (Alibaba internal)67,7 (ниже Fable 5 80,0, Opus 4.8 69,2)
HLE (Alibaba internal)43,6 (lowest среди flagships, Fable 5 53,3)
Open weightsОбещали «на следующей неделе», на момент публикации не выложены

Строки «Alibaba internal» — из официальных материалов; Artificial Analysis и Arena.ai GA-версию ещё не реплицировали независимо.

03 Под капотом 2,4T: MoE-архитектура и Agent-фичи

Зачем MoE + hybrid attention? Qwen3.8-Max продолжает линейку Qwen3.5: 2,4T total, ~95B active per token — inference cost ближе к сотням миллиардов, а не к буквальным 2,4T. Отсюда API $2/$6 (ниже Claude Opus 5 $5/$25, Fable 5 $10/$50): архитектурная эффективность vs ценовое давление.

reasoning_effort три уровня: low / medium / xhigh (default xhigh), через native API enable_thinking или Anthropic-compatible reasoning.effort — стандартный cost dial для agent-сценариев.

Long-horizon autonomy — главный headline: Alibaba заявляет 16 дней coding без human-in-the-loop, 500+ шагов chip design optimization, свой RecreationBench (black-box interaction + visual feedback). Часть логов на GitHub qwen-code-dev-bot/oh-my-cli, полного third-party audit нет.

Экосистема: Agent-платформа «Qwen Office»; API совместим с OpenAI и Anthropic — plug-in в Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw с минимальной migration friction.

  • Multimodal: text / image / video в одном API; vision Arena #2.
  • Agent race: Qwen Office vs Tencent WorkBuddy, Moonshot Kimi Work.
  • Consumer: Qwen — core generator для Apple Intelligence China; compressed version on-device на iPhone 15+.

04 Сравнение: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude

Сравнение flagship LLM (начало августа 2026)
Модель Total/active Контекст Цена in/out $/M Веса Независимые тесты
Qwen3.8-Max2,4T / 95B1M$2 / $6Не выложены (обещаны)GA-репликации нет
Kimi K32,8T / ~500B~1,05M$3 / $15Выложены (27.07)AA index ~57,11
DeepSeek V4-Pro1,6T / 490B1Mсм. официальную таблицуВыложеныSWE-bench Verified 80,6%
DeepSeek V4-Flashкак V4-Pro1Mсм. официальную таблицуВыложены9 agent/code бенчмарков выше V4-Pro
Claude Opus 5не раскрыто1M$5 / $25Closed sourceArena top tier
Claude Fable 5не раскрыто1M$10 / $50Closed sourceArena text #1

Нюанс: Kimi K3 ~500B active, DeepSeek 490B — Alibaba в preview active params вообще не называла, в GA только «95B». Отсюда критика «недостаточная прозрачность» в июле.

Единственный сопоставимый независимый blind test (269 файлов, architecture design): Kimi K3 83 pts, Qwen3.8-Max preview 80 — одна лига, без явного wipe.

В сравнительной таблице Alibaba есть сноска «результаты Fable 5 могут involve fallback» — implicit shade на конкурентов, при том что собственная методология тоже не документирована до third-party reproducibility.

05 Open-source скандал, 6 шагов интеграции и цитируемые данные

Главный risk factor — information timing gap, а не один score:

  • Лейбл до весов: qwen.ai «Open-Source» в день GA, repo и license отсутствуют.
  • Vendor-run benchmarks: включая QwenSWEBench, RecreationBench; Arena 1496 всё ещё Preliminary.
  • Preview ban: июльский preview без automated production, нет public model card / safety assessment.
  • Weights TBD: полный 2,4T checkpoint = datacenter-scale; реалистичный путь — API или ждать Qwen3.8-27B.

6 шагов для безопасной интеграции Qwen3.8-Max:

  1. Поднять QwenCloud: API key в Alibaba Model Studio / Qwen console, проверить GA model ID и regional endpoint.
  2. Выбрать compatible protocol: OpenAI или Anthropic base_url под вашу toolchain, без переписывания клиента.
  3. Настроить inference tier: medium для latency check, сложные agent tasks — xhigh / enable_thinking.
  4. Sandbox A/B: свои prompts blind vs Kimi K3 / DeepSeek V4 — не мигрировать в прод только по vendor table.
  5. Спланировать weights path: следить за Hugging Face / ModelScope «next week»; локально нереально — lock на Qwen3.8-27B.
  6. Подключить agent toolchain: заменить base URL в OpenClaw, Qoder, Claude Code, проверить long-running stability.
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

Цитируемые hard numbers (Alibaba official, Arena.ai public, 2026-08-04):

  • Total / active: 2,4T / 95B, MoE + hybrid attention
  • Контекст: 1M tokens; thinking ~983K input, output cap 131K
  • API pricing: $2/$6 per M tokens; cache hit $0,25/M
  • Arena text: #5, 1496 pts (Preliminary, snapshot 01.08)
  • Arena vision: #2, после Fable 5
  • Independent blind test: architecture K3 83 vs Qwen preview 80
  • Markets: release day HK +7%, US +4,5%
  • Weights status: promise ~10.08, на момент публикации не live

06 FAQ, industry context и продакшен-выводы

Q: Qwen3.8-Max уже можно юзать? Open source?
A: API через QwenCloud доступен, OpenAI / Anthropic compatible. Веса не выложены; «Open-Source» label описывает intent, не shipped artifact. Repo и license ожидаются ~10 августа.

Q: Qwen3.8-Max или Kimi K3?
A: Единого authoritative head-to-head нет. Blind test близко (83 vs 80); K3 выигрывает на open weights + AA index; Qwen — на lower API price и stronger multimodal.

Q: 2,4T = локально не запустить?
A: Full checkpoint требует multi-node datacenter. API billing по 95B active; indie devs должны ждать Qwen3.8-27B open release.

Q: Alibaba benchmarks — верить?
A: Как reference, не как verdict. Ждать Artificial Analysis replication или свой A/B.

Q: Impact для обычных юзеров?
A: Apple Intelligence China на compressed Qwen — iPhone users косвенно получают Qwen в system layer.

2026 — год trillion-parameter race: DeepSeek V4-Pro (1,6T), Qwen3.8-Max (2,4T), Kimi K3 (2,8T) — а DeepSeek V4-Flash показывает, что agent gains возможны без param explosion. Редкое обещание Alibaba open-source Max-level weights конкурирует с Kimi и DeepSeek за китайский open-weight ecosystem; параллельно 4 августа White House собирает OpenAI, Anthropic, Google, Meta на agent cybersecurity testing framework — open-weight land grab vs regulatory tightening.

Чистый API снижает entry barrier, но long-horizon agents на shared VPS ловят memory jitter и обрывы long connections, parallel toolchains требуют 7×24 stable host, 2,4T self-deploy = supercomputer cluster. Для production-grade OpenClaw, Qoder или Claude Code gateways JEXCLOUD multi-region bare-metal Mac — более надёжная база: dedicated Apple Silicon unified memory, no overselling, launchd-resident agents, 120-second provisioning. Ноды и цены: страница тарифов JEXCLOUD.