Alibaba Qwen3.8-Max GA: 2,4T параметров в Arena top 5, веса обещали на следующей неделе
Alibaba 3 августа 2026 выкатила флагман Qwen3.8-Max в GA: 2,4 триллиона total params, 95B active, контекст 1M tokens, плюс Agent-платформа «Qwen Office». Arena text (снапшот 1 августа): #5, 1496 pts (Preliminary) — единственный non-Anthropic в top 8.
Для тех, кто выбирает модель или пилит AI-стек, разбираем три вещи: ① двухнедельный таймлайн от preview (19 июля) до GA и дыры в прозрачности; ② бенчмарки vs Kimi K3 и DeepSeek V4; ③ open-source лейбл без весов и чеклист из шести шагов. Данные на 2026-08-04.
01 От preview к GA: двухнедельный таймлайн и болевые точки
- 16 июля: Moonshot релизит Kimi K3 (2,8T params, 896 experts, 16 active) с независимыми ревью и technical report.
- 19 июля: Qwen3.8-Max preview через Token Plan / Qoder / QoderWork; цена 10% от ожидаемого GA; active params не раскрыты, бенчмарков нет; ToS запрещает automated production calls.
- 27 июля: Kimi K3 weights на Hugging Face как обещали, часть infra тоже open.
- 31 июля: DeepSeek V4-Flash GA; при тех же params сильный прирост на agent/code бенчмарках vs V4-Pro preview.
- 3 августа: Qwen3.8-Max GA с полной таблицей бенчмарков, «Qwen Office» live; акции Alibaba HK +7%, US +4,5%.
- ~10 августа (официально «на следующей неделе»): Qwen3.8-Max и Qwen3.8-27B планируются на Hugging Face и ModelScope — дата и лицензия на момент публикации неизвестны.
Текущие pain points для девов и enterprise:
- Лейбл раньше артефакта: qwen.ai уже «Open-Source», но на Hugging Face / ModelScope нет репо и лицензии.
- Vendor-run бенчмарки: PaperBench, OSWorld, SWE-bench Pro из внутреннего фреймворка Alibaba — независимой GA-репликации нет.
- Preview без прозрачности: в июле active params не раскрывали; независимые тестеры советовали не тащить в прод.
- Конкуренты уже open weight: Kimi K3 и DeepSeek V4 выложены; Qwen3.8-Max flagship только через API.
В Arena text top 8 Qwen3.8-Max — единственный non-Anthropic, но запись Preliminary, остальные скоры в основном vendor-run. «Первая лига» требует независимой верификации.
02 Ключевые цифры Qwen3.8-Max
| Параметр | Значение |
|---|---|
| Дата релиза | 3 августа 2026 (GA) |
| Total / active params | 2,4T / 95B |
| Архитектура | Sparse MoE на базе Qwen3.5 + hybrid attention |
| Контекст | 1M tokens (thinking mode ~983K input, output cap 131K) |
| Input modalities | Text / image / video |
| API pricing (international) | Input $2/M, output $6/M; implicit cache hit $0,25, explicit cache write $2,5, read $0,17 |
| Pricing China (official) | Input 12 CNY/M, output 36 CNY/M, cache hit от 1,5 CNY |
| Arena text (snapshot 01.08) | #5, 1496 pts (Preliminary); #1–4 и #6–8 — Anthropic |
| Arena vision | #2, после Claude Fable 5 |
| PaperBench (Alibaba internal) | 93,0 (+28,2 vs prev gen) |
| OSWorld-Verified (Alibaba internal) | 86,1 |
| SWE-bench Pro (Alibaba internal) | 67,7 (ниже Fable 5 80,0, Opus 4.8 69,2) |
| HLE (Alibaba internal) | 43,6 (lowest среди flagships, Fable 5 53,3) |
| Open weights | Обещали «на следующей неделе», на момент публикации не выложены |
Строки «Alibaba internal» — из официальных материалов; Artificial Analysis и Arena.ai GA-версию ещё не реплицировали независимо.
03 Под капотом 2,4T: MoE-архитектура и Agent-фичи
Зачем MoE + hybrid attention? Qwen3.8-Max продолжает линейку Qwen3.5: 2,4T total, ~95B active per token — inference cost ближе к сотням миллиардов, а не к буквальным 2,4T. Отсюда API $2/$6 (ниже Claude Opus 5 $5/$25, Fable 5 $10/$50): архитектурная эффективность vs ценовое давление.
reasoning_effort три уровня: low / medium / xhigh (default xhigh), через native API enable_thinking или Anthropic-compatible reasoning.effort — стандартный cost dial для agent-сценариев.
Long-horizon autonomy — главный headline: Alibaba заявляет 16 дней coding без human-in-the-loop, 500+ шагов chip design optimization, свой RecreationBench (black-box interaction + visual feedback). Часть логов на GitHub qwen-code-dev-bot/oh-my-cli, полного third-party audit нет.
Экосистема: Agent-платформа «Qwen Office»; API совместим с OpenAI и Anthropic — plug-in в Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw с минимальной migration friction.
- Multimodal: text / image / video в одном API; vision Arena #2.
- Agent race: Qwen Office vs Tencent WorkBuddy, Moonshot Kimi Work.
- Consumer: Qwen — core generator для Apple Intelligence China; compressed version on-device на iPhone 15+.
04 Сравнение: Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Модель | Total/active | Контекст | Цена in/out $/M | Веса | Независимые тесты |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | $2 / $6 | Не выложены (обещаны) | GA-репликации нет |
| Kimi K3 | 2,8T / ~500B | ~1,05M | $3 / $15 | Выложены (27.07) | AA index ~57,11 |
| DeepSeek V4-Pro | 1,6T / 490B | 1M | см. официальную таблицу | Выложены | SWE-bench Verified 80,6% |
| DeepSeek V4-Flash | как V4-Pro | 1M | см. официальную таблицу | Выложены | 9 agent/code бенчмарков выше V4-Pro |
| Claude Opus 5 | не раскрыто | 1M | $5 / $25 | Closed source | Arena top tier |
| Claude Fable 5 | не раскрыто | 1M | $10 / $50 | Closed source | Arena text #1 |
Нюанс: Kimi K3 ~500B active, DeepSeek 490B — Alibaba в preview active params вообще не называла, в GA только «95B». Отсюда критика «недостаточная прозрачность» в июле.
Единственный сопоставимый независимый blind test (269 файлов, architecture design): Kimi K3 83 pts, Qwen3.8-Max preview 80 — одна лига, без явного wipe.
В сравнительной таблице Alibaba есть сноска «результаты Fable 5 могут involve fallback» — implicit shade на конкурентов, при том что собственная методология тоже не документирована до third-party reproducibility.
05 Open-source скандал, 6 шагов интеграции и цитируемые данные
Главный risk factor — information timing gap, а не один score:
- Лейбл до весов: qwen.ai «Open-Source» в день GA, repo и license отсутствуют.
- Vendor-run benchmarks: включая QwenSWEBench, RecreationBench; Arena 1496 всё ещё Preliminary.
- Preview ban: июльский preview без automated production, нет public model card / safety assessment.
- Weights TBD: полный 2,4T checkpoint = datacenter-scale; реалистичный путь — API или ждать Qwen3.8-27B.
6 шагов для безопасной интеграции Qwen3.8-Max:
- Поднять QwenCloud: API key в Alibaba Model Studio / Qwen console, проверить GA model ID и regional endpoint.
- Выбрать compatible protocol: OpenAI или Anthropic
base_urlпод вашу toolchain, без переписывания клиента. - Настроить inference tier: medium для latency check, сложные agent tasks — xhigh /
enable_thinking. - Sandbox A/B: свои prompts blind vs Kimi K3 / DeepSeek V4 — не мигрировать в прод только по vendor table.
- Спланировать weights path: следить за Hugging Face / ModelScope «next week»; локально нереально — lock на Qwen3.8-27B.
- Подключить agent toolchain: заменить base URL в OpenClaw, Qoder, Claude Code, проверить long-running stability.
from openai import OpenAI
client = OpenAI(
api_key="your_qwen_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
extra_body={"enable_thinking": True}
)
Цитируемые hard numbers (Alibaba official, Arena.ai public, 2026-08-04):
- Total / active: 2,4T / 95B, MoE + hybrid attention
- Контекст: 1M tokens; thinking ~983K input, output cap 131K
- API pricing: $2/$6 per M tokens; cache hit $0,25/M
- Arena text: #5, 1496 pts (Preliminary, snapshot 01.08)
- Arena vision: #2, после Fable 5
- Independent blind test: architecture K3 83 vs Qwen preview 80
- Markets: release day HK +7%, US +4,5%
- Weights status: promise ~10.08, на момент публикации не live
06 FAQ, industry context и продакшен-выводы
Q: Qwen3.8-Max уже можно юзать? Open source?
A: API через QwenCloud доступен, OpenAI / Anthropic compatible. Веса не выложены; «Open-Source» label описывает intent, не shipped artifact. Repo и license ожидаются ~10 августа.
Q: Qwen3.8-Max или Kimi K3?
A: Единого authoritative head-to-head нет. Blind test близко (83 vs 80); K3 выигрывает на open weights + AA index; Qwen — на lower API price и stronger multimodal.
Q: 2,4T = локально не запустить?
A: Full checkpoint требует multi-node datacenter. API billing по 95B active; indie devs должны ждать Qwen3.8-27B open release.
Q: Alibaba benchmarks — верить?
A: Как reference, не как verdict. Ждать Artificial Analysis replication или свой A/B.
Q: Impact для обычных юзеров?
A: Apple Intelligence China на compressed Qwen — iPhone users косвенно получают Qwen в system layer.
2026 — год trillion-parameter race: DeepSeek V4-Pro (1,6T), Qwen3.8-Max (2,4T), Kimi K3 (2,8T) — а DeepSeek V4-Flash показывает, что agent gains возможны без param explosion. Редкое обещание Alibaba open-source Max-level weights конкурирует с Kimi и DeepSeek за китайский open-weight ecosystem; параллельно 4 августа White House собирает OpenAI, Anthropic, Google, Meta на agent cybersecurity testing framework — open-weight land grab vs regulatory tightening.
Чистый API снижает entry barrier, но long-horizon agents на shared VPS ловят memory jitter и обрывы long connections, parallel toolchains требуют 7×24 stable host, 2,4T self-deploy = supercomputer cluster. Для production-grade OpenClaw, Qoder или Claude Code gateways JEXCLOUD multi-region bare-metal Mac — более надёжная база: dedicated Apple Silicon unified memory, no overselling, launchd-resident agents, 120-second provisioning. Ноды и цены: страница тарифов JEXCLOUD.