Alibaba Qwen3.8-Max en GA : 2,4 billions de paramètres dans le top 5 Arena, poids open source promis la semaine prochaine
Alibaba a officiellement mis en GA le 3 août 2026 son nouveau modèle phare Qwen3.8-Max : 2,4 billions de paramètres totaux, 95 milliards actifs, contexte 1 million de tokens, avec la plateforme Agent « Qwen Office ». Arena texte (snapshot du 1er août) : 5e place, 1496 points (Preliminary) — seul modèle non Anthropic dans le top 8.
Pour les équipes en phase de sélection et les développeurs IA, cet article couvre : ① la chronologie de deux semaines entre preview (19 juillet) et GA, avec les lacunes de transparence ; ② les benchmarks clés face à Kimi K3 et DeepSeek V4 ; ③ la controverse du label open source — badge affiché, poids non publiés — et une checklist d'intégration en six étapes. Données au 2026-08-04.
01 De la preview à la GA : chronologie de deux semaines et enjeux clés
- 16 juillet : Moonshot publie Kimi K3 (2,8T paramètres, 896 experts, 16 actifs), avec évaluations indépendantes et technical report.
- 19 juillet : Qwen3.8-Max en preview via Token Plan / Qoder / QoderWork ; tarif à 10 % du prix GA attendu ; paramètres actifs non divulgués, pas de tableau de benchmarks ; CGU interdisant l'appel automatisé en production.
- 27 juillet : Kimi K3 — poids publiés sur Hugging Face comme promis, partie de l'infrastructure open source.
- 31 juillet : DeepSeek V4-Flash en GA ; gains substantiels sur benchmarks agent et code à paramétrage identique vs preview V4-Pro.
- 3 août : Qwen3.8-Max GA avec tableau complet de benchmarks, « Qwen Office » en ligne ; action Alibaba +7 % à Hong Kong, +4,5 % aux États-Unis.
- vers le 10 août (formulation officielle « la semaine prochaine ») : Qwen3.8-Max et Qwen3.8-27B attendus sur Hugging Face et ModelScope — date et licence non confirmées à la rédaction.
Points de friction actuels pour développeurs et entreprises :
- Label avant artefact : qwen.ai affiche « Open-Source », sans dépôt ni licence sur Hugging Face / ModelScope.
- Benchmarks éditeur : PaperBench, OSWorld, SWE-bench Pro issus du framework interne Alibaba — pas de réplication GA par un tiers.
- Transparence preview : juillet sans paramètres actifs ; plusieurs évaluateurs indépendants ont déconseillé la migration production.
- Concurrence déjà open weight : Kimi K3 et DeepSeek V4 publiés ; Qwen3.8-Max flagship accessible uniquement par API.
Dans le top 8 Arena texte, Qwen3.8-Max est le seul modèle non Anthropic — entrée marquée Preliminary, et la plupart des scores restent auto-évalués. Le statut « première ligue » exige une validation indépendante.
02 Données clés Qwen3.8-Max
| Élément | Valeur |
|---|---|
| Date de release | 3 août 2026 (GA) |
| Paramètres totaux / actifs | 2,4T / 95B |
| Architecture | MoE sparse sur base Qwen3.5 + attention hybride |
| Fenêtre de contexte | 1M tokens (mode thinking ~983K entrée, plafond sortie 131K) |
| Modalités d'entrée | Texte / image / vidéo |
| Tarif API (international) | Entrée $2/M, sortie $6/M ; cache implicite hit $0,25, écriture cache explicite $2,5, lecture $0,17 |
| Tarif Chine (officiel) | Entrée 12 CNY/M, sortie 36 CNY/M, cache hit dès 1,5 CNY |
| Arena texte (snapshot 01/08) | 5e place, 1496 pts (Preliminary) ; rangs 1–4 et 6–8 Anthropic |
| Arena vision | 2e place, derrière Claude Fable 5 |
| PaperBench (Alibaba interne) | 93,0 (+28,2 vs génération précédente) |
| OSWorld-Verified (Alibaba interne) | 86,1 |
| SWE-bench Pro (Alibaba interne) | 67,7 (sous Fable 5 80,0, Opus 4.8 69,2) |
| HLE (Alibaba interne) | 43,6 (plus bas des flagships, Fable 5 53,3) |
| Poids open source | Promis « semaine prochaine », non publiés à la rédaction |
Les lignes « Alibaba interne » proviennent des supports officiels ; Artificial Analysis et l'équipe Arena.ai n'ont pas encore répliqué la version GA de façon indépendante.
03 Sous les 2,4T : architecture MoE et proposition Agent
Pourquoi MoE + attention hybride ? Qwen3.8-Max prolonge Qwen3.5 : 2,4T au total, ~95B activés par token — coût d'inférence proche d'un modèle centaines de milliards plutôt que de 2,4T littéraux. Cela explique le tarif API $2/$6 (inférieur à Claude Opus 5 $5/$25, Fable 5 $10/$50) : efficacité architecturale au service du prix.
reasoning_effort en trois niveaux : low / medium / xhigh (défaut xhigh), réglable via API native enable_thinking ou interface compatible Anthropic reasoning.effort — levier de coût standard en scénarios Agent.
Tâches autonomes longues comme argument central : Alibaba cite 16 jours de coding sans intervention, optimisation chip design 500+ étapes, benchmark propriétaire RecreationBench (interaction boîte noire + retour visuel). Documentation partielle sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.
Positionnement écosystème : plateforme Agent « Qwen Office » ; API compatible OpenAI et Anthropic — intégration Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw avec friction minimale.
- Multimodal : texte / image / vidéo unifiés ; Arena vision 2e place.
- Concurrence Agent : Qwen Office vs Tencent WorkBuddy, Moonshot Kimi Work.
- Grand public : Qwen moteur génératif de Apple Intelligence Chine ; version compressée en local sur iPhone 15+.
04 Comparaison : Qwen3.8-Max vs Kimi K3 vs DeepSeek V4 vs Claude
| Modèle | Total/actif | Contexte | Prix in/out $/M | Poids | Évaluations indépendantes |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | $2 / $6 | Non publiés (promis) | Pas de réplication GA |
| Kimi K3 | 2,8T / ~500B | ~1,05M | $3 / $15 | Publiés (27/07) | Indice AA ~57,11 |
| DeepSeek V4-Pro | 1,6T / 490B | 1M | voir grille officielle | Publiés | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | identique V4-Pro | 1M | voir grille officielle | Publiés | 9 benchmarks agent/code au-dessus V4-Pro |
| Claude Opus 5 | non divulgué | 1M | $5 / $25 | Propriétaire | Tête Arena |
| Claude Fable 5 | non divulgué | 1M | $10 / $50 | Propriétaire | Arena texte #1 |
Détail souvent omis : Kimi K3 ~500B actifs, DeepSeek 490B — Alibaba n'a divulgué aucun chiffre actif en preview, GA seulement « 95B ». Source de la critique « transparence insuffisante » en juillet.
Seul blind test indépendant comparable (269 fichiers, conception d'architecture) : Kimi K3 83 points, Qwen3.8-Max preview 80 — même catégorie, pas de domination nette.
Le tableau comparatif Alibaba note que « les résultats Fable 5 pourraient impliquer un fallback » — critique implicite des concurrents, alors que la méthodologie interne n'est pas documentée à un niveau reproductible par un tiers.
05 Controverse open source, guide en six étapes et données citables
Le risque principal est le décalage informationnel, plus qu'un score isolé :
- Label avant poids : qwen.ai « Open-Source » le jour du GA, dépôt et licence absents.
- Benchmarks vendor-run : QwenSWEBench, RecreationBench inclus ; Arena 1496 toujours Preliminary.
- Interdiction preview : juillet sans appel automatisé production, pas de model card ni évaluation sécurité publique.
- Poids en attente : 2,4T complet exige infrastructure datacenter ; voie réaliste API ou Qwen3.8-27B.
Six étapes pour intégrer Qwen3.8-Max en production de façon prudente :
- Configurer QwenCloud : clé API dans Alibaba Model Studio / console Qwen, vérifier ID modèle GA et endpoint régional.
- Choisir le protocole compatible :
base_urlOpenAI ou Anthropic selon la toolchain, sans réécrire le client. - Régler le niveau d'inférence : medium pour valider la latence, xhigh /
enable_thinkingpour agents complexes. - A/B en sandbox : prompts métier en blind test vs Kimi K3 / DeepSeek V4 — ne pas migrer sur la seule base du tableau éditeur.
- Anticiper la voie poids : surveiller Hugging Face / ModelScope « semaine prochaine » ; déploiement local irréaliste → Qwen3.8-27B.
- Brancher la toolchain Agent : remplacer base URL dans OpenClaw, Qoder, Claude Code, valider stabilité des tâches longues.
from openai import OpenAI
client = OpenAI(
api_key="your_qwen_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
extra_body={"enable_thinking": True}
)
Données citables (Alibaba officiel, Arena.ai public, 2026-08-04) :
- Total / actif : 2,4T / 95B, MoE + attention hybride
- Contexte : 1M tokens ; thinking ~983K entrée, plafond sortie 131K
- Tarif API : $2/$6 par M tokens ; cache hit $0,25/M
- Arena texte : #5, 1496 pts (Preliminary, snapshot 01/08)
- Arena vision : #2, derrière Fable 5
- Blind test indépendant : architecture K3 83 vs Qwen preview 80
- Marchés : jour du release HK +7 %, US +4,5 %
- État des poids : promesse vers 10/08, non en ligne à la rédaction
06 FAQ, contexte sectoriel et conclusion production
Q : Qwen3.8-Max est-il utilisable maintenant ? Open source ?
R : API disponible via QwenCloud, compatible OpenAI / Anthropic. Poids non publiés ; le label « Open-Source » décrit une intention, pas un artefact livré. Dépôt et licence attendus vers le 10 août.
Q : Qwen3.8-Max ou Kimi K3 ?
R : Pas de confronto unique de référence. Blind test proche (83 vs 80) ; avantage K3 sur poids publiés et indice AA ; avantage Qwen sur tarif API et multimodal.
Q : 2,4T implique-t-il l'impossibilité du local ?
R : Checkpoint complet = cluster multi-nœuds. Facturation API sur 95B actifs ; développeurs individuels : attendre Qwen3.8-27B.
Q : Les benchmarks Alibaba sont-ils fiables ?
R : Référence utile, pas verdict. Attendre réplication Artificial Analysis ou A/B métier.
Q : Impact grand public ?
R : Apple Intelligence Chine s'appuie sur Qwen compressé — les utilisateurs iPhone y accèdent indirectement via le système.
2026 marque l'ère des billions de paramètres : DeepSeek V4-Pro (1,6T), Qwen3.8-Max (2,4T), Kimi K3 (2,8T) — DeepSeek V4-Flash démontre des gains agent sans explosion paramétrique. La promesse rare d'Alibaba d'open sourcer un Max entre en concurrence avec Kimi et DeepSeek pour l'écosystème open weight chinois ; parallèlement, la Maison Blanche réunit le 4 août OpenAI, Anthropic, Google et Meta sur un cadre de tests cybersécurité Agent — course open weight vs resserrement réglementaire.
L'API seule abaisse la barrière d'entrée, mais les agents longue durée sur VPS partagé subissent jitter mémoire et coupures de connexion, les toolchains parallèles exigent un hôte stable 7×24, et le déploiement 2,4T requiert un cluster supercalculateur. Pour des gateways OpenClaw, Qoder ou Claude Code en production continue, JEXCLOUD Mac bare metal multi-région constitue la base la plus fiable : mémoire unifiée Apple Silicon dédiée, pas de survente, agents résidents launchd, provisionnement en 120 secondes. Nœuds et tarifs : page tarifs JEXCLOUD.