Alibaba Qwen3.8-Max GA: 2,4 Billionen Parameter in Arena Top 5, Open Weight versprochen für nächste Woche
Alibaba hat am 3. August 2026 das neue Flaggschiff Qwen3.8-Max (GA, vollständig verfügbar) veröffentlicht: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, 1 Million Token Kontext, plus die Agent-Plattform „Qwen Office“. In der Arena-Text-Rangliste (Snapshot 1. August) Platz 5 mit 1496 Punkten (Preliminary) — einziges Nicht-Anthropic-Modell in den Top 8.
Für Modellauswahl und AI-Entwicklung beantwortet dieser Artikel drei Fragen: ① die Zwei-Wochen-Timeline von der Preview (19. Juli) bis GA und Transparenzprobleme; ② Kernbenchmarks im Vergleich zu Kimi K3 und DeepSeek V4; ③ die Open-Source-Label-Kontroverse — Label aktiv, Gewichte noch nicht veröffentlicht — plus eine Sechs-Schritte-Checkliste. Datenstand: 2026-08-04.
01 Von der Preview zur GA: Zwei-Wochen-Timeline und Kernschmerzen
- 16. Juli: Moonshot veröffentlicht Kimi K3 (2,8T Parameter, 896 Experten, 16 aktiv), mit unabhängigen Reviews und Technical Report.
- 19. Juli: Qwen3.8-Max Preview über Token Plan / Qoder / QoderWork; Preis 10 % des erwarteten GA-Tarifs; keine Aktivparameter, keine Benchmark-Tabelle; AGB verbieten automatisierte Produktionsaufrufe.
- 27. Juli: Kimi K3-Gewichte wie versprochen auf Hugging Face, inkl. Teilen der Infrastruktur.
- 31. Juli: DeepSeek V4-Flash GA; bei gleicher Parameterzahl deutliche Agent- und Code-Benchmark-Gewinne gegenüber V4-Pro Preview.
- 3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle, „Qwen Office“ live; Alibaba-Aktien HK +7 %, US +4,5 %.
- ca. 10. August (offiziell „nächste Woche“): Qwen3.8-Max und Qwen3.8-27B geplant auf Hugging Face und ModelScope — Datum und Lizenz zum Redaktionsschluss unbekannt.
Aktuelle Schmerzpunkte für Entwickler und Unternehmen:
- Label vor Artefakt: qwen.ai trägt „Open-Source“, aber Hugging Face / ModelScope ohne Repository und Lizenz.
- Vendor-Benchmarks: PaperBench, OSWorld, SWE-bench Pro aus Alibabas eigenem Framework — keine unabhängige GA-Replikation.
- Preview-Transparenz: Juli-Preview ohne Aktivparameter; unabhängige Tester empfahlen Produktionsmigration zu vermeiden.
- Wettbewerb bereits open weight: Kimi K3 und DeepSeek V4 veröffentlicht; Qwen3.8-Max nur per API als Voll-Flaggschiff.
In den Arena-Text-Top-8 ist Qwen3.8-Max das einzige Nicht-Anthropic-Modell — Eintrag jedoch Preliminary, übrige Scores vor allem Hersteller-eigen. „Erste Liga“ braucht unabhängige Verifikation.
02 Qwen3.8-Max Kerndaten im Überblick
| Merkmal | Wert |
|---|---|
| Release-Datum | 3. August 2026 (GA) |
| Gesamt- / Aktivparameter | 2,4T / 95B |
| Architektur | Sparse MoE auf Qwen3.5-Basis + Hybrid-Attention |
| Kontextfenster | 1M Token (Thinking-Modus ~983K Input, Output-Limit 131K) |
| Input-Modalitäten | Text / Bild / Video |
| API-Preis (international) | Input $2/M, Output $6/M; impliziter Cache-Hit $0,25, expliziter Cache Write $2,5, Read $0,17 |
| Preis China (offiziell) | Input 12 CNY/M, Output 36 CNY/M, Cache-Hit ab 1,5 CNY |
| Arena Text (Snapshot 1.8.) | Platz 5, 1496 Pkt. (Preliminary); Plätze 1–4 und 6–8 Anthropic |
| Arena Vision | Platz 2, hinter Claude Fable 5 |
| PaperBench (Alibaba intern) | 93,0 (+28,2 ggü. Vorgänger) |
| OSWorld-Verified (Alibaba intern) | 86,1 |
| SWE-bench Pro (Alibaba intern) | 67,7 (unter Fable 5 80,0, Opus 4.8 69,2) |
| HLE (Alibaba intern) | 43,6 (niedrigster Flaggschiff-Wert, Fable 5 53,3) |
| Gewichte | Versprochen „nächste Woche“, zum Redaktionsschluss nicht veröffentlicht |
Einträge mit „Alibaba intern“ stammen aus offiziellen Release-Materialien; Artificial Analysis und Arena.ai haben die GA-Version noch nicht unabhängig repliziert.
03 Hinter 2,4T: MoE-Architektur und Agent-Argumentation
Warum MoE + Hybrid-Attention? Qwen3.8-Max setzt die Qwen3.5-Linie fort: 2,4T Gesamt, ~95B pro Token aktiv — Inferenzkosten näher an Hundert-Milliarden-Modellen als an literal 2,4T. Grund für API-Preis $2/$6 (unter Claude Opus 5 $5/$25, Fable 5 $10/$50): Architektur-Effizienz gegen Preisdruck.
reasoning_effort drei Stufen: low / medium / xhigh (Default xhigh), steuerbar via natives API enable_thinking oder Anthropic-kompatibles reasoning.effort — Standard-Kostenregler für Agent-Szenarien.
Langläufer-Autonomie als Headline: Alibaba nennt 16 Tage Coding ohne Eingriff, 500+ Schritte Chip-Design-Optimierung, eigenes RecreationBench (Black-Box-Interaktion + visuelles Feedback). Teile dokumentiert auf GitHub qwen-code-dev-bot/oh-my-cli, kein vollständiges Third-Party-Audit.
Ökosystem: „Qwen Office“ Agent-Plattform; API kompatibel mit OpenAI und Anthropic — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw mit geringer Migrationsfriction.
- Multimodal: Text / Bild / Video einheitlich; Vision Arena Platz 2.
- Agent-Wettbewerb: Qwen Office vs. Tencent WorkBuddy, Moonshot Kimi Work.
- Consumer: Qwen als Kern-Generator für Apple Intelligence China; komprimierte Version lokal auf iPhone 15+.
04 Vergleich: Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude
| Modell | Gesamt/Aktiv | Kontext | Preis In/Out $/M | Gewichte | Unabhängige Tests |
|---|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 95B | 1M | $2 / $6 | Nicht veröffentlicht (versprochen) | Keine GA-Replikation |
| Kimi K3 | 2,8T / ~500B | ~1,05M | $3 / $15 | Veröffentlicht (27.7.) | AA-Index ~57,11 |
| DeepSeek V4-Pro | 1,6T / 490B | 1M | siehe offizielle Tabelle | Veröffentlicht | SWE-bench Verified 80,6 % |
| DeepSeek V4-Flash | wie V4-Pro | 1M | siehe offizielle Tabelle | Veröffentlicht | 9 Agent/Code-Benchmarks über V4-Pro |
| Claude Opus 5 | nicht offengelegt | 1M | $5 / $25 | Closed Source | Arena-Spitze |
| Claude Fable 5 | nicht offengelegt | 1M | $10 / $50 | Closed Source | Arena Text Platz 1 |
Detail: Kimi K3 ~500B aktiv, DeepSeek 490B — Alibaba nannte in der Preview keine Aktivzahl, GA erst „95B“. Grund für Kritik „unzureichende Transparenz“ im Juli.
Einziger vergleichbarer unabhängiger Blindtest (269 Dateien, Architektur-Design): Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — gleiche Liga, kein klarer Sweep.
Alibabas Vergleichstabelle vermerkt „Fable-5-Ergebnisse möglicherweise mit Fallback“ — implizite Konkurrenz-Kritik, während die eigene Methodik ebenfalls nicht third-party-replizierbar dokumentiert ist.
05 Open-Source-Label-Kontroverse, Sechs-Schritte-Anleitung und zitierbare Daten
Die größte Risikodimension ist Informations-Timing, nicht ein einzelner Score:
- Label vor Gewichten: qwen.ai „Open-Source“ am GA-Tag, Repository und Lizenz fehlen.
- Vendor-run Benchmarks: inkl. QwenSWEBench, RecreationBench; Arena 1496 weiterhin Preliminary.
- Preview-Verbot: Juli-Preview ohne automatisierte Produktion, kein öffentliches Model Card / Safety Assessment.
- Gewichte offen: vollständiges 2,4T braucht Rechenzentrum; realistischer Pfad API oder Qwen3.8-27B.
Sechs Schritte für sichere Qwen3.8-Max-Integration:
- QwenCloud einrichten: API Key in Alibaba Model Studio / Qwen-Konsole, GA-Modell-ID und Regional-Endpoint prüfen.
- Kompatibilitätsprotokoll wählen: OpenAI oder Anthropic
base_urlpassend zur Toolchain, Client nicht neu schreiben. - Inferenz-Stufe konfigurieren: medium für Latenz-Check, komplexe Agent-Tasks xhigh /
enable_thinking. - Sandbox A/B: eigene Prompts blind gegen Kimi K3 / DeepSeek V4 — nicht nur Hersteller-Tabelle für Produktion.
- Gewichte-Pfad planen: Hugging Face / ModelScope „nächste Woche“ beobachten; lokal unrealistisch → Qwen3.8-27B.
- Agent-Toolchain: base URL in OpenClaw, Qoder, Claude Code ersetzen, Langläufer-Stabilität validieren.
from openai import OpenAI
client = OpenAI(
api_key="your_qwen_api_key",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
response = client.chat.completions.create(
model="qwen3.8-max",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
extra_body={"enable_thinking": True}
)
Zitierbare Kerndaten (Alibaba offiziell, Arena.ai öffentlich, 2026-08-04):
- Gesamt / Aktiv: 2,4T / 95B, MoE + Hybrid-Attention
- Kontext: 1M Token; Thinking ~983K Input, Output-Limit 131K
- API-Preis: $2/$6 pro M Token; Cache-Hit $0,25/M
- Arena Text: #5, 1496 Pkt. (Preliminary, Snapshot 1.8.)
- Arena Vision: #2, hinter Fable 5
- Unabhängiger Blindtest: Architektur K3 83 vs. Qwen Preview 80
- Börse: Release-Tag HK +7 %, US +4,5 %
- Gewichte: Versprechen ca. 10.8., zum Redaktionsschluss nicht live
06 FAQ, Branchenkontext und Produktionsfazit
F: Ist Qwen3.8-Max jetzt nutzbar? Schon open source?
A: API über QwenCloud verfügbar, OpenAI / Anthropic kompatibel. Gewichte noch nicht veröffentlicht; „Open-Source“-Label beschreibt Absicht, kein Artefakt. Repository und Lizenz erwartet ca. 10. August.
F: Qwen3.8-Max oder Kimi K3?
A: Kein einheitlicher Head-to-Head. Blindtest nah beieinander (83 vs. 80); K3-Vorteil veröffentlichte Gewichte + AA-Index; Qwen-Vorteil niedrigerer API-Preis und stärkeres Multimodal.
F: 2,4T lokal unmöglich?
A: Vollständiger Checkpoint braucht Multi-Node-Rechenzentrum. API-Kosten nach 95B aktiv; Privatentwickler sollten Qwen3.8-27B abwarten.
F: Alibaba-Benchmarks vertrauenswürdig?
A: Als Referenz, nicht als Urteil. Auf Artificial Analysis-Replikation oder eigenes A/B warten.
F: Relevanz für Endnutzer?
A: Apple Intelligence China nutzt komprimierte Qwen-Modelle — iPhone-Nutzer indirekt im Systemstack.
2026 ist das Jahr der Billionen-Parameter: DeepSeek V4-Pro (1,6T), Qwen3.8-Max (2,4T), Kimi K3 (2,8T) — DeepSeek V4-Flash zeigt, dass Agent-Gewinne ohne Parameter-Explosion möglich sind. Alibabas seltenes Max-Open-Weight-Versprechen konkurriert mit Kimi und DeepSeek um das chinesische Open-Weight-Ökosystem; parallel diskutiert das Weiße Haus am 4. August mit OpenAI, Anthropic, Google und Meta Agent-Cybersicherheits-Tests — Open-Weight-Rennen vs. Regulierung.
Reine API-Nutzung senkt die Einstiegshürde, aber Langläufer-Agenten auf Shared VPS leiden unter RAM-Jitter und abgebrochenen Long Connections, parallele Toolchains brauchen 7×24-stabile Hosts, 2,4T Self-Deploy braucht Supercomputer-Cluster. Für dauerhaft laufende OpenClaw-, Qoder- oder Claude-Code-Gateways in Produktion ist JEXCLOUD Multi-Region Bare-Metal Mac die robustere Basis: dediziertes Apple-Silicon-Unified-Memory, kein Overselling, launchd-residente Agents, 120-Sekunden-Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.