AI Agent Qwen Flaggschiff 2026.08.04

Alibaba Qwen3.8-Max GA: 2,4 Billionen Parameter in Arena Top 5, Open Weight versprochen für nächste Woche

Alibaba hat am 3. August 2026 das neue Flaggschiff Qwen3.8-Max (GA, vollständig verfügbar) veröffentlicht: 2,4 Billionen Gesamtparameter, 95 Milliarden aktiv, 1 Million Token Kontext, plus die Agent-Plattform „Qwen Office“. In der Arena-Text-Rangliste (Snapshot 1. August) Platz 5 mit 1496 Punkten (Preliminary) — einziges Nicht-Anthropic-Modell in den Top 8.

Für Modellauswahl und AI-Entwicklung beantwortet dieser Artikel drei Fragen: ① die Zwei-Wochen-Timeline von der Preview (19. Juli) bis GA und Transparenzprobleme; ② Kernbenchmarks im Vergleich zu Kimi K3 und DeepSeek V4; ③ die Open-Source-Label-Kontroverse — Label aktiv, Gewichte noch nicht veröffentlicht — plus eine Sechs-Schritte-Checkliste. Datenstand: 2026-08-04.

01 Von der Preview zur GA: Zwei-Wochen-Timeline und Kernschmerzen

  • 16. Juli: Moonshot veröffentlicht Kimi K3 (2,8T Parameter, 896 Experten, 16 aktiv), mit unabhängigen Reviews und Technical Report.
  • 19. Juli: Qwen3.8-Max Preview über Token Plan / Qoder / QoderWork; Preis 10 % des erwarteten GA-Tarifs; keine Aktivparameter, keine Benchmark-Tabelle; AGB verbieten automatisierte Produktionsaufrufe.
  • 27. Juli: Kimi K3-Gewichte wie versprochen auf Hugging Face, inkl. Teilen der Infrastruktur.
  • 31. Juli: DeepSeek V4-Flash GA; bei gleicher Parameterzahl deutliche Agent- und Code-Benchmark-Gewinne gegenüber V4-Pro Preview.
  • 3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle, „Qwen Office“ live; Alibaba-Aktien HK +7 %, US +4,5 %.
  • ca. 10. August (offiziell „nächste Woche“): Qwen3.8-Max und Qwen3.8-27B geplant auf Hugging Face und ModelScope — Datum und Lizenz zum Redaktionsschluss unbekannt.

Aktuelle Schmerzpunkte für Entwickler und Unternehmen:

  • Label vor Artefakt: qwen.ai trägt „Open-Source“, aber Hugging Face / ModelScope ohne Repository und Lizenz.
  • Vendor-Benchmarks: PaperBench, OSWorld, SWE-bench Pro aus Alibabas eigenem Framework — keine unabhängige GA-Replikation.
  • Preview-Transparenz: Juli-Preview ohne Aktivparameter; unabhängige Tester empfahlen Produktionsmigration zu vermeiden.
  • Wettbewerb bereits open weight: Kimi K3 und DeepSeek V4 veröffentlicht; Qwen3.8-Max nur per API als Voll-Flaggschiff.

In den Arena-Text-Top-8 ist Qwen3.8-Max das einzige Nicht-Anthropic-Modell — Eintrag jedoch Preliminary, übrige Scores vor allem Hersteller-eigen. „Erste Liga“ braucht unabhängige Verifikation.

02 Qwen3.8-Max Kerndaten im Überblick

Offizielle Kernparameter Qwen3.8-Max (GA 2026-08-03)
Merkmal Wert
Release-Datum3. August 2026 (GA)
Gesamt- / Aktivparameter2,4T / 95B
ArchitekturSparse MoE auf Qwen3.5-Basis + Hybrid-Attention
Kontextfenster1M Token (Thinking-Modus ~983K Input, Output-Limit 131K)
Input-ModalitätenText / Bild / Video
API-Preis (international)Input $2/M, Output $6/M; impliziter Cache-Hit $0,25, expliziter Cache Write $2,5, Read $0,17
Preis China (offiziell)Input 12 CNY/M, Output 36 CNY/M, Cache-Hit ab 1,5 CNY
Arena Text (Snapshot 1.8.)Platz 5, 1496 Pkt. (Preliminary); Plätze 1–4 und 6–8 Anthropic
Arena VisionPlatz 2, hinter Claude Fable 5
PaperBench (Alibaba intern)93,0 (+28,2 ggü. Vorgänger)
OSWorld-Verified (Alibaba intern)86,1
SWE-bench Pro (Alibaba intern)67,7 (unter Fable 5 80,0, Opus 4.8 69,2)
HLE (Alibaba intern)43,6 (niedrigster Flaggschiff-Wert, Fable 5 53,3)
GewichteVersprochen „nächste Woche“, zum Redaktionsschluss nicht veröffentlicht

Einträge mit „Alibaba intern“ stammen aus offiziellen Release-Materialien; Artificial Analysis und Arena.ai haben die GA-Version noch nicht unabhängig repliziert.

03 Hinter 2,4T: MoE-Architektur und Agent-Argumentation

Warum MoE + Hybrid-Attention? Qwen3.8-Max setzt die Qwen3.5-Linie fort: 2,4T Gesamt, ~95B pro Token aktiv — Inferenzkosten näher an Hundert-Milliarden-Modellen als an literal 2,4T. Grund für API-Preis $2/$6 (unter Claude Opus 5 $5/$25, Fable 5 $10/$50): Architektur-Effizienz gegen Preisdruck.

reasoning_effort drei Stufen: low / medium / xhigh (Default xhigh), steuerbar via natives API enable_thinking oder Anthropic-kompatibles reasoning.effort — Standard-Kostenregler für Agent-Szenarien.

Langläufer-Autonomie als Headline: Alibaba nennt 16 Tage Coding ohne Eingriff, 500+ Schritte Chip-Design-Optimierung, eigenes RecreationBench (Black-Box-Interaktion + visuelles Feedback). Teile dokumentiert auf GitHub qwen-code-dev-bot/oh-my-cli, kein vollständiges Third-Party-Audit.

Ökosystem: „Qwen Office“ Agent-Plattform; API kompatibel mit OpenAI und Anthropic — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw mit geringer Migrationsfriction.

  • Multimodal: Text / Bild / Video einheitlich; Vision Arena Platz 2.
  • Agent-Wettbewerb: Qwen Office vs. Tencent WorkBuddy, Moonshot Kimi Work.
  • Consumer: Qwen als Kern-Generator für Apple Intelligence China; komprimierte Version lokal auf iPhone 15+.

04 Vergleich: Qwen3.8-Max vs. Kimi K3 vs. DeepSeek V4 vs. Claude

Flaggschiff-LLM-Vergleich (Anfang August 2026)
Modell Gesamt/Aktiv Kontext Preis In/Out $/M Gewichte Unabhängige Tests
Qwen3.8-Max2,4T / 95B1M$2 / $6Nicht veröffentlicht (versprochen)Keine GA-Replikation
Kimi K32,8T / ~500B~1,05M$3 / $15Veröffentlicht (27.7.)AA-Index ~57,11
DeepSeek V4-Pro1,6T / 490B1Msiehe offizielle TabelleVeröffentlichtSWE-bench Verified 80,6 %
DeepSeek V4-Flashwie V4-Pro1Msiehe offizielle TabelleVeröffentlicht9 Agent/Code-Benchmarks über V4-Pro
Claude Opus 5nicht offengelegt1M$5 / $25Closed SourceArena-Spitze
Claude Fable 5nicht offengelegt1M$10 / $50Closed SourceArena Text Platz 1

Detail: Kimi K3 ~500B aktiv, DeepSeek 490B — Alibaba nannte in der Preview keine Aktivzahl, GA erst „95B“. Grund für Kritik „unzureichende Transparenz“ im Juli.

Einziger vergleichbarer unabhängiger Blindtest (269 Dateien, Architektur-Design): Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — gleiche Liga, kein klarer Sweep.

Alibabas Vergleichstabelle vermerkt „Fable-5-Ergebnisse möglicherweise mit Fallback“ — implizite Konkurrenz-Kritik, während die eigene Methodik ebenfalls nicht third-party-replizierbar dokumentiert ist.

05 Open-Source-Label-Kontroverse, Sechs-Schritte-Anleitung und zitierbare Daten

Die größte Risikodimension ist Informations-Timing, nicht ein einzelner Score:

  • Label vor Gewichten: qwen.ai „Open-Source“ am GA-Tag, Repository und Lizenz fehlen.
  • Vendor-run Benchmarks: inkl. QwenSWEBench, RecreationBench; Arena 1496 weiterhin Preliminary.
  • Preview-Verbot: Juli-Preview ohne automatisierte Produktion, kein öffentliches Model Card / Safety Assessment.
  • Gewichte offen: vollständiges 2,4T braucht Rechenzentrum; realistischer Pfad API oder Qwen3.8-27B.

Sechs Schritte für sichere Qwen3.8-Max-Integration:

  1. QwenCloud einrichten: API Key in Alibaba Model Studio / Qwen-Konsole, GA-Modell-ID und Regional-Endpoint prüfen.
  2. Kompatibilitätsprotokoll wählen: OpenAI oder Anthropic base_url passend zur Toolchain, Client nicht neu schreiben.
  3. Inferenz-Stufe konfigurieren: medium für Latenz-Check, komplexe Agent-Tasks xhigh / enable_thinking.
  4. Sandbox A/B: eigene Prompts blind gegen Kimi K3 / DeepSeek V4 — nicht nur Hersteller-Tabelle für Produktion.
  5. Gewichte-Pfad planen: Hugging Face / ModelScope „nächste Woche“ beobachten; lokal unrealistisch → Qwen3.8-27B.
  6. Agent-Toolchain: base URL in OpenClaw, Qoder, Claude Code ersetzen, Langläufer-Stabilität validieren.
qwen3_8_max_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_qwen_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    extra_body={"enable_thinking": True}
)

Zitierbare Kerndaten (Alibaba offiziell, Arena.ai öffentlich, 2026-08-04):

  • Gesamt / Aktiv: 2,4T / 95B, MoE + Hybrid-Attention
  • Kontext: 1M Token; Thinking ~983K Input, Output-Limit 131K
  • API-Preis: $2/$6 pro M Token; Cache-Hit $0,25/M
  • Arena Text: #5, 1496 Pkt. (Preliminary, Snapshot 1.8.)
  • Arena Vision: #2, hinter Fable 5
  • Unabhängiger Blindtest: Architektur K3 83 vs. Qwen Preview 80
  • Börse: Release-Tag HK +7 %, US +4,5 %
  • Gewichte: Versprechen ca. 10.8., zum Redaktionsschluss nicht live

06 FAQ, Branchenkontext und Produktionsfazit

F: Ist Qwen3.8-Max jetzt nutzbar? Schon open source?
A: API über QwenCloud verfügbar, OpenAI / Anthropic kompatibel. Gewichte noch nicht veröffentlicht; „Open-Source“-Label beschreibt Absicht, kein Artefakt. Repository und Lizenz erwartet ca. 10. August.

F: Qwen3.8-Max oder Kimi K3?
A: Kein einheitlicher Head-to-Head. Blindtest nah beieinander (83 vs. 80); K3-Vorteil veröffentlichte Gewichte + AA-Index; Qwen-Vorteil niedrigerer API-Preis und stärkeres Multimodal.

F: 2,4T lokal unmöglich?
A: Vollständiger Checkpoint braucht Multi-Node-Rechenzentrum. API-Kosten nach 95B aktiv; Privatentwickler sollten Qwen3.8-27B abwarten.

F: Alibaba-Benchmarks vertrauenswürdig?
A: Als Referenz, nicht als Urteil. Auf Artificial Analysis-Replikation oder eigenes A/B warten.

F: Relevanz für Endnutzer?
A: Apple Intelligence China nutzt komprimierte Qwen-Modelle — iPhone-Nutzer indirekt im Systemstack.

2026 ist das Jahr der Billionen-Parameter: DeepSeek V4-Pro (1,6T), Qwen3.8-Max (2,4T), Kimi K3 (2,8T) — DeepSeek V4-Flash zeigt, dass Agent-Gewinne ohne Parameter-Explosion möglich sind. Alibabas seltenes Max-Open-Weight-Versprechen konkurriert mit Kimi und DeepSeek um das chinesische Open-Weight-Ökosystem; parallel diskutiert das Weiße Haus am 4. August mit OpenAI, Anthropic, Google und Meta Agent-Cybersicherheits-Tests — Open-Weight-Rennen vs. Regulierung.

Reine API-Nutzung senkt die Einstiegshürde, aber Langläufer-Agenten auf Shared VPS leiden unter RAM-Jitter und abgebrochenen Long Connections, parallele Toolchains brauchen 7×24-stabile Hosts, 2,4T Self-Deploy braucht Supercomputer-Cluster. Für dauerhaft laufende OpenClaw-, Qoder- oder Claude-Code-Gateways in Produktion ist JEXCLOUD Multi-Region Bare-Metal Mac die robustere Basis: dediziertes Apple-Silicon-Unified-Memory, kein Overselling, launchd-residente Agents, 120-Sekunden-Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.