AI Agent 2026.08.17

DeepSeek-Preisanstieg, Qwen-Open-Weights und GLM-5.3: Warum stellen Chinas Großmodelle im August um?

In den fünf Tagen vom 12. bis 17. August haben Chinas Großmodell-Labore drei Schritte gesetzt, die sich widersprechen und zugleich ergänzen: DeepSeek kündigt API-Preiserhöhungen von über 1.100 % in einzelnen Stufen an. Alibaba legt im selben Fenster die nie zuvor offenen Qwen-Max-Flaggschiff-Gewichte mit 2,4 Billionen Parametern vor. Zhipu zieht mit demselben Basismodell, allein über Nachtraining, die Programmier-Benchmarks um ein Vielfaches nach oben. Drei Unternehmen, drei Spielzüge — ein Signal: chinesische Großmodelle wechseln vom reinen Preiswettbewerb zur Verteidigung der Preissetzungsmacht.

Dieser Artikel beantwortet drei Fragen: ① Was in diesen zwei Wochen geschah und wie die Kernzahlen zu lesen sind; ② worauf DeepSeeks zeitabhängige Preise, Alibabas Sonderlizenz und GLM-5.3s Nachtraining jeweils setzen; ③ ob DeepSeek nach der Erhöhung noch das günstigste Flaggschiff ist und wie Entwickler Rechnungen zerlegen, Lizenzen lesen und Lasten verschieben. Interne Einordnungen: Qwen3.8-Max-Release, V4 Flash GA und GPT-5.6-Preissenkung.

01 Chinas Großmodelle im August: Zeitachse und zentrale Schmerzpunkte

Auf einer Zeitachse wird der Takt dieser zwei Wochen klarer:

Zeitachse Open Weights und Preise, Juli–August 2026
Datum Ereignis
16. JuliMoonshot AI öffnet Kimi K3 (2,8 Billionen Parameter); zuvor bereits US-Sicherheitsinteresse
2.–3. AugustAlibaba kündigt Qwen3.8-Max an und schaltet die Cloud-API frei
10. AugustMeta veröffentlicht Muse Glimmer (30 Milliarden Parameter, Apache 2.0) und kündigt offene Gewichte für das Flaggschiff Muse Spark 1.2 an
12. AugustAlibaba stellt Qwen3.8-2.4T-A95B-Gewichte auf ModelScope / Hugging Face; am selben Tag erscheint xAI Grok 4.6
13. AugustDeepSeek-V4-Pro GA, Preiserhöhung ab 17. August angekündigt; Google veröffentlicht das vergünstigte Gemini 3.7 Flash
14. AugustZhipu veröffentlicht GLM-5.3 auf dem 743-Milliarden-Basismodell von GLM-5.2
17. August, 00:00 (Peking-Zeit)DeepSeeks neue Preise gelten

Weiter zurückgezoomt: Am 30. Juli senkte OpenAI die günstigste Stufe GPT-5.6 Luna um 80 %; am 6.–7. August wurde Luna das Standardmodell für kostenlose Nutzer mit unbegrenztem Textchat. Während chinesische Anbieter Preise anheben und Flaggschiff-Gewichte öffnen, addieren US-Anbieter Rabatte und Gratiszugang. Das ist kein Zufall, sondern zwei Seiten derselben Preisauseinandersetzung. Hintergrund zu Kimi K3: Kimi K3 vollständig offen; DeepSeeks früheres Peak-/Off-Peak-Gerüst: V4 GA und Peak-/Off-Peak-Tarife.

Die zentralen Schmerzpunkte für Leser und Einkauf:

  • Headline-Steigerungen sind nicht die Rechnung. Medien schreiben „11-fach“, „über 1.100 %“ oder „350 %“ — das sind Cache-Hit-Input, Output und Cache-Miss-Input, nicht derselbe Posten.
  • „Offiziell ist am günstigsten“ gilt nicht mehr. In Spitzenzeiten liegt DeepSeeks offizieller API-Preis über einzelnen Reseller-Angeboten. Kanalwahl und Lastverschiebung werden Pflicht.
  • Offene Gewichte sind nicht Apache 2.0. Qwen3.8-Max ist herunterladbar, die Sonderlizenz blockiert jedoch umsatzstarke MaaS- und KI-Arbeitsassistenten-Geschäfte.
  • Geo-Verbotsgerüchte liefen der LICENSE voraus. Behauptungen, Alibaba sperre Downloads für USA, EU, UK und Südkorea, sind falsch. Der Text enthält keine territoriale Klausel.

Drei Unternehmen, drei Spielzüge — ein Signal: chinesische Großmodelle wechseln vom reinen Preiswettbewerb zur Verteidigung der Preissetzungsmacht.

02 DeepSeek-Preisanstieg, Qwen-Open-Weights, GLM-5.3: Kerndaten im Überblick

Die neuen DeepSeek-Preise gelten ab 17. August, 00:00. Spitzenzeiten sind 9–12 und 14–18 Uhr Peking-Zeit.

DeepSeek-Preisanstieg nach Tarif (pro 1 Mio. Tokens; Peak = 09:00–12:00 und 14:00–18:00 Peking)
Tarifposten Vorher Nebenzeit (neu) Spitze (neu) Anstieg (Spitze)
V4-Flash Cache-Hit Input¥0.02¥0.05¥0.10ca. 400%
V4-Flash Cache-Miss Input¥1.0¥1.5¥3.0200%
V4-Flash Output¥2.0¥4.5¥9.0350%
V4-Pro Cache-Hit Input¥0.025¥0.15¥0.30ca. 1100%
V4-Pro Cache-Miss Input¥3.0¥4.5¥9.0200%
V4-Pro Output¥6.0¥13.5¥27.0350%

Quellen: DeepSeek-Offizialankündigung, abgeglichen mit Wall Street CN, IT Home und V2EX. Die Cache-Hit-Stufe steigt am stärksten (bis etwa 12-fach / über 1100 %), bleibt aber absolut klein. Für schwere Lasten wiegen Output (350 %) und Cache-Miss-Input schwerer. Eine unabhängige Kostenrechnung für eine realistische schwere Last (etwa 84 Mio. Tokens/Monat, überwiegend Nebenzeit, etwa die Hälfte Cache-Hits) ergibt eher das 1,8-Fache — real, aber weit unter der schärfsten Headline.

Qwen3.8-2.4T-A95B (Qwen3.8-Max Open Weights): Kernspezifikation
Feld Wert
Parameter2,4 Billionen gesamt, 95 Milliarden aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt)
KontextfensterOpen Weights nativ 262.144 Tokens, erweiterbar auf etwa 1,01 Mio.; Cloud-Max standardmäßig 1 Mio. Tokens
Release-Takt2. August Ankündigung → 3. August API → 12. August offene Gewichte
API-Preis (International)Input $2 / M Tokens, Output $6 / M Tokens
LizenzNicht Apache 2.0, sondern die eigene „Qwen3.8-Max License“
BedeutungErstmals öffnet Alibaba ein Max-Flaggschiff; Qwen3.5 / 3.6 / 3.7 Max blieben API-only
GLM-5.3 vs. GLM-5.2: dasselbe Basismodell, nur Nachtraining
Benchmark GLM-5.2 GLM-5.3 Änderung
Terminal-Bench 3.04.6%28.3%+23.7
DeepSWE v1.146.2%66.9%+20.7
Agents' Last Exam (CLI)23.8%28.5%+4.7
CyberGym77.2%84.5%+7.3
AutomationBench26.2%48.2%+22.0

Das sind Zhipus eigene Messungen; eine unabhängige Drittwiederholung liegt noch nicht vor. Auf Terminal-Bench 3.0 liegt GLM-5.3 weiter hinter GPT-5.6 Sol (34.6 %) und Claude Fable 5 (33.7 %). Es ist erste Open-Weight-Liga, kein umfassender Spitzenplatz.

03 DeepSeek, Alibaba, Zhipu: drei Strategien, drei Logiken

1. DeepSeek: von der Flachpreis-Linie zur Tageszeit-Tarifierung — sichtbare Rechenknappheit

Der Preisanstieg wird leicht als bloßes Mitziehen gelesen. Die Struktur spricht für etwas anderes: eine transparente Rechenrechnung. DeepSeek hielt lange einen einheitlichen Niedrigpreis, holte damit Nutzer und dämpfte Kosten über Cache-Hits und Lastverschiebung. Als das Aufrufvolumen exponentiell wuchs und die GPU-Kapazität nicht mithielt, trug das Modell nicht mehr. Der Satz in der Ankündigung, flexiblere Lastplanung zu fördern, heißt im Klartext: Die Spitzenkapazität reicht nicht, bitte verschieben Sie selbst.

Ein oft übersehener Punkt: Nach der Erhöhung liegt DeepSeeks offizielle API in Spitzenzeiten über einzelnen Reseller-Preisen (GMI Cloud, Novita und andere notieren V4-Pro weiter unter dem neuen Peak). Die Annahme „offiziell ist immer am günstigsten“ — lange Teil des DeepSeek-Grabens — ist damit erstmals gebrochen.

2. Alibaba: offene Gewichte für das Ökosystem, Sonderlizenz für den Umsatz

Das Open-Weighting von Qwen3.8-Max ist keine schlichte Großzügigkeit. Alibaba macht zwei Dinge zugleich: Die 2,4-Billionen-Gewichte sind frei herunterladbar, und daran hängt eine andere Lizenz als das bisherige Apache 2.0 — Model-as-a-Service oder KI-Arbeitsassistenten mit über 50 Millionen US-Dollar Umsatz in 12 Monaten brauchen eine gesonderte Alibaba-Lizenz; Produkte mit über 100 Millionen MAU oder über 20 Millionen US-Dollar Monatsumsatz müssen den Modellnamen prominent zeigen.

Die Logik: Gewichte gegen Entwicklerökosystem und Reputation (besonders international, gegen den Eindruck „chinesisches Modell taugt nicht“), Verhandlungsmacht aber bei den wenigen Kunden, die daraus Cashflow bauen. Das ist ein anderes Offenheitsniveau als Metas Muse Glimmer (uneingeschränktes Apache 2.0).

Ein weit gelaufenes Gerücht ist falsch: Die Lizenz verbiete Downloads aus den USA, der EU, dem Vereinigten Königreich und Südkorea. Der veröffentlichte Text enthält keine territoriale Klausel. Primärquellen: Hugging-Face-Modellrepo und die LICENSE im Original.

3. Zhipu GLM-5.3: kein neues Basismodell, nur ein größeres Nachtrainingsrezept

An GLM-5.3 zählt weniger die Punktzahl als der Weg dorthin: dasselbe 743-Milliarden-Basismodell wie GLM-5.2, kein erneutes Vortraining, allein durch Skalierung der Reinforcement-Learning-Umgebungen im Nachtraining steigt Terminal-Bench 3.0 von 4.6 % auf 28.3 % — knapp das Sechsfache. Das bestätigt einen Trend der letzten Monate: Wenn der Grenzertrag des Vortrainings-Scaling nachlässt, wird Nachtrainings-RL ein eigenständiger Leistungshebel — mit deutlich niedrigerer Schwelle als ein neues hundertmilliardenschweres Basismodell. Auch mittlere Labore können über „Feinausbau“ aufschließen. Offizielle Technikseite: Z.ai GLM-5.3.

peak_window_check.sh
TZ=Asia/Shanghai date +%H:%M
# peak if 09:00-12:00 or 14:00-18:00 Beijing
# shift batch / eval jobs off these windows
# do not quote 1100% as your real bill delta
curl -s https://api-docs.deepseek.com/quick_start/pricing

DeepSeek schreibt die Rechenlücke in die Preisliste. Alibaba tauscht Gewichte gegen Ökosystem und behält Hebel in der Lizenz. Zhipu zeigt, dass Nachtrainingsskalierung allein als Hebel trägt.

04 Ist DeepSeek nach der Preiserhöhung noch das günstigste Flaggschiff?

Input/Output nach der Erhöhung (pro 1 Mio. Tokens)
Modell Input Output Open Weights
DeepSeek V4-Pro (Spitze)¥9.0 (ca. $1.26)¥27.0 (ca. $3.78)Gewichte nicht offen
DeepSeek V4-Pro (Nebenzeit)¥4.5 (ca. $0.63)¥13.5 (ca. $1.89)Gewichte nicht offen
Qwen3.8-Max (International)$2$6Offen (Sonderlizenz)
OpenAI GPT-5.6 Luna$0.20$1.20Geschlossen
Claude Opus 5 (aus Alibabas angegebenem Vielfachen)ca. $5ca. $25Geschlossen

Umrechnung etwa ¥7.15 / $1, nur Orientierung; maßgeblich bleibt die Offizialankündigung. DeepSeek V4-Pro in der Nebenzeit bleibt klar unter Claude Opus 5, ist aber nicht mehr das absolute Minimum: Qwen3.8-Max international und OpenAI Luna unterbieten den DeepSeek-Nebenzeitpreis. Die Gleichung „chinesisch = am günstigsten“ löst sich auf; der Preiswettbewerb wird gestuft.

„Chinesisch = am günstigsten“ galt grob von 2025 bis Anfang 2026. Am 17. August 2026 ist das keine vorbehaltlos tragfähige Annahme mehr.

05 Streitpunkte, Zweifrontenkrieg und Sechs-Schritte-Checkliste

Streitpunkte und ungeprüfte Details

  • Uneinheitliche Steigerungsangaben: „11-fach“, „über 1.100 %“ und „350 %“ sind jeweils zutreffend, gelten aber für verschiedene Posten (Cache-Hit-Input vs. Output vs. Cache-Miss-Input). Die Zeile muss mitgelesen werden.
  • Behauptung, Qwen3.8-Max laufe auf Alibabas Zhenwu-M890-Chips und „Pangu AL128“-Superknoten: mehrere chinesische Finanzmedien berichten das; eine eigenständige Alibaba-Technikdokumentation oder ein Drittbenchmark fehlt. Als nicht unabhängig bestätigt kennzeichnen.
  • GLM-5.3 habe eine „schwere Schwachstelle“ in Cursor gefunden: VentureBeat und Angaben von Zhipu; technische Details sind nicht öffentlich. Das ist eine einseitige Herstellerangabe, keine geprüfte Sicherheitsfeststellung.
  • Mögliche Gegensanktionen des chinesischen Handelsministeriums zu KI- und Halbleitertechnik: bisher ohne offizielle Bestätigung, Medienvermutung / Hörensagen, nur als Hintergrund.

Wirkung und Rahmen: kein Einzelereignis, sondern ein Zweifrontenkrieg

Im größeren Bild: Im vergangenen Monat haben Chinas Spitzenlabore in einem Takt veröffentlicht, den inländische Finanzmedien „drei Updates pro Woche“ nennen — neben DeepSeek, Alibaba und Zhipu auch Moonshot Kimi K3 (16. Juli, 2,8 Billionen Parameter offen) und MiniMax H3. Die inländische Lesart: dichte Open-Weight-Releases zwingen die globale KI-Branche zur Neubepreisung.

US-Anbieter gehen den anderen Weg: OpenAI senkte am 30. Juli um 80 % (Luna) und machte das Modell am 6.–7. August zum kostenlosen Standard mit unbegrenztem Textchat; Google veröffentlichte am 13. August Gemini 3.7 Flash zum halben Preis. China öffnet Flaggschiffe und staffelt höhere Preise am kapazitätsengen oberen Ende; die USA verteidigen mit Gratis- und Tiefpreisen am Konsumende. Beide Strategien sind real; sie optimieren verschiedene Trichterabschnitte. Der August 2026 wird damit zu einem Knoten der Preislogik.

Eine geopolitische Schicht gehört dazu, vorsichtig benannt: Kimi K3 zog bereits US-Sicherheitsinteresse; dass Alibaba in diesem Fenster 2,4-Billionen-Flaggschiff-Gewichte öffnet, lesen einzelne Analysten als Vorlauf, internationale Sichtbarkeit und eine Paritätserzählung zu sichern, bevor Regulierung enger werden könnte. Das ist eine informierte Deutung, kein bestätigter Fakt — aber Teil des Zeitfensters, das englischsprachige Produktmeldungen oft als isolierte Releases behandeln.

Sechs-Schritte-Checkliste für Entwickler und Einkauf:

  1. Rechnung nach Tarifposten zerlegen. Cache-Hit-Input, Cache-Miss-Input und Output getrennt rechnen. „1100 %“ ist nicht der eigene Multiplikator.
  2. Peking-Spitzenfenster abbilden. Batch-Agent- und Eval-Jobs aus 9–12 und 14–18 Uhr schieben, Nebenzeitpreise nutzen.
  3. LICENSE zuerst lesen. Maßgeblich ist die Datei in Hugging Face / ModelScope, nicht Threads über ein US-/EU-/UK-/KR-Downloadverbot.
  4. Umsatz- und MAU-Schwellen prüfen. MaaS / KI-Arbeitsassistent über 50 Millionen US-Dollar in 12 Monaten: gesonderte Lizenz. Über 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz: prominente Modellnamensanzeige.
  5. Quervergleich vor der Lieferantenbindung. DeepSeek Nebenzeit/Spitze, Qwen international $2/$6, GPT-5.6 Luna $0.20/$1.20 und Reseller unter dem offiziellen Peak.
  6. Stabilen Nebenzeit-Host wählen. Lokaler 2.4T-Zug, lange Kontexte oder 7×24-Agent-Planung: dediziertes Bare-Metal-Mac statt überbuchter Shared Cloud.
aug2026_price_war_watchlist.md
# Aug 2026 China open-weight + pricing watchlist
1. split bill: cache-hit / cache-miss / output
2. shift jobs off Beijing 09-12 and 14-18
3. read Qwen3.8-Max LICENSE, not rumor threads
4. check $50M MaaS / 100M MAU / $20M monthly triggers
5. compare Luna $0.20/$1.20 vs Qwen $2/$6 vs DS off-peak
6. avoid shared-cloud for 2.4T / long-context evals
next: isolated Apple Silicon host

Zitierfähige Kerndaten (Stand 2026-08-17):

  • V4-Pro Cache-Hit Input (Spitze): ¥0.025 → ¥0.30, ca. 1100 % (nur diese Headline-Stufe)
  • V4-Pro Output (Spitze): ¥6.0 → ¥27.0, 350 % (meist der postenstarke Teil der Rechnung)
  • Qwen3.8-2.4T-A95B: 2,4 Billionen gesamt / 95 Milliarden aktiv, nativ 262.144 Tokens, Sonderlizenz
  • GLM-5.3 Terminal-Bench 3.0: 4.6 % → 28.3 %, dasselbe 743-Milliarden-Basismodell, kein erneutes Vortraining
  • Lizenzschwellen: MaaS / KI-Arbeitsassistent über $50 Mio. in 12 Monaten: gesonderte Lizenz; über 100 Mio. MAU oder $20 Mio. Monatsumsatz: prominente Modellnamensanzeige

06 FAQ und Abschluss für die Produktion

Bedeutet der DeepSeek-Preisanstieg, dass die Nutzung künftig teurer wird?
Das hängt vom Szenario ab. Liegen die Aufrufe überwiegend in Nebenzeiten (außerhalb 9–12 und 14–18 Uhr Peking-Zeit) und ist die Cache-Trefferquote hoch, liegt die reale Steigerung deutlich unter den Headline-Zahlen von 350 % und 1.100 % (Analysen für schwere Lasten nennen etwa das 1,8-Fache). Konzentrieren sich die Aufrufe auf Spitzenzeiten bei niedriger Cache-Trefferquote, kann die Steigerung die Headline-Zahlen erreichen.

Können Einzelentwickler die offenen Gewichte von Qwen3.8-Max kostenlos kommerziell nutzen?
Einzelentwickler und interne Nutzung sind weitgehend unberührt. Handelt es sich um Model-as-a-Service oder einen KI-Arbeitsassistenten und übersteigt der Umsatz der letzten 12 Monate 50 Millionen US-Dollar, ist eine gesonderte kommerzielle Lizenz von Alibaba nötig. Bei über 100 Millionen monatlich aktiven Nutzern oder über 20 Millionen US-Dollar Monatsumsatz muss der Modellname prominent angezeigt werden.

Sind GLM-5.3 und GLM-5.2 dasselbe Modell? Warum der plötzliche Sprung?
Das Basismodell ist identisch (743 Milliarden Parameter); Zhipu hat nicht neu vortrainiert. Der Sprung kommt aus einem deutlich größeren Reinforcement-Learning-Umfeld in der Nachtrainingsphase. Nachtrainingsskalierung ist damit ein eigenständiger Hebel — ein größeres Basismodell ist nicht zwingend nötig.

Stimmt es, dass die Qwen3.8-Max-Lizenz Downloads für Nutzer in den USA und der EU verbietet?
Nein. Das ist eine im Netz kursierende Falschmeldung. Der offizielle Lizenztext enthält keine geografische Beschränkung. Die Einschränkungen gelten für kommerzielle Dienste oberhalb bestimmter Umsatzschwellen, unabhängig vom Standort.

Bedeutet Metas Open-Weighting von Muse Glimmer die Rückkehr des Llama-Open-Source-Geists?
Vorerst nur eine Teilrückkehr. Muse Glimmer ist ein destilliertes 30-Milliarden-Parameter-Modell. Das eigentliche geschlossene Flaggschiff Muse Spark 1.2 ist noch nicht offen; Zuckerberg hat lediglich angekündigt, die Gewichte später freizugeben. Erst wenn das geschieht, wäre es das erste US-Flaggschiff, das von geschlossen auf offen wechselt. Der Schritt ist noch nicht erfolgt.

Quellen: DeepSeek-Offizialankündigung zur Preiserhöhung, abgeglichen mit Wall Street CN, IT Home, AIGC-Tool-Navigation und V2EX; Alibabas Qwen-Modellrepos (Hugging Face / ModelScope) sowie South China Morning Post (SCMP) zu den Lizenzklauseln; Zhipu (Z.ai) GLM-5.3-Technikseite sowie VentureBeat und StableLearn; Meta AI Research und VentureBeat zu Muse Glimmer; Yicai / 第一财经, Sohu Finance und weitere zur dichten Veröffentlichungsfolge chinesischer Großmodelle. Stand der öffentlichen Angaben vor Redaktionsschluss. Preise, Lizenzklauseln und Benchmarks vor Weiterveröffentlichung an der jeweils aktuellen Offizialquelle prüfen. Details zu Chip-Betrieb, Sicherheitsfund und Exportkontroll-Gerüchten sind im Text als nicht unabhängig bestätigt gekennzeichnet.

Shared-Cloud-Hosts für lange Kontexte oder einen lokalen 2.4T-Zug zeigen oft Bandbreitenjitter und Überbuchung. Ad-hoc-Knoten für Nebenzeit-Agent-Planung reißen lange Verbindungen und liefern selten echte Isolation. Hochspeicher-Inferenz und 7×24-Planung auf einer instabilen Shared-Instanz lassen Rechnung und Erfolgsquote gemeinsam schwanken. Für stabilere Open-Weight-Evals und Nebenzeit-Agent-Automatisierung ist ein JEXCLOUD Multi-Region-Bare-Metal-Mac in der Regel die bessere Produktionsumgebung: dediziertes Apple Silicon, Root, 7×24, monatlich flexibel, Lieferung in etwa 120 Sekunden. Knoten und Preise auf der JEXCLOUD-Preisseite.