DeepSeek V4 GA: Vollversion mit Preisen, Architektur und GPT-5.6-Vergleich
Nach drei Monaten Wartezeit ist DeepSeek V4 GA (Vollversion) am 20. Juli 2026 offiziell live. Gegenüber der Preview vom April liefert die GA messbare Verbesserungen bei Agent-Fähigkeiten, mathematischem Reasoning und Code-Generierung — und führt erstmals Peak-Off-Peak-Tarife ein. Das markiert den Übergang von „nahezu kostenlos“ zu einer strukturierten kommerziellen Plattform.
Für AI-Entwickler, Indie-Devs und Enterprise-Engineers beantwortet dieser Artikel drei Fragen: ① vollständige Zeitlinie Preview → GA inkl. Architektur (CSA+HCA, mHC, Muon); ② Benchmarks mit SWE-bench Verified 80,6 % und Vergleich mit GPT-5.6 sowie Claude Fable 5; ③ Peak-Off-Peak-Kalkulation und API-Migrationsguide vor dem 24. Juli-Deadline für deepseek-chat / deepseek-reasoner.
01 Zeitlinie: Von der Preview zur GA-Vollversion
Aktuelle Engpässe für Entwickler:
- Legacy-API-Ende:
deepseek-chatunddeepseek-reasonerwerden am 24. Juli dauerhaft abgeschaltet — ungemigrierte Produktionscode bricht ab. - Peak-Off-Peak-Komplexität: GA führt zeitabhängige Tarife ein; Spitzenzeiten verdoppeln die Raten, ungeplante Batch-Jobs verursachen versteckte Mehrkosten.
- Closed-Source-Kosten: Claude Fable 5 Output $50/M, GPT-5.6 Sol ~$15/M — hochfrequente Agent-Calls erzeugen untragbare Rechnungen.
- 1M-Kontext-Deployment: Viele Modelle werben mit 1M Token, aber KV-Cache-Speicher macht den realen Betrieb teuer.
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4 Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktionsoptimierte V4-Flash/Pro-Versionen, API allgemein verfügbar |
| 2026-06 | V4-Pro dauerhaft 75 % günstiger (Output $0,87/M Token) |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak-Schema |
| 2026-07-19 | GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte „Vollversion morgen“ |
| 2026-07-20 | GA offiziell live (Publikationstag) |
| 2026-07-24 | Legacy-Namen deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet |
Kurzfassung: Die Preview war bereits stark; die GA verbessert Agent, Mathe und Code gezielt und bringt ein formales kommerzielles Preismodell.
02 Architektur: Wie 1M Kontext praktikabel wird
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktive Parameter/Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Layer | 61 | 43 |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Max. Output | 384K Token | 384K Token |
| Präzision | FP4 (Experten) + FP8 (Rest) | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Token | 32T+ Token |
| Lizenz | MIT | MIT |
Hybride Attention (CSA + HCA)
DeepSeek V4 ersetzt MLA aus V2/V3 durch zwei neue Mechanismen:
- Compressed Sparse Attention (CSA): KV-Sequenz per Softmax-Gating 4× komprimiert; FP4-„Lightning Indexer“ für top-k-Auswahl (Pro: top-1024, Flash: top-512); 128-Token-Sliding-Window. Bei 1M Kontext nur 27 % der V3.2-FLOPs.
- Heavily Compressed Attention (HCA): Token 128× komprimiert, dann globale dichte Attention für Langstrecken-Abhängigkeiten; Flash: erste 2 Layer HCA, danach CSA/HCA alternierend; Pro analog.
Gesamteffekt: KV-Cache bei 1M Token nur 10 % von V3.2 (V4-Flash bis 7 %).
Manifold-Constrained Hyper-Connections (mHC)
Upgrade klassischer Residual-Verbindungen: 4-Kanal-Residual-Stream, Mischmatrix mit doppelt-stochastischer Constraint (Birkhoff-Polytop) für stabile Signalpropagation über 61 Layer.
Muon-Optimierer
Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere Konvergenz, stabilere Trainingskurve.
| Modus | Eigenschaft | Einsatz |
|---|---|---|
| Non-think | Keine Thought Chain, maximale Geschwindigkeit | Einfache Q&A, Routing |
| Think High | Explizites Reasoning (<redacted_thinking>) | Mittlere Komplexität, Code-Debug |
| Think Max | Maximale Reasoning-Tiefe, 384K+ Kontext nötig | Komplexe Mathe, lange Agent-Ketten |
Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi). Lokales Deployment: ds4 High-Memory-Mac-Inferenz-Guide.
03 Benchmarks: Open-Source-Spitzenwerte
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Rekord, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.
Kosten-Nutzen (Artificial Analysis):
- Claude Fable 5: Strategy & Ops Index $3,48/Aufgabe, Score 50
- DeepSeek V4-Pro: gleiche Kategorie $0,03/Aufgabe, Score 38
- DeepSeek V4-Flash: alle sechs Index-Kategorien unter $0,04/Aufgabe
Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten (31 %) Vorsprung. Für die meisten Produktionsszenarien dominiert V4-Pro das Preis-Leistungs-Verhältnis.
04 V4 vs. GPT-5.6: Positionierung und Peak-Off-Peak-Tarife
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Hosting | MIT, ja | Closed Source | Closed Source |
| Kontextfenster | 1M Token | nicht veröffentlicht | 1M Token |
| Code-Fähigkeit | sehr stark (nahe Fable 5) | sehr stark | stärkste |
| API-Output (Off-Peak) | $0,87/M | ~$15/M | $50/M |
| API-Output (Peak) | $1,74/M | — | — |
| Datenschutz | Private Deployment, DSGVO-konforme Option | — | — |
Szenario-Matrix: Budget / hohe Frequenz / Private Deployment → V4-Pro oder V4-Flash; maximale Code-Qualität → Claude Fable 5; komplexe Algorithmen + Mathe → GPT-5.6 Sol/Ultra; Massen-Log-Verarbeitung → V4-Flash (Cache-Hit Input nur $0,0028/M).
| Modell | Posten | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Hit) | ¥0,025 / $0,0035 / 1M | verdoppelt |
| Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Input (Cache-Hit) | ¥0,02 / $0,0028 / 1M | verdoppelt |
| Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Peak-Zeiten (Peking): Werktags 09:00–12:00 und 14:00–18:00. Einsparpotenzial: Batch-Jobs in Off-Peak legen; Prompt Cache nutzen; einfache Tasks auf V4-Flash; DeepSeek kündigt Preisänderungen 24 Stunden per E-Mail an. Selbst im Peak: V4-Pro Output $1,74/M bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M).
05 deepseek-chat Abschaltung: 6-Schritte-Migration bis 24. Juli
Wichtig: Legacy-Namen deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 15:59 UTC (23:59 Peking) dauerhaft abgeschaltet.
| Alter Name | Neuer Name | Hinweis |
|---|---|---|
deepseek-chat | deepseek-v4-flash (Non-think) | Schnell, leichte Tasks |
deepseek-reasoner | deepseek-v4-flash (Think-Modus) | oder Upgrade auf deepseek-v4-pro |
6 Schritte:
- Codebase durchsuchen: Alle Referenzen auf
deepseek-chatunddeepseek-reasonerfinden. - Ersetzungsstrategie: Leichte Dialoge →
deepseek-v4-flash; komplexes Reasoning →deepseek-v4-pro+ Think High/Max. - OpenAI SDK aktualisieren: Nur
modeländern,base_urlbleibthttps://api.deepseek.com. - Think-Modus konfigurieren: Ex-Reasoner-Nutzer via
extra_body; Think Max braucht 384K+ Kontext. - Staging validieren: Vor dem 24. Juli Kern-Use-Cases in Pre-Prod testen, Latenz und Kosten prüfen.
- Peak-Off-Peak-Monitoring: Batch-Jobs nach Peking-Zeit planen, Cache-Hit für Input-Kosten optimieren.
client.chat.completions.create(model="deepseek-chat", messages=[...])
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — Anthropic SDK nur model aktualisieren, base_url="https://api.deepseek.com" unverändert.
Zitierbare Kerndaten (DeepSeek offiziell, 2026-07-20):
- SWE-bench Verified: 80,6 %, Open-Source-Rekord, gleichauf Gemini 3.1 Pro
- KV-Cache-Effizienz: 1M Kontext nur 10 % von V3.2 (Flash 7 %)
- Kosten-Nutzen: V4-Pro $0,03 vs. Fable 5 $3,48 pro Aufgabe, Faktor 116×
- Peak-Output: V4-Pro $1,74/M, 8,6× günstiger als Opus 4.8
- Migrations-Deadline: 2026-07-24 23:59 Peking, Legacy-API dauerhaft ab
- Quellen: DeepSeek-Dokumentation, arXiv:2606.19348, HuggingFace, Artificial Analysis
06 Fazit: GA-Vollversion und Produktionsbetrieb
DeepSeek V4 GA ist einer der wichtigsten Open-Source-Meilensteine 2026. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen — sondern auf 1/10 bis 1/100 der Closed-Source-Kosten die stärkste Open-Source-Performance zu liefern.
Zielgruppen: Unternehmen mit Datenresidenz-Anforderungen (inkl. DSGVO), budgetbewusste Indie-Devs, Agent-Engineers mit 1M-Kontext-Bedarf, AI-Produktteams mit Fokus auf ROI. Peak-Off-Peak erhöht die Kalkulationskomplexität, bleibt aber wettbewerbsfähig — der Schritt von „Preisaggressor“ zu regulierter Plattform signalisiert Reife.
Wer noch deepseek-chat nutzt: Migration vor dem 24. Juli abschließen, sonst Serviceunterbrechung.
Reine API-Nutzung ermöglicht schnellen V4-Zugang, birgt aber versteckte Kosten: 1M-Kontext-Agenten auf Shared-VPS scheitern am RAM, Peak-Off-Peak-Batch-Inferenz ohne stabile Scheduling-Hosts, lokale MIT-Gewichte brauchen High-UM-Mac-Hardware. Für 7×24 DeepSeek-Agent-Pipelines, ds4-Lokalinferenz oder Long-Context-MCP-Server ist JEXCLOUD Multi-Region Bare-Metal Mac die bessere Basis: dediziertes Apple-Silicon-UM, kein Overselling, launchd-Gateway, 120-Sekunden-Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.