AI Agent Open-Source-LLM 2026.07.20

DeepSeek V4 GA: Vollversion mit Preisen, Architektur und GPT-5.6-Vergleich

Nach drei Monaten Wartezeit ist DeepSeek V4 GA (Vollversion) am 20. Juli 2026 offiziell live. Gegenüber der Preview vom April liefert die GA messbare Verbesserungen bei Agent-Fähigkeiten, mathematischem Reasoning und Code-Generierung — und führt erstmals Peak-Off-Peak-Tarife ein. Das markiert den Übergang von „nahezu kostenlos“ zu einer strukturierten kommerziellen Plattform.

Für AI-Entwickler, Indie-Devs und Enterprise-Engineers beantwortet dieser Artikel drei Fragen: ① vollständige Zeitlinie Preview → GA inkl. Architektur (CSA+HCA, mHC, Muon); ② Benchmarks mit SWE-bench Verified 80,6 % und Vergleich mit GPT-5.6 sowie Claude Fable 5; ③ Peak-Off-Peak-Kalkulation und API-Migrationsguide vor dem 24. Juli-Deadline für deepseek-chat / deepseek-reasoner.

01 Zeitlinie: Von der Preview zur GA-Vollversion

Aktuelle Engpässe für Entwickler:

  • Legacy-API-Ende: deepseek-chat und deepseek-reasoner werden am 24. Juli dauerhaft abgeschaltet — ungemigrierte Produktionscode bricht ab.
  • Peak-Off-Peak-Komplexität: GA führt zeitabhängige Tarife ein; Spitzenzeiten verdoppeln die Raten, ungeplante Batch-Jobs verursachen versteckte Mehrkosten.
  • Closed-Source-Kosten: Claude Fable 5 Output $50/M, GPT-5.6 Sol ~$15/M — hochfrequente Agent-Calls erzeugen untragbare Rechnungen.
  • 1M-Kontext-Deployment: Viele Modelle werben mit 1M Token, aber KV-Cache-Speicher macht den realen Betrieb teuer.
DeepSeek V4: Meilensteine Preview → GA
Datum Ereignis
2026-04-24V4 Preview live und Open Source (MIT): V4-Pro (1,6T) und V4-Flash (284B)
2026-05Produktionsoptimierte V4-Flash/Pro-Versionen, API allgemein verfügbar
2026-06V4-Pro dauerhaft 75 % günstiger (Output $0,87/M Token)
2026-06-29E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak-Schema
2026-07-19GA-Grauzonen-Zugang für ausgewählte Entwickler, Medienberichte „Vollversion morgen“
2026-07-20GA offiziell live (Publikationstag)
2026-07-24Legacy-Namen deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet

Kurzfassung: Die Preview war bereits stark; die GA verbessert Agent, Mathe und Code gezielt und bringt ein formales kommerzielles Preismodell.

02 Architektur: Wie 1M Kontext praktikabel wird

V4-Pro vs. V4-Flash Spezifikation
Spezifikation V4-Pro V4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktive Parameter/Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Layer6143
Kontextfenster1.000.000 Token1.000.000 Token
Max. Output384K Token384K Token
PräzisionFP4 (Experten) + FP8 (Rest)FP4 + FP8 gemischt
Pretraining-Daten33T+ Token32T+ Token
LizenzMITMIT

Hybride Attention (CSA + HCA)

DeepSeek V4 ersetzt MLA aus V2/V3 durch zwei neue Mechanismen:

  • Compressed Sparse Attention (CSA): KV-Sequenz per Softmax-Gating 4× komprimiert; FP4-„Lightning Indexer“ für top-k-Auswahl (Pro: top-1024, Flash: top-512); 128-Token-Sliding-Window. Bei 1M Kontext nur 27 % der V3.2-FLOPs.
  • Heavily Compressed Attention (HCA): Token 128× komprimiert, dann globale dichte Attention für Langstrecken-Abhängigkeiten; Flash: erste 2 Layer HCA, danach CSA/HCA alternierend; Pro analog.

Gesamteffekt: KV-Cache bei 1M Token nur 10 % von V3.2 (V4-Flash bis 7 %).

Manifold-Constrained Hyper-Connections (mHC)

Upgrade klassischer Residual-Verbindungen: 4-Kanal-Residual-Stream, Mischmatrix mit doppelt-stochastischer Constraint (Birkhoff-Polytop) für stabile Signalpropagation über 61 Layer.

Muon-Optimierer

Training mit Muon statt AdamW; Newton-Schulz-Orthogonalisierung der Gradienten — schnellere Konvergenz, stabilere Trainingskurve.

Drei Inferenzmodi
Modus Eigenschaft Einsatz
Non-thinkKeine Thought Chain, maximale GeschwindigkeitEinfache Q&A, Routing
Think HighExplizites Reasoning (<redacted_thinking>)Mittlere Komplexität, Code-Debug
Think MaxMaximale Reasoning-Tiefe, 384K+ Kontext nötigKomplexe Mathe, lange Agent-Ketten

Offizielle Sampling-Parameter: temperature=1.0, top_p=1.0 (alle Modi). Lokales Deployment: ds4 High-Memory-Mac-Inferenz-Guide.

03 Benchmarks: Open-Source-Spitzenwerte

V4-Pro Kerndaten
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80,6 %96,0 %nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified misst echte GitHub-Bugfixes — 80,6 % ist der aktuelle Open-Source-Rekord, gleichauf mit Gemini 3.1 Pro. SWE-bench Pro ist strenger; Claude Fable 5 führt mit 80,3 %.

Kosten-Nutzen (Artificial Analysis):

  • Claude Fable 5: Strategy & Ops Index $3,48/Aufgabe, Score 50
  • DeepSeek V4-Pro: gleiche Kategorie $0,03/Aufgabe, Score 38
  • DeepSeek V4-Flash: alle sechs Index-Kategorien unter $0,04/Aufgabe

Fable 5 kostet 116× mehr als V4-Pro bei nur ~12 Punkten (31 %) Vorsprung. Für die meisten Produktionsszenarien dominiert V4-Pro das Preis-Leistungs-Verhältnis.

04 V4 vs. GPT-5.6: Positionierung und Peak-Off-Peak-Tarife

DeepSeek V4-Pro vs. GPT-5.6 Sol vs. Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open Source / Self-HostingMIT, jaClosed SourceClosed Source
Kontextfenster1M Tokennicht veröffentlicht1M Token
Code-Fähigkeitsehr stark (nahe Fable 5)sehr starkstärkste
API-Output (Off-Peak)$0,87/M~$15/M$50/M
API-Output (Peak)$1,74/M
DatenschutzPrivate Deployment, DSGVO-konforme Option

Szenario-Matrix: Budget / hohe Frequenz / Private Deployment → V4-Pro oder V4-Flash; maximale Code-Qualität → Claude Fable 5; komplexe Algorithmen + Mathe → GPT-5.6 Sol/Ultra; Massen-Log-Verarbeitung → V4-Flash (Cache-Hit Input nur $0,0028/M).

Peak-Off-Peak-Preistabelle (GA neu)
Modell Posten Off-Peak Peak
V4-ProInput (Cache-Hit)¥0,025 / $0,0035 / 1Mverdoppelt
Input (Cache-Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Output¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (Cache-Hit)¥0,02 / $0,0028 / 1Mverdoppelt
Input (Cache-Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Output¥2,00 / $0,28 / 1M¥4,00 / $0,56

Peak-Zeiten (Peking): Werktags 09:00–12:00 und 14:00–18:00. Einsparpotenzial: Batch-Jobs in Off-Peak legen; Prompt Cache nutzen; einfache Tasks auf V4-Flash; DeepSeek kündigt Preisänderungen 24 Stunden per E-Mail an. Selbst im Peak: V4-Pro Output $1,74/M bleibt 8,6× günstiger als Claude Opus 4.8 ($15/M).

05 deepseek-chat Abschaltung: 6-Schritte-Migration bis 24. Juli

Wichtig: Legacy-Namen deepseek-chat und deepseek-reasoner werden am 24. Juli 2026, 15:59 UTC (23:59 Peking) dauerhaft abgeschaltet.

Migrations-Mapping
Alter Name Neuer Name Hinweis
deepseek-chatdeepseek-v4-flash (Non-think)Schnell, leichte Tasks
deepseek-reasonerdeepseek-v4-flash (Think-Modus)oder Upgrade auf deepseek-v4-pro

6 Schritte:

  1. Codebase durchsuchen: Alle Referenzen auf deepseek-chat und deepseek-reasoner finden.
  2. Ersetzungsstrategie: Leichte Dialoge → deepseek-v4-flash; komplexes Reasoning → deepseek-v4-pro + Think High/Max.
  3. OpenAI SDK aktualisieren: Nur model ändern, base_url bleibt https://api.deepseek.com.
  4. Think-Modus konfigurieren: Ex-Reasoner-Nutzer via extra_body; Think Max braucht 384K+ Kontext.
  5. Staging validieren: Vor dem 24. Juli Kern-Use-Cases in Pre-Prod testen, Latenz und Kosten prüfen.
  6. Peak-Off-Peak-Monitoring: Batch-Jobs nach Peking-Zeit planen, Cache-Hit für Input-Kosten optimieren.
deepseek_v4_migration.py
client.chat.completions.create(model="deepseek-chat", messages=[...])

client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 unterstützt OpenAI ChatCompletions und Anthropic Messages — Anthropic SDK nur model aktualisieren, base_url="https://api.deepseek.com" unverändert.

Zitierbare Kerndaten (DeepSeek offiziell, 2026-07-20):

  • SWE-bench Verified: 80,6 %, Open-Source-Rekord, gleichauf Gemini 3.1 Pro
  • KV-Cache-Effizienz: 1M Kontext nur 10 % von V3.2 (Flash 7 %)
  • Kosten-Nutzen: V4-Pro $0,03 vs. Fable 5 $3,48 pro Aufgabe, Faktor 116×
  • Peak-Output: V4-Pro $1,74/M, 8,6× günstiger als Opus 4.8
  • Migrations-Deadline: 2026-07-24 23:59 Peking, Legacy-API dauerhaft ab
  • Quellen: DeepSeek-Dokumentation, arXiv:2606.19348, HuggingFace, Artificial Analysis

06 Fazit: GA-Vollversion und Produktionsbetrieb

DeepSeek V4 GA ist einer der wichtigsten Open-Source-Meilensteine 2026. Der Wert liegt nicht darin, Claude Fable 5 oder GPT-5.6 sofort zu schlagen — sondern auf 1/10 bis 1/100 der Closed-Source-Kosten die stärkste Open-Source-Performance zu liefern.

Zielgruppen: Unternehmen mit Datenresidenz-Anforderungen (inkl. DSGVO), budgetbewusste Indie-Devs, Agent-Engineers mit 1M-Kontext-Bedarf, AI-Produktteams mit Fokus auf ROI. Peak-Off-Peak erhöht die Kalkulationskomplexität, bleibt aber wettbewerbsfähig — der Schritt von „Preisaggressor“ zu regulierter Plattform signalisiert Reife.

Wer noch deepseek-chat nutzt: Migration vor dem 24. Juli abschließen, sonst Serviceunterbrechung.

Reine API-Nutzung ermöglicht schnellen V4-Zugang, birgt aber versteckte Kosten: 1M-Kontext-Agenten auf Shared-VPS scheitern am RAM, Peak-Off-Peak-Batch-Inferenz ohne stabile Scheduling-Hosts, lokale MIT-Gewichte brauchen High-UM-Mac-Hardware. Für 7×24 DeepSeek-Agent-Pipelines, ds4-Lokalinferenz oder Long-Context-MCP-Server ist JEXCLOUD Multi-Region Bare-Metal Mac die bessere Basis: dediziertes Apple-Silicon-UM, kein Overselling, launchd-Gateway, 120-Sekunden-Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.