DeepSeek V4 Flash offiziell: Benchmarks nahe Opus 4.8, Preis ein Bruchteil, Pro-Version noch ausstehend
Am 31. Juli stufte DeepSeek V4-Flash zur offiziellen Version DeepSeek-V4-Flash-0731 hoch: Parameter unverändert, nur Re-Post-Training. Agent-Benchmarks überholen das größere V4-Pro-Preview; der Preis liegt bei einem Bruchteil von Claude Opus 4.8. Das Flaggschiff V4-Pro (offiziell) und das eigene Agent-Framework Harness sind weiterhin nicht verfügbar.
Für AI-Entwickler und Modellentscheider beantwortet dieser Artikel drei Punkte: ① die vollständige Timeline vom April-Preview bis zur offiziellen Version vom 31. Juli; ② Preise, Architektur und Harness im Vergleich zu Kimi K3 und Qwen3.8-Max; ③ Score-Kontroversen, Preiskampf und eine 6-Schritte-Integrationscheckliste. Datenstand: 2026-08-05.
01 Vom April-Preview zur Juli-Offiziellversion: Timeline und Kernprobleme
Kein neues Modell, sondern Re-Post-Training desselben 284B Gesamt- / 13B aktiver Parameter. V4-Pro (offiziell) und Harness stehen auf „bald verfügbar“ ohne festes Datum.
- 24. April 2026: DeepSeek-V4-Preview erstmals veröffentlicht und open source (V4-Pro 1,6T/49B, V4-Flash 284B/13B), jeweils 1M Token Kontext, MIT.
- 24. Juli 2026: Legacy-APIs
deepseek-chatunddeepseek-reasonereingestellt; Traffic auf V4-Namensgebung umgestellt. - 27. Juli 2026: Kimi K3 (2,8T) Open Weights auf Hugging Face — Wettbewerbsdruck für DeepSeek.
- 31. Juli 2026: V4-Flash-0731 offiziell in API-Beta; Weights auf Hugging Face; Changelog nennt Harness erstmals. Beta nur API, App/Web noch nicht synchron.
- Stand 5. August 2026: V4-Pro offiziell weiter „so schnell wie möglich“. Medien zitieren anonyme Quellen für GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt.
Kernprobleme für Entwickler:
- Flaggschiff ausstehend: V4-Pro offiziell und Harness ohne Release-Datum; Pro-Abhängigkeit erfordert Preview weiter.
- Benchmark-Sensitivität: Agent-Scores mit undisclosed Harness „Minimal Mode“; DeepSeek warnt vor Gleichsetzung mit Modellfähigkeit.
- API vs. Consumer: 0731 nur API; App/Web auf älterer Version.
- Wettbewerbsdruck: Qwen3.8-Max (GA 2.8.), Kimi K3 (27.7.), GPT-5.6-Preissenkung komprimieren das Auswahlzeitfenster.
284B Flash übertrifft in mehreren Agent-Benchmarks das mehrfach größere V4-Pro-Preview — Post-Training-Qualität rückt 2026 der reinen Parameter-Skalierung gleichauf oder davon.
02 DeepSeek V4-Flash-0731: Kerndaten
| Modell | Status | Gesamt/Aktiv | Kontext | Input ($/M, Cache miss/hit) | Output $/M | Lizenz |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Offiziell (31.7.) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview (offiziell ausstehend) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Weights open (27.7.) | 2,8T / ~104B | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open Source (Juni 2026) | ~744B / ~40B | 1M | unverifiziert | unverifiziert | MIT |
| Qwen3.8-Max | API GA (2.8.), Weights ausstehend | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open Source versprochen |
Preise: Herstellerangaben. DeepSeek kündigt „2× Peak-Tarif“ an (Peking 9–12, 14–18 Uhr); kein Startdatum zum Redaktionsschluss.
03 Architektur unverändert, Post-Training neu: CSA+HCA und Harness
V4-Flash-0731: identische Parameter und Struktur wie April-Preview; Gewinn ausschließlich aus Re-Post-Training. Laut Technical Report drei Architekturänderungen:
- Hybrid Attention: CSA + HCA als DSA Sparse Attention — weniger Compute/VRAM bei langem Kontext.
- mHC: verbesserte Residual-Verbindungen.
- Muon Optimizer: schnellere, stabilere Konvergenz.
Offizielle Metrik (1M Token): V4-Pro vs. V3.2 — FLOPs/token 27%, KV Cache 10%. Keine unabhängige Reproduktion bestätigt.
DeepSeek Harness (31.7. Changelog): eigenes Agent-Framework für Dateien, Tools, Shell, End-to-End-Engineering — Gegenstück zu Claude Code. Bisher Drittanbieter-Agent-Tools.
Agent-Scores (Terminal Bench 2.0: 82,7 vs. V4-Pro-Preview 67,9) alle mit Harness „Minimal Mode“ (max, top_p=0,95, temperature=1,0). Changelog: „Scores hängen stark vom Harness ab.“
| Benchmark | Flash-0731 | Flash Preview | V4-Pro Preview | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 | 85,0 |
| NL2Repo | 54,2 | 39,4 | 38,5 | 69,7 |
| DeepSWE | 54,4 | 7,3 | 12,8 | 58,0 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 | 76,2 |
04 Open-Source-Wettbewerb: Preis-Leistung als Hauptfeld
| Modell | Lab | Gesamtparameter | Intelligence Index | Kosten/Task |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot | 2,8T | 57 | $0,86 |
| GLM-5.2 | Z.ai | ~744B | ~1 Punkt über V4-Flash | unverifiziert |
| GPT-5.6 Sol | OpenAI | nicht offengelegt | 9+ Punkte über V4-Flash | $1,86 |
| Claude Fable 5 | Anthropic | nicht offengelegt | 9+ Punkte über V4-Flash | $3,15 |
Intelligence Index und Kosten/Task: Artificial Analysis (via Medien). DeepSeek-Scores: Hersteller — getrennt ausgewiesen wegen unterschiedlicher Methodik.
Kernbefund: V4-Flash nicht Spitzen-Intelligence (hinter Kimi K3, GLM-5.2), aber Kosten/Task ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol, 1/105 von Claude Fable 5. Strategie: „ausreichende Intelligenz + extrem niedriger Preis“ — erklärt 7 Wochen #1 auf OpenRouter (Preview).
„Kill line“ in chinesischen Dev-Kreisen: DeepSeek setzt eine Preis-Leistungs-Schwelle — Modelle ohne klaren Vorsprung und ohne tieferen Preis verlieren Marktpräsenz.
05 Score-Kontroversen, 6-Schritte-Integration, zitierbare Daten
Klar zu kennzeichnen:
- Harness-Abhängigkeit: Agent-Scores mit undisclosed Minimal Mode — bis Community-Reproduktion „Hersteller + spezifisches Framework“.
- Verfügbarkeit: Berichte über niedrige Cache-Hit-Rate, gelegentliche Safety-Classifier-Timeouts (via Medien, Entwickler-Feedback).
- V4-Pro-Datum unbestätigt: „10.–20. August GA“ nur anonyme Quellen; offiziell: „so schnell wie möglich“.
- Finanzierungsgerüchte: ~7,4 Mrd. USD, ~48,7 Mrd. USD Bewertung — „laut Berichten“, keine offizielle Bestätigung.
6 Schritte für sichere Integration von V4-Flash-0731:
- API-Naming: Modell-ID
deepseek-v4-flash(zeigt auf 0731). Legacydeepseek-chat/deepseek-reasonersofort migrieren. - API Key: DeepSeek Open Platform; Guthaben und Peak-2×-Hinweis prüfen.
- Protokoll: OpenAI ChatCompletions oder Anthropic —
base_urlan Toolchain anpassen, kein Client-Code-Change nötig. - Sandbox A/B: Eigene Prompts vs. Kimi K3 / Qwen3.8-Max — nicht nur Hersteller-Tabelle.
- Harness beobachten: Nach Release offizielle Benchmarks replizieren; Claude Code / Cursor zur Kreuzvalidierung.
- Lokal deployen: MIT-Weights auf Hugging Face (
deepseek-ai/DeepSeek-V4-Flash-0731); 284B MoE braucht High-Memory Apple Silicon oder GPU-Cluster.
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
temperature=1.0,
top_p=0.95
)
Zitierbare Hard Facts (DeepSeek, Artificial Analysis, 2026-08-05):
- Parameter: 284B gesamt / 13B aktiv; Architektur = April-Preview
- Preis: Input $0,14/M (miss), $0,0028/M (hit); Output $0,28/M
- Terminal Bench 2.1: 82,7 (Hersteller, Harness minimal mode)
- Artificial Analysis: Terminal-Bench 2.1 ~78,65% — Delta 4,05 zu 82,7
- Kosten/Task: $0,03 — 1/29 Kimi K3, 1/105 Claude Fable 5
- Long-Context: 1M Token: FLOPs 27% vs. V3.2, KV Cache 10% (Hersteller)
- vs. Opus 4.8: Input ~36× (miss), ~179× (hit), Output ~89× günstiger (Listenpreise)
- Lizenz: MIT; Weights auf Hugging Face
06 FAQ, Branchenkontext, Produktionsbetrieb
F: Größter Unterschied V4 vs. V3.2?
A: Native 1M Token; deutlich weniger Compute/VRAM (V4-Pro: FLOPs 27%, KV Cache 10% vs. V3.2). Agent-Optimierung in V4.
F: V4 Flash oder V4 Pro im Alltag?
A: Dialog, Batch, kostensensitive Agent-Pipelines: V4-Flash-0731 (bessere Agent-Scores als Pro-Preview). Tiefes Reasoning, Budget egal: Pro-Preview bis offizielles Pro.
F: V4 Pro offiziell verfügbar?
A: Nein (Stand Redaktion). Nur V4-Flash-0731 via API. Pro + Harness: „so schnell wie möglich“. „10.–20. August“ unbestätigt.
F: DeepSeek-Scores vertrauenswürdig?
A: SWE-bench Verified (Drittanbieter) solide. Terminal Bench 2.0 etc. mit undisclosed Harness — erst nach unabhängiger Reproduktion (Claude Code, Cursor) bewerten.
F: Praktische Auswirkung für Entwickler?
A: OpenAI/Anthropic-kompatibel; deepseek-v4-flash zeigt auf neue Version. Legacy-Namen migrieren.
Vor V4-GA verspottete die chinesische AI-Community Liang Wenfeng als „Liang Boiled Water“ (Wortspiel: leeres Warten). Nach 0731 kehrte der Spitzname „Liang Saint“ zurück. Relevanter: „Kill-line“-Effekt — erklärt u.a. GPT-5.6 Luna −80%. Am 31.7. keine signifikante Bewegung bei NVIDIA, Broadcom, AMD — Markt gewöhnt an „DeepSeek-Effizienz“-Narrativ.
Reine API-Nutzung: niedrige Einstiegshürde. Langlaufende Agents auf Shared VPS: Memory-Jitter, Verbindungsabbrüche; 284B lokal: 96GB+ Unified Memory; parallele Toolchains: fehlender 7×24-Host. Für produktive OpenClaw-, Claude-Code- oder Cursor-Agent-Gateways: JEXCLOUD Multi-Region Bare-Metal Mac — dediziertes Apple-Silicon-RAM, kein Overselling-Jitter, launchd-persistente Agents, 120s Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.