AI Agent Open-Source-LLM 2026.08.05

DeepSeek V4 Flash offiziell: Benchmarks nahe Opus 4.8, Preis ein Bruchteil, Pro-Version noch ausstehend

Am 31. Juli stufte DeepSeek V4-Flash zur offiziellen Version DeepSeek-V4-Flash-0731 hoch: Parameter unverändert, nur Re-Post-Training. Agent-Benchmarks überholen das größere V4-Pro-Preview; der Preis liegt bei einem Bruchteil von Claude Opus 4.8. Das Flaggschiff V4-Pro (offiziell) und das eigene Agent-Framework Harness sind weiterhin nicht verfügbar.

Für AI-Entwickler und Modellentscheider beantwortet dieser Artikel drei Punkte: ① die vollständige Timeline vom April-Preview bis zur offiziellen Version vom 31. Juli; ② Preise, Architektur und Harness im Vergleich zu Kimi K3 und Qwen3.8-Max; ③ Score-Kontroversen, Preiskampf und eine 6-Schritte-Integrationscheckliste. Datenstand: 2026-08-05.

01 Vom April-Preview zur Juli-Offiziellversion: Timeline und Kernprobleme

Kein neues Modell, sondern Re-Post-Training desselben 284B Gesamt- / 13B aktiver Parameter. V4-Pro (offiziell) und Harness stehen auf „bald verfügbar“ ohne festes Datum.

  • 24. April 2026: DeepSeek-V4-Preview erstmals veröffentlicht und open source (V4-Pro 1,6T/49B, V4-Flash 284B/13B), jeweils 1M Token Kontext, MIT.
  • 24. Juli 2026: Legacy-APIs deepseek-chat und deepseek-reasoner eingestellt; Traffic auf V4-Namensgebung umgestellt.
  • 27. Juli 2026: Kimi K3 (2,8T) Open Weights auf Hugging Face — Wettbewerbsdruck für DeepSeek.
  • 31. Juli 2026: V4-Flash-0731 offiziell in API-Beta; Weights auf Hugging Face; Changelog nennt Harness erstmals. Beta nur API, App/Web noch nicht synchron.
  • Stand 5. August 2026: V4-Pro offiziell weiter „so schnell wie möglich“. Medien zitieren anonyme Quellen für GA-Fenster 10.–20. August — von DeepSeek nicht bestätigt.

Kernprobleme für Entwickler:

  • Flaggschiff ausstehend: V4-Pro offiziell und Harness ohne Release-Datum; Pro-Abhängigkeit erfordert Preview weiter.
  • Benchmark-Sensitivität: Agent-Scores mit undisclosed Harness „Minimal Mode“; DeepSeek warnt vor Gleichsetzung mit Modellfähigkeit.
  • API vs. Consumer: 0731 nur API; App/Web auf älterer Version.
  • Wettbewerbsdruck: Qwen3.8-Max (GA 2.8.), Kimi K3 (27.7.), GPT-5.6-Preissenkung komprimieren das Auswahlzeitfenster.

284B Flash übertrifft in mehreren Agent-Benchmarks das mehrfach größere V4-Pro-Preview — Post-Training-Qualität rückt 2026 der reinen Parameter-Skalierung gleichauf oder davon.

02 DeepSeek V4-Flash-0731: Kerndaten

Preis- und Parametervergleich führender Open-Source-LLMs (2026-08-05)
Modell Status Gesamt/Aktiv Kontext Input ($/M, Cache miss/hit) Output $/M Lizenz
DeepSeek-V4-Flash-0731Offiziell (31.7.)284B / 13B1M$0,14 / $0,0028$0,28MIT
DeepSeek-V4-ProPreview (offiziell ausstehend)1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Weights open (27.7.)2,8T / ~104B~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open Source (Juni 2026)~744B / ~40B1MunverifiziertunverifiziertMIT
Qwen3.8-MaxAPI GA (2.8.), Weights ausstehend2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Open Source versprochen

Preise: Herstellerangaben. DeepSeek kündigt „2× Peak-Tarif“ an (Peking 9–12, 14–18 Uhr); kein Startdatum zum Redaktionsschluss.

03 Architektur unverändert, Post-Training neu: CSA+HCA und Harness

V4-Flash-0731: identische Parameter und Struktur wie April-Preview; Gewinn ausschließlich aus Re-Post-Training. Laut Technical Report drei Architekturänderungen:

  • Hybrid Attention: CSA + HCA als DSA Sparse Attention — weniger Compute/VRAM bei langem Kontext.
  • mHC: verbesserte Residual-Verbindungen.
  • Muon Optimizer: schnellere, stabilere Konvergenz.

Offizielle Metrik (1M Token): V4-Pro vs. V3.2 — FLOPs/token 27%, KV Cache 10%. Keine unabhängige Reproduktion bestätigt.

DeepSeek Harness (31.7. Changelog): eigenes Agent-Framework für Dateien, Tools, Shell, End-to-End-Engineering — Gegenstück zu Claude Code. Bisher Drittanbieter-Agent-Tools.

Agent-Scores (Terminal Bench 2.0: 82,7 vs. V4-Pro-Preview 67,9) alle mit Harness „Minimal Mode“ (max, top_p=0,95, temperature=1,0). Changelog: „Scores hängen stark vom Harness ab.“

DeepSeek Agent-Benchmarks (Hersteller, Harness minimal mode)
Benchmark Flash-0731 Flash Preview V4-Pro Preview Opus 4.8
Terminal Bench 2.182,761,872,185,0
NL2Repo54,239,438,569,7
DeepSWE54,47,312,858,0
Toolathlon-Verified70,349,755,976,2

04 Open-Source-Wettbewerb: Preis-Leistung als Hauptfeld

Artificial Analysis: Intelligence Index und Kosten/Task (Drittanbieter)
Modell Lab Gesamtparameter Intelligence Index Kosten/Task
DeepSeek-V4-Flash-0731DeepSeek284B50$0,03
Kimi K3Moonshot2,8T57$0,86
GLM-5.2Z.ai~744B~1 Punkt über V4-Flashunverifiziert
GPT-5.6 SolOpenAInicht offengelegt9+ Punkte über V4-Flash$1,86
Claude Fable 5Anthropicnicht offengelegt9+ Punkte über V4-Flash$3,15

Intelligence Index und Kosten/Task: Artificial Analysis (via Medien). DeepSeek-Scores: Hersteller — getrennt ausgewiesen wegen unterschiedlicher Methodik.

Kernbefund: V4-Flash nicht Spitzen-Intelligence (hinter Kimi K3, GLM-5.2), aber Kosten/Task ca. 1/29 von Kimi K3, 1/62 von GPT-5.6 Sol, 1/105 von Claude Fable 5. Strategie: „ausreichende Intelligenz + extrem niedriger Preis“ — erklärt 7 Wochen #1 auf OpenRouter (Preview).

„Kill line“ in chinesischen Dev-Kreisen: DeepSeek setzt eine Preis-Leistungs-Schwelle — Modelle ohne klaren Vorsprung und ohne tieferen Preis verlieren Marktpräsenz.

05 Score-Kontroversen, 6-Schritte-Integration, zitierbare Daten

Klar zu kennzeichnen:

  • Harness-Abhängigkeit: Agent-Scores mit undisclosed Minimal Mode — bis Community-Reproduktion „Hersteller + spezifisches Framework“.
  • Verfügbarkeit: Berichte über niedrige Cache-Hit-Rate, gelegentliche Safety-Classifier-Timeouts (via Medien, Entwickler-Feedback).
  • V4-Pro-Datum unbestätigt: „10.–20. August GA“ nur anonyme Quellen; offiziell: „so schnell wie möglich“.
  • Finanzierungsgerüchte: ~7,4 Mrd. USD, ~48,7 Mrd. USD Bewertung — „laut Berichten“, keine offizielle Bestätigung.

6 Schritte für sichere Integration von V4-Flash-0731:

  1. API-Naming: Modell-ID deepseek-v4-flash (zeigt auf 0731). Legacy deepseek-chat/deepseek-reasoner sofort migrieren.
  2. API Key: DeepSeek Open Platform; Guthaben und Peak-2×-Hinweis prüfen.
  3. Protokoll: OpenAI ChatCompletions oder Anthropic — base_url an Toolchain anpassen, kein Client-Code-Change nötig.
  4. Sandbox A/B: Eigene Prompts vs. Kimi K3 / Qwen3.8-Max — nicht nur Hersteller-Tabelle.
  5. Harness beobachten: Nach Release offizielle Benchmarks replizieren; Claude Code / Cursor zur Kreuzvalidierung.
  6. Lokal deployen: MIT-Weights auf Hugging Face (deepseek-ai/DeepSeek-V4-Flash-0731); 284B MoE braucht High-Memory Apple Silicon oder GPU-Cluster.
deepseek_v4_flash_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    temperature=1.0,
    top_p=0.95
)

Zitierbare Hard Facts (DeepSeek, Artificial Analysis, 2026-08-05):

  • Parameter: 284B gesamt / 13B aktiv; Architektur = April-Preview
  • Preis: Input $0,14/M (miss), $0,0028/M (hit); Output $0,28/M
  • Terminal Bench 2.1: 82,7 (Hersteller, Harness minimal mode)
  • Artificial Analysis: Terminal-Bench 2.1 ~78,65% — Delta 4,05 zu 82,7
  • Kosten/Task: $0,03 — 1/29 Kimi K3, 1/105 Claude Fable 5
  • Long-Context: 1M Token: FLOPs 27% vs. V3.2, KV Cache 10% (Hersteller)
  • vs. Opus 4.8: Input ~36× (miss), ~179× (hit), Output ~89× günstiger (Listenpreise)
  • Lizenz: MIT; Weights auf Hugging Face

06 FAQ, Branchenkontext, Produktionsbetrieb

F: Größter Unterschied V4 vs. V3.2?
A: Native 1M Token; deutlich weniger Compute/VRAM (V4-Pro: FLOPs 27%, KV Cache 10% vs. V3.2). Agent-Optimierung in V4.

F: V4 Flash oder V4 Pro im Alltag?
A: Dialog, Batch, kostensensitive Agent-Pipelines: V4-Flash-0731 (bessere Agent-Scores als Pro-Preview). Tiefes Reasoning, Budget egal: Pro-Preview bis offizielles Pro.

F: V4 Pro offiziell verfügbar?
A: Nein (Stand Redaktion). Nur V4-Flash-0731 via API. Pro + Harness: „so schnell wie möglich“. „10.–20. August“ unbestätigt.

F: DeepSeek-Scores vertrauenswürdig?
A: SWE-bench Verified (Drittanbieter) solide. Terminal Bench 2.0 etc. mit undisclosed Harness — erst nach unabhängiger Reproduktion (Claude Code, Cursor) bewerten.

F: Praktische Auswirkung für Entwickler?
A: OpenAI/Anthropic-kompatibel; deepseek-v4-flash zeigt auf neue Version. Legacy-Namen migrieren.

Vor V4-GA verspottete die chinesische AI-Community Liang Wenfeng als „Liang Boiled Water“ (Wortspiel: leeres Warten). Nach 0731 kehrte der Spitzname „Liang Saint“ zurück. Relevanter: „Kill-line“-Effekt — erklärt u.a. GPT-5.6 Luna −80%. Am 31.7. keine signifikante Bewegung bei NVIDIA, Broadcom, AMD — Markt gewöhnt an „DeepSeek-Effizienz“-Narrativ.

Reine API-Nutzung: niedrige Einstiegshürde. Langlaufende Agents auf Shared VPS: Memory-Jitter, Verbindungsabbrüche; 284B lokal: 96GB+ Unified Memory; parallele Toolchains: fehlender 7×24-Host. Für produktive OpenClaw-, Claude-Code- oder Cursor-Agent-Gateways: JEXCLOUD Multi-Region Bare-Metal Mac — dediziertes Apple-Silicon-RAM, kein Overselling-Jitter, launchd-persistente Agents, 120s Bereitstellung. Knoten und Preise: JEXCLOUD Preisseite.