DeepSeek V4 Flash officiel : benchmarks proches d'Opus 4.8, prix à une fraction, version Pro encore en attente
Le 31 juillet, DeepSeek a promu V4-Flash en version officielle DeepSeek-V4-Flash-0731 : paramètres inchangés, post-entraînement renouvelé. Les benchmarks Agent dépassent la preview V4-Pro, plus volumineuse, pour un prix représentant une fraction de celui de Claude Opus 4.8. Le flagship V4-Pro officiel et le framework Agent propriétaire Harness restent indisponibles.
À l'intention des développeurs IA et des décideurs en choix de modèles, cet article couvre trois axes : ① la chronologie complète de la preview d'avril à la version officielle du 31 juillet ; ② les données clés sur tarification, architecture et Harness, comparées à Kimi K3 et Qwen3.8-Max ; ③ les controverses de scores, la guerre des prix et une checklist d'intégration en six étapes. Données au 2026-08-05.
01 De la preview d'avril à la version officielle de juillet : chronologie et enjeux
Il ne s'agit pas d'un nouveau modèle, mais d'un post-entraînement du même gabarit 284B paramètres totaux / 13B actifs. Le V4-Pro officiel et Harness, premier framework Agent maison de DeepSeek, restent annoncés « bientôt » sans date ferme.
- 24 avril 2026 : première publication open source de DeepSeek-V4 preview (V4-Pro 1,6T/49B, V4-Flash 284B/13B), contexte 1M tokens, licence MIT.
- 24 juillet 2026 : arrêt des anciennes API
deepseek-chatetdeepseek-reasoner; bascule vers la nomenclature V4. - 27 juillet 2026 : poids open source de Kimi K3 (2,8T) sur Hugging Face — pression concurrentielle sur DeepSeek.
- 31 juillet 2026 : V4-Flash-0731 officiel en beta API ; poids synchronisés sur Hugging Face ; changelog mentionnant Harness pour la première fois. Beta API uniquement ; app et web non synchronisés.
- Au 5 août 2026 : V4-Pro officiel toujours « dès que possible ». Des médias chinois citent des sources anonymes pour une fenêtre GA 10–20 août — non confirmé par DeepSeek, à titre indicatif.
Principaux points de friction pour les développeurs :
- Flagship en suspens : V4-Pro officiel et Harness sans date ; les environnements dépendant de Pro restent sur la preview.
- Sensibilité méthodologique : benchmarks Agent mesurés avec le « mode minimal » non public de Harness ; DeepSeek prévient de ne pas les assimiler à la capacité brute du modèle.
- Fracture API / grand public : 0731 officiel réservé à l'API ; app et web sur une version antérieure.
- Rafale concurrentielle : Qwen3.8-Max (GA 2 août), Kimi K3 (poids 27 juillet), baisse de prix GPT-5.6 compriment la fenêtre de décision.
Le Flash à 284B dépasse en benchmarks Agent la preview V4-Pro, plusieurs fois plus grande — en seconde moitié 2026, la qualité du post-entraînement rivalise avec, voire dépasse, l'empilement de paramètres.
02 DeepSeek V4-Flash-0731 : données essentielles
| Modèle | Statut | Total/actifs | Contexte | Input ($/M, miss/hit cache) | Output $/M | Licence |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Officiel (31/7) | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| DeepSeek-V4-Pro | Preview (officiel en attente) | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Poids ouverts (27/7) | 2,8T / ~104B | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open source (juin 2026) | ~744B / ~40B | 1M | non vérifié | non vérifié | MIT |
| Qwen3.8-Max | API GA (2/8), poids en attente | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Open source promis |
Tarifs : données publiques des éditeurs. DeepSeek annonce un tarif « 2× en heures de pointe » (Pékin 9h–12h, 14h–18h) ; date d'entrée en vigueur non communiquée à la rédaction.
03 Architecture stable, post-entraînement renouvelé : CSA+HCA et première apparition de Harness
V4-Flash-0731 conserve exactement les mêmes paramètres et structure que la preview d'avril ; le gain provient « entièrement du post-entraînement ». Selon le rapport technique « DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence », trois évolutions structurantes :
- Attention hybride : CSA et HCA unifiées en attention sparse DSA — réduction du coût compute et VRAM en long contexte.
- mHC : hyper-connexions à contrainte de variété, améliorant les connexions résiduelles.
- Optimiseur Muon : convergence plus rapide et stable.
Métriques officielles (1M tokens) : V4-Pro vs V3.2 — FLOPs/token à 27%, KV Cache à 10%. Pas de reproduction indépendante confirmée.
DeepSeek Harness, cité le 31 juillet dans le changelog, est le framework d'exécution Agent maison (fichiers, outils, commandes, tâches engineering de bout en bout), en regard de Claude Code. Jusqu'ici, les modèles DeepSeek s'appuyaient surtout sur des outils tiers.
Scores Agent officiels (Terminal Bench 2.0 : 82,7, devant la preview V4-Pro à 67,9) obtenus en « mode minimal » Harness (max, top_p=0,95, temperature=1,0). DeepSeek précise : « les scores dépendent fortement du harness choisi ».
| Benchmark | Flash-0731 | Flash preview | V4-Pro preview | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82,7 | 61,8 | 72,1 | 85,0 |
| NL2Repo | 54,2 | 39,4 | 38,5 | 69,7 |
| DeepSWE | 54,4 | 7,3 | 12,8 | 58,0 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 | 76,2 |
04 Concurrence open source : le rapport qualité-prix comme terrain principal
| Modèle | Labo | Paramètres totaux | Intelligence Index | Coût moyen/tâche |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B | 50 | $0,03 |
| Kimi K3 | Moonshot | 2,8T | 57 | $0,86 |
| GLM-5.2 | Z.ai | ~744B | ~1 point au-dessus de V4-Flash | non vérifié |
| GPT-5.6 Sol | OpenAI | non divulgué | 9+ points au-dessus de V4-Flash | $1,86 |
| Claude Fable 5 | Anthropic | non divulgué | 9+ points au-dessus de V4-Flash | $3,15 |
Intelligence Index et coût/tâche : Artificial Analysis (via presse économique). Scores DeepSeek : auto-déclarés — présentés séparément en raison de méthodologies différentes.
Constat : V4-Flash n'occupe pas le sommet de l'Intelligence Index (derrière Kimi K3 et GLM-5.2), mais le coût/tâche représente environ 1/29 de Kimi K3, 1/62 de GPT-5.6 Sol, 1/105 de Claude Fable 5. La stratégie DeepSeek : « intelligence suffisante + prix extrême » — ce qui explique sept semaines consécutives en tête des appels sur OpenRouter (preview).
Dans la communauté chinoise, on parle de « kill line » : DeepSeek fixe un seuil prix-performance ; sans avantage net ni prix inférieur, un modèle disparaît du marché.
05 Controverses de scores, intégration en six étapes, données citables
Points à qualifier explicitement :
- Dépendance à Harness : scores Agent via mode minimal non public — à traiter comme « éditeur + framework spécifique » jusqu'à reproduction communautaire.
- Disponibilité : retours d'usage signalant un faible taux de hit cache et des timeouts sporadiques du classificateur de sécurité (via presse, développeurs).
- Date V4-Pro non confirmée : fenêtre « 10–20 août » issue de sources anonymes ; formulation officielle : « dès que possible ».
- Rumeurs de financement : ~7,4 Md USD levés, valorisation ~48,7 Md USD — « selon des sources », sans confirmation officielle ou réglementaire.
Six étapes pour intégrer V4-Flash-0731 en toute sécurité :
- Vérifier le nommage API : ID
deepseek-v4-flash(pointe vers 0731). Migrer immédiatement depuisdeepseek-chat/deepseek-reasoner. - Créer une clé API : plateforme DeepSeek ; solde et tarification (y compris annonce peak 2×).
- Choisir le protocole : OpenAI ChatCompletions ou Anthropic — adapter
base_url, sans modifier le client. - A/B en sandbox : prompts métier vs Kimi K3 / Qwen3.8-Max — ne pas migrer sur la seule base des tableaux éditeur.
- Surveiller Harness : reproduire les benchmarks officiels après publication ; valider avec Claude Code / Cursor.
- Planifier le déploiement local : poids MIT sur Hugging Face (
deepseek-ai/DeepSeek-V4-Flash-0731) ; MoE 284B exige Apple Silicon haute mémoire ou cluster GPU datacenter.
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
temperature=1.0,
top_p=0.95
)
Données citables (DeepSeek, Artificial Analysis, 2026-08-05) :
- Paramètres : 284B total / 13B actifs ; architecture identique à la preview d'avril
- Tarifs : input $0,14/M (cache miss), $0,0028/M (hit) ; output $0,28/M
- Terminal Bench 2.1 : 82,7 (éditeur, Harness minimal mode)
- Artificial Analysis : Terminal-Bench 2.1 ~78,65 % — écart de 4,05 avec 82,7
- Rapport qualité-prix : $0,03/tâche — 1/29 de Kimi K3, 1/105 de Claude Fable 5
- Long contexte : 1M tokens — FLOPs 27 % vs V3.2, KV Cache 10 % (éditeur)
- vs Opus 4.8 : input ~36× (miss), ~179× (hit), output ~89× moins cher (tarifs listés)
- Open source : MIT ; poids sur Hugging Face
06 FAQ, contexte sectoriel et passage en production
Q : Différence majeure V4 vs V3.2 ?
R : Contexte natif 1M tokens ; coût compute et VRAM fortement réduit (V4-Pro : FLOPs 27 %, KV Cache 10 % vs V3.2). Optimisation Agent dans V4.
Q : V4 Flash ou V4 Pro au quotidien ?
R : Dialogue, batch, pipelines Agent à coût maîtrisé : V4-Flash-0731 (meilleurs scores Agent que la preview Pro). Raisonnement profond, budget flexible : preview Pro en attendant l'officiel.
Q : V4 Pro officiel disponible ?
R : Non à la rédaction. Seul V4-Flash-0731 via API. Pro + Harness : « dès que possible ». « 10–20 août » : rumeur non confirmée.
Q : Scores DeepSeek fiables ?
R : SWE-bench Verified (tiers) crédible. Terminal Bench 2.0 etc. via Harness non public — attendre reproduction indépendante (Claude Code, Cursor).
Q : Impact pratique pour les développeurs ?
R : API compatible OpenAI/Anthropic ; deepseek-v4-flash pointe vers la nouvelle version. Migrer les anciens noms rapidement.
Avant le GA V4, la communauté IA chinoise surnommait Liang Wenfeng « Liang Boiled Water » (jeu de mots sur l'attente). Après 0731, le surnom « Liang Saint » revient. Plus structurant : l'effet « kill line », illustré par la baisse de 80 % sur GPT-5.6 Luna. Le 31 juillet, NVIDIA, Broadcom et AMD n'ont pas bougé de façon marquée — le marché intègre désormais le récit « efficacité à la DeepSeek ».
L'appel API pur reste accessible, mais les Agents longue durée sur VPS partagé subissent jitter mémoire et coupures de connexion ; le déploiement local 284B exige 96 Go+ de mémoire unifiée ; les toolchains parallèles manquent d'un hôte stable 7×24. Pour des gateways Agent OpenClaw, Claude Code ou Cursor en production continue, JEXCLOUD Mac bare metal multi-régions offre mémoire unifiée Apple Silicon dédiée, bande passante sans survente, Agents persistants via launchd, déploiement en 120 secondes. Nœuds et tarifs : page tarifs JEXCLOUD.