AI Agent LLM open source 2026.07.20

DeepSeek V4 version complète GA : tarification, architecture et écart face à GPT-5.6

Après trois mois d'attente, la version complète DeepSeek V4 (GA) est officiellement en ligne depuis le 20 juillet 2026. Par rapport à la preview d'avril, la GA apporte des gains mesurables en capacités agent, raisonnement mathématique et génération de code, tout en introduisant pour la première fois une tarification heures pleines et creuses — signalant la transition de DeepSeek d'un modèle « quasi gratuit » vers une exploitation commerciale structurée.

Pour les développeurs IA, les indépendants et les ingénieurs en entreprise, cet article répond à trois questions : ① la chronologie complète preview → GA et les innovations d'architecture (CSA+HCA, mHC, Muon) ; ② les benchmarks avec SWE-bench Verified 80,6 % et la comparaison avec GPT-5.6 et Claude Fable 5 ; ③ comment optimiser les tarifs peak-off-peak et migrer l'API avant la date limite du 24 juillet pour deepseek-chat / deepseek-reasoner.

01 Chronologie : de la preview à la version complète GA

Les contraintes actuelles pour les équipes techniques :

  • Fin des anciennes interfaces : deepseek-chat et deepseek-reasoner seront définitivement retirés le 24 juillet — tout code de production non migré cessera de fonctionner.
  • Complexité tarifaire : la GA introduit des tarifs horaires ; les heures de pointe doublent les taux, et les tâches batch non planifiées génèrent des surcoûts discrets.
  • Pression budgétaire des modèles propriétaires : Claude Fable 5 à $50/M en sortie, GPT-5.6 Sol ~$15/M — les appels agent à haute fréquence deviennent insoutenables.
  • Déploiement du contexte 1M : de nombreux modèles annoncent 1M tokens, mais la mémoire KV Cache rend le déploiement réel coûteux.
Jalons DeepSeek V4 : preview vers version complète
Date Événement
2026-04-24Preview V4 en ligne et open source (MIT) : V4-Pro (1,6T) et V4-Flash (284B)
2026-05Versions optimisées production V4-Flash/Pro, API généralement disponible
2026-06Baisse permanente de 75 % sur V4-Pro (sortie à $0,87/M tokens)
2026-06-29E-mail à tous les utilisateurs API : GA mi-juillet, première divulgation du schéma peak-off-peak
2026-07-19Accès bêta GA pour développeurs sélectionnés, presse : « version complète dès demain »
2026-07-20GA officielle en ligne (date de publication)
2026-07-24Anciens noms deepseek-chat et deepseek-reasoner définitivement retirés

En synthèse : la preview était déjà performante ; la GA consolide les capacités agent, mathématiques et code, avec un cadre tarifaire commercial formel.

02 Architecture technique : rendre le contexte 1M opérationnel

Spécifications V4-Pro vs V4-Flash
Spécification V4-Pro V4-Flash
Paramètres totaux1,6 billion (1,6T)284 milliards (284B)
Paramètres actifs/token49 milliards (49B)13 milliards (13B)
Couches Transformer6143
Fenêtre de contexte1 000 000 tokens1 000 000 tokens
Sortie maximale384K tokens384K tokens
PrécisionFP4 (experts) + FP8 (reste)FP4 + FP8 mixte
Données de pré-entraînement33T+ tokens32T+ tokens
LicenceMITMIT

Attention hybride (CSA + HCA)

DeepSeek V4 abandonne le MLA de V2/V3 au profit de deux mécanismes nouveaux :

  • Compressed Sparse Attention (CSA) : séquence KV compressée 4× par pooling Softmax-gated ; indexeur FP4 « lightning » pour sélection top-k (Pro : top-1024, Flash : top-512) ; fenêtre glissante de 128 tokens. À 1M de contexte, seulement 27 % des FLOPs de V3.2.
  • Heavily Compressed Attention (HCA) : tokens compressés 128× puis attention dense globale pour les dépendances longues ; Flash : 2 premières couches en HCA, puis alternance CSA/HCA ; structure similaire pour Pro.

Résultat global : mémoire KV Cache à 1M tokens réduite à 10 % de V3.2 (V4-Flash jusqu'à 7 %).

Manifold-Constrained Hyper-Connections (mHC)

Évolution des connexions résiduelles classiques : flux résiduel à 4 canaux, matrice de mélange sous contrainte doublement stochastique (polytope de Birkhoff) pour une propagation stable sur 61 couches.

Optimiseur Muon

Entraînement avec Muon plutôt qu'AdamW ; orthogonalisation des gradients par Newton-Schulz — convergence plus rapide et courbe d'entraînement plus stable.

Trois modes d'inférence
Mode Caractéristique Cas d'usage
Non-thinkPas de chaîne de pensée, réponse immédiateQ&R simples, routage
Think HighRaisonnement explicite (<redacted_thinking>)Tâches moyennes, débogage code
Think MaxRaisonnement maximal, contexte 384K+ requisMathématiques complexes, agents longue chaîne

Paramètres d'échantillonnage recommandés : temperature=1.0, top_p=1.0 (tous modes). Déploiement local : guide d'inférence ds4 sur Mac haute mémoire.

03 Benchmarks : le meilleur bilan open source

Données clés V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80,6 %96,0 %non publié séparément~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3 206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

SWE-bench Verified évalue la correction de bugs sur de vrais dépôts GitHub — 80,6 % constitue le record open source actuel, à égalité avec Gemini 3.1 Pro. SWE-bench Pro est plus exigeant ; Claude Fable 5 mène avec 80,3 %.

Rapport qualité-prix (Artificial Analysis) :

  • Claude Fable 5 : tâches Strategy & Ops Index à $3,48 par exécution, score 50
  • DeepSeek V4-Pro : mêmes tâches à $0,03 par exécution, score 38
  • DeepSeek V4-Flash : les six catégories d'index sous $0,04 par exécution

Fable 5 coûte 116 fois plus que V4-Pro pour un écart d'environ 12 points (31 %). Dans la majorité des scénarios de production, V4-Pro offre le meilleur rapport qualité-prix.

04 V4 vs GPT-5.6 : positionnement et tarification peak-off-peak

DeepSeek V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / auto-hébergementMIT, ouiPropriétairePropriétaire
Fenêtre de contexte1M tokensnon divulguée1M tokens
Capacité codetrès élevée (proche Fable 5)très élevéela plus élevée
Sortie API (heures creuses)$0,87/M~$15/M$50/M
Sortie API (heures pleines)$1,74/M
Confidentialité des donnéesdéploiement privé possible

Choix par scénario : budget serré / appels fréquents / déploiement privé → V4-Pro ou V4-Flash ; excellence code maximale → Claude Fable 5 ; algorithmes complexes + raisonnement mathématique → GPT-5.6 Sol/Ultra ; traitement massif de logs → V4-Flash (entrée cache-hit à $0,0028/M seulement).

Grille tarifaire peak-off-peak complète (nouveauté GA)
Modèle Poste Heures creuses Heures pleines
V4-ProEntrée (cache-hit)¥0,025 / $0,0035 / 1M×2
Entrée (cache-miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Sortie¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashEntrée (cache-hit)¥0,02 / $0,0028 / 1M×2
Entrée (cache-miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Sortie¥2,00 / $0,28 / 1M¥4,00 / $0,56

Heures pleines (heure de Pékin) : jours ouvrés 09:00–12:00 et 14:00–18:00. Stratégies d'optimisation : planifier les tâches non temps réel en heures creuses ; exploiter le Prompt Cache ; router les tâches simples vers V4-Flash ; DeepSeek s'engage à notifier toute modification tarifaire 24 heures à l'avance par e-mail. Même en heures pleines, la sortie V4-Pro à $1,74/M reste 8,6 fois moins chère que Claude Opus 4.8 ($15/M).

05 Fin de deepseek-chat : guide de migration API en 6 étapes avant le 24 juillet

Avertissement : les anciens noms deepseek-chat et deepseek-reasoner cesseront définitivement d'être accessibles le 24 juillet 2026 à 15:59 UTC (23:59 heure de Pékin).

Table de correspondance de migration
Ancien nom Nouveau nom Remarque
deepseek-chatdeepseek-v4-flash (mode non-think)Rapide, tâches légères
deepseek-reasonerdeepseek-v4-flash (mode think)ou passage à deepseek-v4-pro

Six étapes pour finaliser la migration :

  1. Rechercher dans le code : identifier toutes les références à deepseek-chat et deepseek-reasoner.
  2. Définir la stratégie de remplacement : dialogues légers → deepseek-v4-flash ; raisonnement complexe → deepseek-v4-pro + Think High/Max.
  3. Mettre à jour l'appel OpenAI SDK : modifier uniquement le paramètre model, conserver base_url à https://api.deepseek.com.
  4. Configurer le mode think : anciens utilisateurs reasoner via extra_body ; Think Max nécessite 384K+ de contexte.
  5. Valider en staging : avant le 24 juillet, exécuter les cas d'usage critiques en pré-production, vérifier latence et coûts.
  6. Surveiller la facturation peak-off-peak : planifier les tâches batch selon l'heure de Pékin, activer le cache pour réduire les coûts d'entrée.
deepseek_v4_migration.py
client.chat.completions.create(model="deepseek-chat", messages=[...])

client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 prend en charge les formats OpenAI ChatCompletions et Anthropic Messages — le SDK Anthropic ne nécessite qu'une mise à jour du paramètre model, base_url="https://api.deepseek.com" reste inchangé.

Données citables (DeepSeek officiel, 2026-07-20) :

  • SWE-bench Verified : 80,6 %, record open source, à égalité avec Gemini 3.1 Pro
  • Efficacité KV Cache : 1M de contexte à seulement 10 % de V3.2 (Flash 7 %)
  • Rapport qualité-prix : V4-Pro $0,03 vs Fable 5 $3,48 par tâche, facteur 116×
  • Sortie heures pleines : V4-Pro $1,74/M, 8,6× moins cher qu'Opus 4.8
  • Date limite migration : 2026-07-24 23:59 heure de Pékin, anciennes interfaces définitivement retirées
  • Sources : documentation DeepSeek, arXiv:2606.19348, HuggingFace, Artificial Analysis

06 Conclusion : la version complète GA et la mise en production

DeepSeek V4 GA représente l'un des jalons open source les plus significatifs de 2026. Sa valeur ne réside pas dans la capacité à surpasser immédiatement Claude Fable 5 ou GPT-5.6, mais dans la proposition de la meilleure performance open source à un dixième, voire un centième du coût des modèles propriétaires.

Publics concernés : entreprises soucieuses de la souveraineté des données, développeurs indépendants à budget contraint, ingénieurs agent nécessitant 1M tokens de contexte, équipes produit IA orientées ROI. La tarification peak-off-peak ajoute une couche de complexité, mais reste hautement compétitive — la transition de « disrupteur tarifaire » à plateforme commerciale structurée témoigne d'une maturité, non d'un recul.

Si vous utilisez encore deepseek-chat, finalisez la migration avant le 24 juillet sous peine d'interruption de service.

L'appel API pur permet une intégration rapide de V4, mais masque trois coûts implicites : agents 1M tokens insuffisants en RAM sur VPS partagé, inférence batch peak-off-peak sans hôte de planification stable, inférence locale des poids MIT nécessitant du matériel Mac haute mémoire unifiée. Pour les pipelines agent DeepSeek 7×24, l'inférence ds4 locale ou les serveurs MCP long contexte, le Mac bare-metal multi-région JEXCLOUD constitue la solution adaptée : mémoire unifiée Apple Silicon dédiée, sans survente, passerelle launchd permanente, livraison en 120 secondes. Nœuds et tarifs : page tarifaire JEXCLOUD.