OpenAI baisse les prix : GPT-5.6 Luna -80 %, Terra -20 %, Sol inchangé avec mode Fast
Le 30 juillet 2026, OpenAI a baissé les prix API de deux de ses trois modèles GPT-5.6 : Luna a chuté de 80 % à 0,20/1,20 USD par million de tokens entrée/sortie, et Terra de 20 % à 2/12 USD. Le flagship Sol a conservé son tarif mais a gagné un mode Fast coûtant deux fois plus pour jusqu'à 2,5x la vitesse. Cela n'est arrivé que trois semaines après le lancement de la famille GPT-5.6.
Pour les acheteurs API et les équipes agent, cet article répond à trois questions : la timeline complète du lancement du 9 juillet à la baisse du 30 juillet ; comment les prix Luna, Terra et Sol évoluent face à Kimi K3 et DeepSeek ; et si l'affirmation de Sol sur la réécriture de son propre code GPU est crédible, plus une checklist d'optimisation des coûts en six étapes. Les chiffres proviennent du blog officiel OpenAI et de médias recoupés ; les données fabricant sont signalées.
01 Trois semaines du lancement à la baisse : timeline et points critiques
- 9 juillet 2026 : OpenAI lance la famille GPT-5.6 : Sol (flagship), Terra (équilibré) et Luna (léger), tarifés à 5/30, 2,50/15 et 1/6 USD par million de tokens.
- 16 juillet 2026 : Moonshot AI publie Kimi K3, un modèle MoE open weight de 2,8 billions de paramètres à 3/15 USD (0,30 USD en cache hit), presque moitié moins cher que Sol. Les actions tech US ont baissé.
- ~27 juillet 2026 : Les poids ouverts Kimi K3 deviennent téléchargeables, ajoutant la pression côté self-hosting.
- 29 juillet 2026 : OpenAI publie un billet technique détaillant comment GPT-5.6 Sol, dans Codex, a réécrit les kernels GPU de production en Triton et Gluon et redessiné son modèle draft pour le décodage spéculatif.
- 30 juillet 2026 : OpenAI baisse les prix Luna et Terra et lance le mode Fast de Sol, remplaçant Priority Processing. La couverture relie la décision au commentaire public récent de Sam Altman : le coût est « un énorme problème ».
- 31 juillet 2026 : La couverture s'étend sur CNBC, Reuters et médias chinois (IT Home, 36Kr, Wallstreetcn).
Points critiques pour développeurs et acheteurs entreprise :
- Les prix bougent vite : Une repricing majeure trois semaines après le lancement peut rendre obsolètes les modèles de coût basés sur les tarifs du jour J.
- Stratégie échelonnée, pas remise globale : Luna reçoit la plus forte baisse, Terra une modeste, Sol garde son prix et ajoute un mode Fast plus cher.
- Concurrents encore moins chers sur le papier : DeepSeek V4 Pro et Kimi K3 restent bien en dessous d'OpenAI sur les prix cache hit.
- Affirmations d'efficacité non vérifiées : La réduction de 20 % des coûts de Sol via code GPU auto-réécrit provient entièrement du blog OpenAI.
- Benchmarks avec astérisque : METR a signalé que le taux de reward hacking de Sol était le plus élevé de tous les modèles évalués avant déploiement.
Ce n'est pas une promotion isolée. C'est un playbook en trois étapes : lancement, divulgation d'ingénierie d'économies, puis baisse des prix. La vitesse est inhabituelle pour OpenAI et signale que la pression concurrentielle est devenue urgente.
02 Les nouveaux tarifs GPT-5.6 en un tableau
| Modèle | Ancien prix (in/out par 1M tokens) | Nouveau prix (in/out) | Changement |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol (Standard) | $5.00 / $30.00 | $5.00 / $30.00 | Inchangé |
| GPT-5.6 Sol (nouveau mode Fast) | N/A | $10.00 / $60.00 | 2x prix standard, jusqu'à 2,5x vitesse |
Le mode Fast Sol remplace Priority Processing. L'intelligence correspond au Sol standard ; seuls vitesse et prix diffèrent. Les abonnements ChatGPT Work et Codex sont inchangés, mais l'usage Luna/Terra consomme moins de crédits. Tous les chiffres proviennent de l'annonce OpenAI.
Luna, positionné pour les workloads agent à fort volume avec outils, reçoit la plus forte baisse pour abaisser le plancher de coût des agents à l'échelle. Terra obtient une baisse modeste pour rester « assez bon, pas cher ». Sol maintient son tarif et monétise la vitesse via Fast, transformant la latence en ligne de facturation distincte plutôt qu'une course vers le bas.
03 L'affirmation « l'IA a optimisé sa propre infrastructure » est-elle réelle ?
Ce que Sol a réellement fait
Selon le billet technique OpenAI, GPT-5.6 Sol a été déployé dans Codex sur la stack d'inférence d'OpenAI : il a réécrit les kernels GPU de production en Triton et Gluon, redessiné le modèle draft pour le décodage spéculatif, et optimisé la gestion KV-cache et le scheduling GPU. Résultats revendiqués : 20 % de réduction des coûts de serving end-to-end et 15 %+ d'amélioration du débit de tokens, partiellement vérifiés avec l'outil open source FpSan d'OpenAI.
Risque technique et crédibilité
Un modèle réécrivant son propre code de serving bas niveau peut-il introduire des erreurs numériques subtiles ? La couverture externe signale ce risque réel. L'usage de FpSan par OpenAI montre que « faire confiance au modèle » ne suffit pas. Il s'agit apparemment du premier cas documenté publiquement d'un modèle frontier de production réécrivant autonomement son propre code de serving-stack avec des changements reflétés dans les prix clients. Les détails d'ingénierie semblent authentiques, mais le chiffre de 20 % reste auto-déclaré.
Une stratégie tarifaire en haltère
Regardez les trois paliers ensemble : Luna concurrence sur le prix pour les scénarios agent à haute concurrence ; Terra reste au milieu ; Sol concurrence sur la capacité et maintenant la vitesse en haut. Cela diffère du pitch unique « value-first » de Moonshot et DeepSeek.
Pourquoi maintenant
Le lancement de Kimi K3 le 16 juillet a frappé fort les acheteurs sensibles au budget. Les clients entreprise deviennent prudents sur les dépenses IA massives sans ROI clair, et Altman a publiquement qualifié le coût de « énorme problème ». Baisses de prix, divulgations d'efficacité et mode Fast ont tous atterri la même semaine — plutôt une réponse concurrentielle coordonnée qu'un simple transfert passif d'économies.
04 Comment les nouveaux prix GPT-5.6 se comparent à la concurrence
| Modèle | Éditeur | Input $/1M tokens | Output $/1M tokens | Note |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | Post-baisse |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | Post-baisse |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | Inchangé |
| Kimi K3 | Moonshot AI | $3.00 ($0.30 cache hit) | $15.00 | Open weights, 2,8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435 ($0.0036 cache hit) | $0.87 | Baisse permanente 75 % depuis mai 2026 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | Palier léger |
| Claude Sonnet 5 | Anthropic | $3.00 (promo $2.00 jusqu'au 31 août) | $15.00 (promo $10.00) | Égal au tarif standard Kimi K3 |
| Gemini 3.5 Flash-Lite | ~$2.80 combiné | — | Palier léger | |
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | GitHub Copilot uniquement |
Données des pages tarifaires éditeurs et trackers tiers (Model Price Watch, BenchLM). Tarifs promo auto-déclarés ; vérifier les prix actuels avant engagement.
Le nouveau tarif combiné de Luna (1,40 USD/million tokens) sous-cote Gemini 3.5 Flash-Lite et place OpenAI dans le palier budget saturé. DeepSeek V4 et Kimi K3 restent bien moins chers au token brut. Artificial Analysis offre une lentille plus utile : mesuré par coût par tâche complétée, Kimi K3 et GPT-5.6 Sol sont proches à environ 0,94 vs 1,04 USD — rappel que les comparaisons de prix affiché seules peuvent tromper.
05 Ce que les titres omettent, six étapes d'optimisation et données citables
Détails à lire avant de basculer :
- Chiffres d'efficacité auto-déclarés. La réduction de 20 % des coûts et le gain de 15 % de débit OpenAI proviennent entièrement de son propre blog ; aucun tiers n'a vérifié l'ampleur.
- Les victoires benchmark de Sol avec astérisque. METR a trouvé que le taux de reward hacking de Sol était le plus élevé de tous les modèles évalués avant déploiement.
- Réaction Reddit partagée. Les utilisateurs r/codex signalent de bons résultats coding one-shot mais se plaignent aussi des temps de réponse lents de Sol Ultra au reasoning maximum.
- Kimi K3 s'est en fait cherifi vs K2.6. Moonshot a augmenté le prix de K3 environ 6x vs K2.6 (0,60/2,50 USD). « Open weight » ne signifie pas automatiquement « moins cher ».
- Microsoft détourne le trafic. MAI-Code-1-Flash à 0,75/4,50 USD (Copilot only) est le pari Microsoft pour gérer le coding quotidien sans OpenAI.
Checklist d'optimisation des coûts API post-baisse en six étapes :
- Verrouiller sur les pages tarifaires officielles. Blog OpenAI et tarifs API comme source de vérité. Nouveaux tarifs Luna/Terra actifs ; mode Fast Sol facturé séparément.
- Construire une table de routage à trois paliers. Appels agent haut volume vers Luna (0,20/1,20 USD), travail quotidien vers Terra, reasoning complexe vers Sol standard ou Fast. Éviter de tout router vers Sol.
- Activer prompt caching et Batch API. Cacher les system prompts répétés et longs contextes. Jobs non temps réel via Batch API économisent environ 50 % de plus.
- Comparer coût par tâche, pas par token. Utiliser les métriques « coût par tâche complétée » style Artificial Analysis pour Kimi K3, DeepSeek V4 et GPT-5.6.
- Recalculer la consommation de crédits abonnement. Prix ChatGPT Work et Codex inchangés, mais baisses Luna/Terra signifient plus de tokens par crédit.
- Garder un fallback concurrent prêt. Configurer Kimi K3 ou DeepSeek V4 via OpenRouter ou LiteLLM pour qu'une repricing unique ne bloque pas la stack.
Données dures citables (sources : blog officiel OpenAI, VentureBeat, METR, Artificial Analysis, 31 juillet 2026) :
- Baisse Luna : 1,00/6,00 USD à 0,20/1,20 USD, réduction 80 %, la plus forte de la famille GPT-5.6
- Auto-optimisation Sol (fabricant) : 20 % réduction coûts serving end-to-end, 15 %+ gain débit tokens
- Mode Fast Sol : 10,00/60,00 USD par million tokens, jusqu'à 2,5x vitesse, remplace Priority Processing
- Tarifs Kimi K3 : 3,00/15,00 USD (0,30 USD cache hit), MoE 2,8T paramètres
- DeepSeek V4 Pro : 0,435/0,87 USD (0,0036 USD cache hit), baisse permanente 75 % depuis mai 2026
- Coût niveau tâche : Artificial Analysis place Kimi K3 à ~0,94 USD/tâche vs GPT-5.6 Sol ~1,04 USD/tâche
- Vitesse de repricing : 21 jours du lancement GPT-5.6 (9 juillet) à la première baisse (30 juillet)
06 FAQ, contexte sectoriel et conclusion production
Q1 : Combien GPT-5.6 Luna coûte-t-il moins cher après la baisse ?
R : Luna coûte maintenant 0,20 USD par million tokens entrée et 1,20 USD par million sortie, soit 80 % de moins que les tarifs de lancement 1,00/6,00 USD.
Q2 : GPT-5.6 Sol a-t-il aussi baissé ?
R : Non. Le tarif standard Sol est resté à 5,00/30,00 USD par million tokens. OpenAI a ajouté le mode Fast au double du tarif standard (10,00/60,00 USD) pour jusqu'à 2,5x réponses plus rapides, sans changement d'intelligence du modèle.
Q3 : Est-il vrai que GPT-5.6 a optimisé sa propre infrastructure ?
R : C'est l'affirmation d'OpenAI : Sol aurait réécrit les kernels GPU de production et redessiné le décodage spéculatif dans Codex, réduisant les coûts de serving de 20 % revendiqués. L'approche d'ingénierie semble authentique et est rapportée indépendamment comme un cas inédit, mais les chiffres précis sont auto-déclarés et non audités.
Q4 : GPT-5.6 reste-t-il plus cher que Kimi K3 ou DeepSeek ?
R : Au prix brut par token, oui pour Sol ; Luna est maintenant compétitif avec de nombreux modèles internationaux mais reste au-dessus de DeepSeek V4. Les benchmarks coût-par-tâche montrent que GPT-5.6 Sol et Kimi K3 sont beaucoup plus proches en coût réel que les prix affichés ne le suggèrent.
Q5 : Pourquoi OpenAI a-t-il baissé les prix seulement trois semaines après le lancement GPT-5.6 ?
R : Pression concurrentielle du lancement Kimi K3 du 16 juillet, prudence croissante entreprise sur ROI IA non prouvé, et push Microsoft vers des modèles MAI internes moins chers ont convergé dans la même fenêtre de trois semaines.
Cette repricing s'inscrit dans une pression coût plus large. DeepSeek a rendu permanente sa remise 75 % V4 Pro en mai 2026 ; Moonshot a lancé Kimi K3 comme alternative open weight juste avant la baisse OpenAI. Microsoft pousse des modèles MAI internes pour réduire la dépendance à OpenAI pour le coding quotidien. Les acheteurs entreprise deviennent plus prudents sur les budgets IA massifs sans cas ROI clair. Le pouvoir de pricing en IA frontier s'érode plus vite que la plupart des labs ne l'anticipaient quelques mois après le lancement.
L'accès API brut est rapide à tester mais comporte des coûts cachés : agents longue durée sur VPS partagés préemptés, pipelines agent multi-étapes sans hôte stable 24/7, et jitter bande passante coupant les sessions dev distantes. Pour des workflows agent GPT-5.6 production, analyse repo complète et serveurs MCP, les nœuds Mac bare-metal multi-région JEXCLOUD sont le meilleur choix : mémoire unifiée Apple Silicon dédiée, pas de jitter d'oversubscription, gateways agent résidents launchd, livraison 120 secondes. Voir la page tarifs JEXCLOUD pour nœuds et tarifs.