Pourquoi DeepSeek a-t-il relevé ses prix API jusqu'à 1 100 % juste après l'offensive chinoise des poids ouverts ?
Entre le 12 et le 17 août, en cinq jours, le cercle des grands modèles chinois a enchaîné trois gestes contradictoires et pourtant cohérents : DeepSeek a annoncé une hausse d'API pouvant dépasser 1100 %, Alibaba a publié les poids d'un flagship de rang Qwen-Max à 2,4 billions de paramètres jamais ouverts auparavant, et Zhipu a, sur le même socle, relevé plusieurs fois les scores de programmation par seul post-entraînement. Trois sociétés, trois stratégies, un même signal : les grands modèles chinois passent de la « guerre des prix » à la « guerre du pouvoir tarifaire ».
Cet article répond à trois questions : ① ce qui s'est passé ces deux semaines et comment lire les chiffres ; ② ce que parient respectivement la tarification horaire de DeepSeek, la licence personnalisée d'Alibaba et le post-entraînement à socle inchangé de GLM-5.3 ; ③ si DeepSeek reste le flagship le moins cher après la hausse, et comment découper une facture, lire une licence et décaler les charges. Relectures liées : lancement de Qwen3.8-Max, V4 Flash officiel et baisse GPT-5.6.
01 Grands modèles chinois en août : chronologie et points critiques
Sur une seule ligne de temps, le rythme de ces deux semaines devient plus lisible :
| Date | Événement |
|---|---|
| 16 juillet | Moonshot ouvre Kimi K3 (2,8 billions de paramètres), déjà sous surveillance sécuritaire américaine |
| 2–3 août | Alibaba préannonce puis met en ligne l'API cloud de Qwen3.8-Max |
| 10 août | Meta publie le modèle ouvert Muse Glimmer (30 milliards de paramètres, Apache 2.0) et annonce que les poids du flagship Muse Spark 1.2 « seront bientôt ouverts » |
| 12 août | Alibaba publie officiellement les poids ouverts de Qwen3.8-2.4T-A95B sur ModelScope / Hugging Face ; le même jour, xAI publie Grok 4.6 |
| 13 août | DeepSeek-V4-Pro passe en version officielle et annonce une hausse d'API au 17 août ; Google publie Gemini 3.7 Flash à prix réduit |
| 14 août | Zhipu publie GLM-5.3, en réutilisant le socle de 743 milliards de paramètres de GLM-5.2 |
| 17 août, 0 h (heure de Pékin) | La nouvelle grille DeepSeek entre en vigueur |
En reculant encore : le 30 juillet, OpenAI a déjà baissé de 80 % le palier le moins cher, GPT-5.6 Luna ; les 6–7 août, Luna est devenu le modèle par défaut des comptes gratuits, avec un dialogue texte illimité. Autrement dit, au moment où les éditeurs chinois ajoutent de la hausse et de l'ouverture de poids, les éditeurs américains ajoutent du gratuit et de la baisse. Ce n'est pas un hasard, mais les deux faces d'une même bataille tarifaire. Contexte Kimi K3 : ouverture complète de Kimi K3 ; cadre heures de pointe / hors pointe DeepSeek : V4 GA et tarification horaire.
Points critiques pour les lecteurs et les équipes achats :
- Les amplitudes « headline » mélangent les postes. La presse écrit « ×11 », « plus de 1100 % » ou « 350 % » selon qu'il s'agit de l'entrée cache hit, de la sortie ou de l'entrée cache miss. Estimer une facture à partir du titre fausse le calcul.
- L'hypothèse « l'officiel est le moins cher » est rompue. Aux heures de pointe, le tarif officiel DeepSeek dépasse déjà certains revendeurs tiers. Décaler les charges et choisir le canal devient un devoir, plus une option.
- Poids ouverts n'égale pas Apache 2.0. Les poids de Qwen3.8-Max se téléchargent, mais une licence personnalisée bloque les métiers MaaS / assistant de travail IA à fort chiffre d'affaires.
- La rumeur d'interdiction géographique a couru plus vite que le texte. On a un temps prétendu qu'Alibaba interdisait le téléchargement aux utilisateurs des États-Unis, de l'UE, du Royaume-Uni et de la Corée. Le texte n'a aucune restriction territoriale.
Trois sociétés, trois stratégies, un même signal : les grands modèles chinois passent de la « guerre des prix » à la « guerre du pouvoir tarifaire ».
02 Hausse DeepSeek, poids ouverts Qwen, GLM-5.3 : données clés
La nouvelle grille DeepSeek entre en vigueur le 17 août à 0 h. Les heures de pointe sont 9–12 h et 14–18 h, heure de Pékin.
| Poste | Avant | Hors pointe (nouveau) | Pointe (nouveau) | Hausse (pointe) |
|---|---|---|---|---|
| V4-Flash entrée cache hit | ¥0.02 | ¥0.05 | ¥0.10 | environ 400% |
| V4-Flash entrée cache miss | ¥1.0 | ¥1.5 | ¥3.0 | 200% |
| V4-Flash sortie | ¥2.0 | ¥4.5 | ¥9.0 | 350% |
| V4-Pro entrée cache hit | ¥0.025 | ¥0.15 | ¥0.30 | environ 1100% |
| V4-Pro entrée cache miss | ¥3.0 | ¥4.5 | ¥9.0 | 200% |
| V4-Pro sortie | ¥6.0 | ¥13.5 | ¥27.0 | 350% |
Sources : annonce officielle DeepSeek, recoupée avec Wall Street CN, IT Home, V2EX et d'autres. L'amplitude maximale concerne le cache hit (jusqu'à environ 12 fois / 1100 %+), mais le montant absolu reste faible. Pour un usage intensif, ce qui pèse davantage est le prix de sortie (350 %) et l'entrée cache miss. Un calcul de coût indépendant pour une charge lourde réaliste (environ 84 millions de tokens/mois, surtout hors pointe, environ la moitié en cache hit) situe la hausse de facture plutôt autour de 1,8 fois : réelle, mais loin des titres les plus alarmistes.
| Rubrique | Donnée |
|---|---|
| Échelle de paramètres | 2,4 billions au total, 95 milliards actifs (MoE, 512 experts, 10 routés + 1 partagé) |
| Fenêtre de contexte | Poids ouverts : 262 144 tokens natifs, extensible à environ 1,01 million ; version Max cloud : 1 million de tokens par défaut |
| Rythme de publication | Préannonce le 2 août → API le 3 août → poids ouverts le 12 août |
| Tarif API (site international) | Entrée $2 / M tokens, sortie $6 / M tokens |
| Licence | Pas Apache 2.0 : licence personnalisée « Qwen3.8-Max License » |
| Portée | Première ouverture d'un modèle de rang Max (flagship) par Alibaba ; Qwen3.5 / 3.6 / 3.7 Max restaient des API fermées |
| Benchmark | GLM-5.2 | GLM-5.3 | Écart |
|---|---|---|---|
| Terminal-Bench 3.0 | 4.6% | 28.3% | +23.7 |
| DeepSWE v1.1 | 46.2% | 66.9% | +20.7 |
| Agents' Last Exam (CLI) | 23.8% | 28.5% | +4.7 |
| CyberGym | 77.2% | 84.5% | +7.3 |
| AutomationBench | 26.2% | 48.2% | +22.0 |
Il s'agit de mesures internes Zhipu ; aucune contre-mesure tierce indépendante n'a encore été publiée. Sur Terminal-Bench 3.0, GLM-5.3 reste derrière GPT-5.6 Sol (34.6 %) et Claude Fable 5 (33.7 %) : ce n'est pas un sacre généralisé, mais un résultat de premier rang parmi les modèles à poids ouverts.
03 DeepSeek, Alibaba, Zhipu : trois stratégies, trois logiques
1. DeepSeek : du tarif plat au tarif horaire — la rareté de calcul devient visible
La lecture la plus facile de cette hausse est un « alignement sur le marché ». La structure dit autre chose : une facture de calcul rendue explicite. DeepSeek a longtemps tenu un tarif unique, bas, toutes heures confondues : le bas prix achetait le volume, le cache hit et le décalage des charges diluaient le coût. Quand les appels ont crû de façon exponentielle et que la capacité GPU n'a plus suivi, le modèle n'a plus tenu. La phrase de l'annonce qui « encourage une planification plus souple des charges » se traduit ainsi : « notre calcul ne suffit plus, décalez vous-mêmes ».
Un détail à retenir : après la hausse, le tarif officiel DeepSeek aux heures de pointe dépasse déjà certains revendeurs (GMI Cloud, Novita et d'autres cotent encore sous le nouveau tarif de pointe officiel). L'hypothèse « l'officiel est toujours le moins cher », qui soutenait une part du fossé DeepSeek, est rompue pour la première fois.
2. Alibaba : ouvrir les poids pour l'écosystème, fermer la licence pour le revenu
L'ouverture de Qwen3.8-Max n'est pas une simple générosité. Alibaba a fait deux choses à la fois : publier le checkpoint de 2,4 billions de paramètres en téléchargement libre, et lui attacher une licence différente de l'Apache 2.0 habituel. Un métier « model-as-a-service » ou « assistant de travail IA » dont le chiffre d'affaires annuel dépasse 50 millions de dollars doit négocier une autorisation commerciale séparée ; un produit à plus de 100 millions d'utilisateurs actifs mensuels ou plus de 20 millions de dollars de revenus mensuels doit afficher le nom du modèle de façon visible.
La logique de ce couple : échanger l'ouverture contre l'écosystème développeur et la réputation (surtout à l'étranger, pour contrer l'idée qu'un modèle chinois « n'est pas présentable »), tout en gardant un levier de prix sur les grands comptes qui génèrent vraiment du cash. C'est aussi pourquoi ce n'est pas le même degré d'« ouverture » que Muse Glimmer de Meta (Apache 2.0 intégral, sans clause additionnelle).
Une rumeur répandue mérite d'être tranchée : on a prétendu que la licence Alibaba interdisait le téléchargement aux utilisateurs des États-Unis, de l'UE, du Royaume-Uni et de la Corée. C'est faux. Le texte officiel n'a aucune clause territoriale. Ce type de rumeur circule souvent plus vite qu'une lecture du fichier source. Textes de première main : dépôt Hugging Face et LICENSE originale.
3. GLM-5.3 de Zhipu : même socle, autre recette de post-entraînement — la mise à l'échelle du préentraînement n'est plus le seul levier
Le plus intéressant dans GLM-5.3 n'est pas le score, c'est la méthode : le socle est identique à GLM-5.2 (743 milliards de paramètres), sans nouveau préentraînement. En élargissant seulement l'échelle des environnements d'apprentissage par renforcement au post-entraînement, Terminal-Bench 3.0 passe de 4.6 % à 28.3 %, soit près de 6 fois. Cela confirme une tendance devenue plus nette depuis six mois : quand les rendements marginaux du Scaling Law de préentraînement ralentissent, la mise à l'échelle du RL en post-entraînement devient un levier autonome, avec un seuil bien plus bas que le réentraînement d'un socle à centaines de milliards de paramètres. Davantage d'éditeurs de taille moyenne peuvent donc rattraper le peloton de tête par un « second œuvre » soigné. Page technique officielle : Z.ai GLM-5.3.
TZ=Asia/Shanghai date +%H:%M
# peak if 09:00-12:00 or 14:00-18:00 Beijing
# shift batch / eval jobs off these windows
# do not quote 1100% as your real bill delta
curl -s https://api-docs.deepseek.com/quick_start/pricing
DeepSeek a inscrit le déficit de calcul dans la grille. Alibaba échange les poids contre l'écosystème et garde le levier dans la licence. Zhipu montre que la mise à l'échelle du post-entraînement peut tenir seule comme levier.
04 Après la hausse, DeepSeek reste-t-il le flagship le moins cher ?
| Modèle | Prix d'entrée | Prix de sortie | Degré d'ouverture |
|---|---|---|---|
| DeepSeek V4-Pro (pointe) | ¥9.0 (environ $1.26) | ¥27.0 (environ $3.78) | Poids non ouverts |
| DeepSeek V4-Pro (hors pointe) | ¥4.5 (environ $0.63) | ¥13.5 (environ $1.89) | Poids non ouverts |
| Qwen3.8-Max (site international) | $2 | $6 | Ouvert (licence personnalisée) |
| OpenAI GPT-5.6 Luna | $0.20 | $1.20 | Fermé |
| Claude Opus 5 (d'après le multiple publié par Alibaba) | environ $5 | environ $25 | Fermé |
Conversion indicative à environ ¥7.15 / $1 ; s'en tenir aux annonces officielles. On voit que, hors pointe, DeepSeek V4-Pro reste nettement sous Claude Opus 5, mais n'est plus « le moins cher du tableau » : Qwen3.8-Max sur le site international et Luna d'OpenAI sont tous deux moins chers que le hors-pointe DeepSeek. L'égalité « chinois = le moins cher » se défait ; la concurrence tarifaire entre dans une phase stratifiée.
« Chinois = le moins cher » tenait grosso modo de 2025 au début 2026. Au 17 août 2026, ce n'est plus une hypothèse à reprendre sans condition.
05 Points de controverse, guerre sur deux fronts et checklist en six étapes
Points de controverse et détails à traiter avec prudence
- Confusion sur l'amplitude. Les médias citent « ×11 », « plus de 1100 % » ou « 350 % » : tous ont raison, mais sur des postes différents (entrée cache hit vs sortie vs entrée cache miss). Il faut lire de quel poste il s'agit.
- Affirmations sur les puces nationales Zhenwu M890. Plusieurs médias financiers chinois indiquent qu'une partie de l'inférence Qwen3.8-Max tournerait sur les puces maison Zhenwu M890 et le super-nœud « Pangu AL128 ». Ce détail n'apparaît pour l'instant que dans des reprises presse chinoises, sans document technique officiel Alibaba ni benchmark tiers. À traiter comme information non vérifiée de façon indépendante.
- Affirmation que GLM-5.3 aurait trouvé une faille grave dans Cursor. Elle vient d'un article VentureBeat et de propos Zhipu ; le détail technique n'est pas public. Authenticité et périmètre restent à confirmer par un organisme de sécurité tiers : divulgation unilatérale de l'éditeur.
- Éventuelles mesures chinoises de rétorsion à l'export. Certaines dépêches évoquent des contrôles à l'export de rétorsion sur l'IA / les semi-conducteurs. Aucune confirmation officielle à ce jour : spéculation / rumeur de presse, utile seulement comme arrière-plan.
Portée et contexte : ce n'est pas un événement isolé, c'est une guerre sur deux fronts
Remis dans un récit plus large : ce dernier mois, les éditeurs chinois de tête ont tenu un rythme que la presse financière locale appelle « trois mises à jour par semaine » — DeepSeek, Alibaba, Zhipu, plus Kimi K3 de Moonshot (16 juillet, 2,8 billions de paramètres ouverts) et MiniMax H3. La presse économique chinoise y voit surtout une « publication dense de modèles ouverts chinois qui force le secteur mondial à revoir ses tarifs ».
Pendant ce temps, les éditeurs américains prennent l'autre voie : OpenAI a fortement baissé le 30 juillet (Luna −80 %), puis les 6–7 août a fait de Luna baissé le défaut des comptes gratuits, avec un dialogue texte illimité ; Google a publié le 13 août Gemini 3.7 Flash à prix divisé par deux. Autrement dit : la Chine ouvre des flagships et relève par paliers ; les États-Unis défendent le grand public par le gratuit et la baisse. Les deux chemins se jouent en même temps et font d'août 2026 un nœud de reconstruction de la logique tarifaire du secteur.
Autre couche, géopolitique : l'ouverture de Kimi K3 avait déjà attiré l'attention des revues de sécurité américaines. Qu'Alibaba choisisse cette fenêtre pour ouvrir un flagship de 2,4 billions de paramètres a été lu par certains analystes comme une façon de verrouiller l'influence internationale et le récit d'équivalence technique avant un éventuel durcissement réglementaire. C'est en partie une interprétation, mais c'est un arrière-plan qu'on ne peut pas ignorer pour comprendre le timing de cette vague d'ouvertures.
Checklist en six étapes (développeurs et achats) :
- Découper la facture par poste. Recalculer séparément l'entrée cache hit, l'entrée cache miss et la sortie. Ne pas prendre « 1100 % » pour votre multiplicateur réel.
- Caler les fenêtres de pointe de Pékin. Sortir les tâches Agent / d'évaluation batchables de 9–12 h et 14–18 h, pour viser le hors-pointe.
- Lire d'abord le LICENSE original. Le fichier des dépôts Hugging Face / ModelScope fait foi. Ne pas relayer les rumeurs de type « interdiction US / UE / UK / KR ».
- Croiser les seuils de revenus et de MAU. MaaS / assistant de travail IA : plus de 50 millions de dollars sur 12 mois glissants → licence séparée. Plus de 100 millions de MAU ou plus de 20 millions de dollars de revenus mensuels → affichage visible du nom du modèle.
- Comparer avant de verrouiller un fournisseur. Mettre côte à côte DeepSeek hors pointe / pointe, Qwen international $2/$6, GPT-5.6 Luna $0.20/$1.20, et les revendeurs déjà sous le tarif de pointe officiel.
- Choisir un hôte stable pour le hors-pointe. Pour tirer localement 2,4 T de poids, évaluer un long contexte ou planifier un Agent 7×24, préférer un Mac bare-metal dédié à une instance cloud partagée en survente.
# Aug 2026 China open-weight + pricing watchlist
1. split bill: cache-hit / cache-miss / output
2. shift jobs off Beijing 09-12 and 14-18
3. read Qwen3.8-Max LICENSE, not rumor threads
4. check $50M MaaS / 100M MAU / $20M monthly triggers
5. compare Luna $0.20/$1.20 vs Qwen $2/$6 vs DS off-peak
6. avoid shared-cloud for 2.4T / long-context evals
next: isolated Apple Silicon host
Chiffres citables (périmètre 2026-08-17) :
- Hausse de pointe, entrée cache hit V4-Pro : ¥0.025 → ¥0.30, environ 1100 % (le chiffre headline ne concerne que ce palier)
- Hausse de pointe, sortie V4-Pro : ¥6.0 → ¥27.0, 350 % (plus déterminant pour une facture réelle)
- Qwen3.8-2.4T-A95B : 2,4 billions totaux / 95 milliards actifs, 262 144 tokens natifs, licence personnalisée
- GLM-5.3 Terminal-Bench 3.0 : 4.6 % → 28.3 %, même socle de 743 milliards, sans nouveau préentraînement
- Seuils de licence : MaaS / assistant de travail IA, plus de $50 millions sur 12 mois consécutifs → licence séparée ; plus de 100 millions de MAU ou plus de $20 millions de revenus mensuels → affichage visible du nom du modèle
06 FAQ et conclusion production
Q1 : Après cette hausse, DeepSeek va-t-il vraiment coûter plus cher à l'usage ?
Cela dépend du scénario. Si vos appels tombent surtout hors pointe (hors 9–12 h et 14–18 h, heure de Pékin) et que vous êtes un utilisateur intensif avec un bon taux de cache hit, la hausse réelle sera nettement inférieure aux 350 % ou 1100 % des titres (des analyses situent la facture d'un usage intensif autour de 1,8 fois) ; si vous appelez surtout aux heures de pointe avec un faible taux de cache hit, la hausse peut approcher voire atteindre les chiffres des titres.
Q2 : Un développeur individuel peut-il utiliser commercialement et gratuitement les poids ouverts de Qwen3.8-Max ?
Les développeurs individuels et l'usage interne ne sont pratiquement pas concernés. En revanche, si votre activité est un « model-as-a-service » ou un « assistant de travail IA », et que ce métier a généré plus de 50 millions de dollars sur les 12 derniers mois, vous devez demander une licence commerciale séparée à Alibaba ; si le produit dépasse 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, le nom du modèle doit être affiché de façon visible.
Q3 : GLM-5.3 et GLM-5.2 sont-ils le même modèle ? Pourquoi une telle hausse de performance ?
Le socle de base est bien identique (743 milliards de paramètres) ; Zhipu n'a pas réentraîné. La hausse des scores vient d'un post-entraînement qui a fortement élargi l'échelle des environnements d'apprentissage par renforcement. Cela montre qu'à ce stade, la « mise à l'échelle du post-entraînement » est elle-même un levier de performance autonome et efficace, sans nécessairement préentraîner un socle plus grand.
Q4 : La licence Qwen3.8-Max d'Alibaba interdit-elle vraiment le téléchargement aux utilisateurs des États-Unis et de l'UE ?
Non. C'est une information inexacte circulant en ligne. Le texte officiel de la licence ne contient aucune clause territoriale ; les restrictions portent sur les services commercialisés au-delà de certains seuils de revenus, indépendamment de la région de l'utilisateur.
Q5 : L'ouverture de Muse Glimmer par Meta signifie-t-elle le retour de l'esprit open source de l'ère Llama ?
Pour l'instant, ce n'est qu'un « retour partiel ». Muse Glimmer n'est qu'un petit modèle distillé de 30 milliards de paramètres. Le véritable flagship fermé de Meta, Muse Spark 1.2, n'est pas encore ouvert ; Zuckerberg n'a fait qu'« annoncer » que ses poids le seraient. Si cette étape se concrétise, ce serait la première fois qu'un éditeur américain ouvre un modèle fermé de rang flagship ; il faut encore suivre la suite.
Sources : annonce officielle de hausse DeepSeek, recoupée avec Wall Street CN, IT Home, AIGC.cn et les discussions V2EX ; dépôts officiels Qwen d'Alibaba (Hugging Face / ModelScope) et reportage du South China Morning Post (SCMP) sur les clauses de licence ; page technique officielle GLM-5.3 de Zhipu (Z.ai) et couvertures VentureBeat et StableLearn ; blog officiel Meta AI Research et couverture VentureBeat de Muse Glimmer ; Yicai / 第一财经, Sohu Finance et autres sur le rythme dense des publications chinoises. Données publiques au moment de la rédaction. Prix, clauses de licence et scores de benchmark sont à revérifier sur les dernières annonces officielles avant republication. Certains détails (service sur puces, découverte de faille, rumeurs de contrôle à l'export) sont signalés dans le corps comme non vérifiés de façon indépendante.
Sur un hôte cloud partagé, une évaluation à long contexte ou un tirage local de 2,4 T de poids se heurte souvent au jitter de bande passante et à la survente. Pour un Agent hors pointe, des nœuds bricolés coupent facilement les connexions longues et offrent rarement une isolation dédiée. Confier l'inférence à forte mémoire et une planification 7×24 à une instance partagée instable fait trembler à la fois la facture et le taux de succès. Pour un environnement de production plus stable, adapté aux évaluations de poids ouverts et à l'automatisation d'Agent hors pointe, le Mac bare-metal multi-région JEXCLOUD est en général le meilleur choix : Apple Silicon dédié, root, 7×24, flexibilité mensuelle, livraison en environ 120 secondes. Nœuds et tarifs : page tarifs JEXCLOUD.