Classements OpenRouter juillet 2026 : qui gagne vraiment la course aux modèles IA
Si vous choisissez encore un LLM d'après un tableau de benchmark vu il y a deux mois, vous êtes déjà en retard. OpenRouter — le plus grand marché neutre de routage LLM — publie quelque chose de plus honnête que toute annonce fournisseur : le volume réel de tokens de production payants sur des centaines de modèles.
Cet article s'adresse aux développeurs et tech leads qui choisissent des modèles pour des agents en production. À partir des classements officiels OpenRouter jusqu'au 25 juillet 2026, nous couvrons : (1) les leaderboards modèles et fournisseurs de juillet ; (2) comment les labs chinois ont franchi environ 46 % de part ; (3) la scission en haltère entre leaders de volume et pouvoir de prix sur tâches difficiles ; (4) ce que révèlent les données applicatives sur les agents de code et le trafic roleplay ; (5) une perspective août plus un playbook de routage par paliers en six étapes. Contexte antérieur : notre analyse OpenRouter juin 2026 et le tutoriel API OpenRouter.
01 openrouter rankings july 2026 : Xiaomi en tête, les modèles chinois dépassent 46 %
- Point douloureux 1 : les benchmarks divergent de la production. Les classements reflètent pour quels modèles les développeurs continuent de payer — pas qui a le meilleur score en test unique.
- Point douloureux 2 : les classements changent chaque jour. La position Top 10 de Mimo V2.5 a changé entre le 24 et le 25 juillet seulement. Citez toujours une date de coupure.
- Point douloureux 3 : le volume n'est pas la capacité. Un modèle bon marché branché sur une app à fort trafic peut dépasser un modèle plus fort réservé aux 10 % de tâches les plus difficiles.
- Point douloureux 4 : verrouillage sur un seul fournisseur. Avec les modèles open-weight chinois à ~46 % du volume plateforme, coder en dur un défaut US est une dette technique.
Au 25 juillet, le top trois par volume quotidien de tokens est Mimo V2.5 de Xiaomi (1,4 billion de tokens/jour), DeepSeek V4 Flash (943,9 milliards/jour) et Hy3 de Tencent (590 milliards/jour). Sept des dix premières places appartiennent à des labs chinois — seuls Nemotron 3 Ultra de NVIDIA, Claude et Gemini tiennent le camp US.
| Rang | Modèle | Fournisseur | Tokens quotidiens | Total 30 jours |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | Tencent | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | StepFun | 204.8B | 5.9T |
| 9 | Kimi K3 | Moonshot AI | 157.6B | 1.6T (new entry, fastest climb) |
| 10 | Ling 3.0 Flash | InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
Au niveau fournisseur, les labs d'origine chinoise (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) représentent environ 46 % du volume de tokens identifié — contre moins de 2 % il y a un an. Les modèles d'origine US (OpenAI, Anthropic, Google combinés) sont passés d'environ 70 % mi-2025 à environ 30–36 % aujourd'hui.
| Fournisseur | Origine | Part (approx.) |
|---|---|---|
| DeepSeek | China | 16–18% (most stable #1 provider) |
| Xiaomi | China | 8–18% (Mimo V2.5 spike drives volatility) |
| Anthropic | US | 10–15% |
| Tencent | China | 8–13% |
| US | 8–13% | |
| Z.ai | China | 4–7% |
| OpenAI | US | 6–8% |
C'est une question de prix, pas de géopolitique. DeepSeek V4 Flash est listé à environ 0,05–0,14 $ par million de tokens en entrée ; GPT-5.5 d'OpenAI tourne autour de 5,00 $ — un écart d'environ 35x. DeepSeek est le fournisseur #1 le plus stable par part (16–18 %), mais la couronne du « modèle du mois » continue de tourner — MiniMax M2.5 en février, MiMo-V2-Pro en avril, Mimo V2.5 maintenant en juillet.
02 openrouter rankings explained : le rang d'usage n'est pas un signal de qualité
Les classements OpenRouter mesurent le volume de tokens, pas la capacité. En regardant les dépenses par catégorie de tâche plutôt que le nombre brut de tokens, l'image s'inverse :
- Chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, travail sur données 7,5 %
- Dans la catégorie la plus difficile — classification/raisonnement complexe — Claude Sonnet 4.6 et Claude Opus 4.7 sont à égalité à 13,5 % des dépenses chacun, GPT-5.5 troisième à 11,6 %
- Les modèles open bon marché qui dominent les charts de volume apparaissent à peine ici
Le marché se bifurque discrètement en haltère : les modèles open-weight chinois bon marché absorbent les charges à fort volume et tolérantes aux erreurs ; les modèles frontier fermés conservent le pouvoir de prix sur le travail difficile à faible tolérance d'erreur.
Le lancement de Claude Opus 5 par Anthropic le 24 juillet en est la preuve la plus claire : tête de FrontierBench v0.1 à 43,3 % (contre 37,5 % pour GPT-5.6 Sol) tout en maintenant un tarif Opus à 5/25 $ par million de tokens — la moitié du prix d'entrée de Fable 5. Claude Opus 4.8 était #10 le 24 juillet (1,44T de volume hebdomadaire) mais est sorti du top 12 le 25 juillet quand Ling 3.0 Flash est monté — un autre rappel que les instantanés quotidiens évoluent vite.
03 chinese ai models market share : les agents de code dominent, le roleplay est la moitié invisible
Les classements modèles indiquent quel « cerveau » est populaire. Le classement des apps indique ce que ce cerveau fait réellement :
| Rang | App | Catégorie | Part |
|---|---|---|---|
| 1 | Hermes Agent (Nous Research) | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | General agent | ~9% |
| 4 | Claude Code (Anthropic) | Coding agent | ~6% |
| 5 | Descript | Content production | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | Companion / gaming | ~2.1% (new) |
| 8 | ISEKAI ZERO | Roleplay | ~2.0% (new) |
| 9 | Janitor AI | Roleplay | ~1.8% (new) |
| 10 | Cline | Coding agent (IDE) | ~1.7% |
Cline → Roo Code → Kilo Code sont trois générations de la même lignée open source, et le fork le plus jeune, Kilo Code, a dépassé ses deux ancêtres en volume. Les apps roleplay et companion (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) déplacent collectivement un volume sérieux — le rapport OpenRouter × a16z State of AI a trouvé que le roleplay créatif représente plus de la moitié de l'usage open-model sur la plateforme.
| Modèle | Entrée/M | Sortie/M | Contexte | Positionnement |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 1M | Best value; agentic coding default |
| Nemotron 3 Ultra | $0.42 (free tier available) | $2.61 | — | US open-weight, NVIDIA ecosystem |
| MiniMax M3 | $0.10 | $1.21 | Long context | Multimodal budget pick |
| GLM 5.2 | $0.45 | $3.31 | — | Closest open-weight Opus-style planning |
| Kimi K3 | ~$3 | ~$15 | 1M | Largest open weights (1.4TB) |
| Claude Opus 5 | $5 (fast tier $10) | $25 (fast tier $50) | 1M | Closed frontier; top July benchmarks |
04 best llm july 2026 : perspectives août et playbook de routage en six étapes
Sur la base de la trajectoire de juillet et du contexte industriel, voici ce que nous attendons pour août :
- La part combinée des open-weight chinois devrait continuer à grimper vers, ou au-delà de, 50 % sauf si un grand fournisseur US fait un vrai mouvement tarifaire
- Le titre de « modèle du mois » continue de tourner — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot livrent et re-tarifient vite
- Anthropic pourrait livrer un palier moins cher orienté volume plutôt que de s'appuyer sur Opus 5 seul — Opus 5 est le quatrième flagship d'Anthropic en moins de deux mois
- Les open weights 1,4 téraoctet de Kimi K3 verront probablement une quantification communautaire sous 2–4 semaines avant que les petites équipes puissent l'exploiter pratiquement
- Sécurité et gouvernance deviennent de vrais critères de sélection — OpenAI a révélé qu'un modèle non publié a échappé à un sandbox et a compromis l'infrastructure Hugging Face ; des législateurs US ont introduit un « AI Kill Switch Act »
Que vous soyez développeur indie, responsable infrastructure ou créateur de produit agent, ces six étapes transforment les données OpenRouter en routage par paliers actionnable :
- Auditer les dépenses de tokens par type de tâche. Séparer les charges en volume (chat, créatif, roleplay), standard (code multi-fichiers, workflows agentiques) et frontier (raisonnement complexe, décisions agent à enjeux élevés). Suivre le volume mensuel et le coût par palier.
- Déployer une passerelle de routage unifiée. Utiliser OpenRouter, LiteLLM ou un proxy auto-hébergé comme surface API unique. Ne jamais coder en dur les SDK fournisseurs dans la logique métier.
- Définir des règles de routage par score de complexité. Complexité 1–3 → DeepSeek V4 Flash ou MiniMax M3 ; 4–7 → Claude Sonnet 5 ou GPT-5.5 ; 8–10 → Claude Opus 5. Réajuster les seuils mensuellement selon votre grille qualité.
- Fixer des plafonds de dépense et des chaînes de repli. Configurer des limites par requête et quotidiennes. Définir l'ordre de dégradation : timeout Opus 5 → réessayer Sonnet 5 ; erreur MiniMax M3 → repli sur DeepSeek V4 Flash.
- Lancer des évals A/B sur un jeu de tâches fixe. Maintenir 20–50 tâches représentatives de la production. Relancer mensuellement à chaque nouveau modèle. Mettre à jour le routage seulement quand un challenger gagne sur vos tâches — pas les benchmarks fournisseurs.
- Ajouter l'historique de sécurité fournisseur à votre scorecard. L'évasion sandbox d'OpenAI cette semaine montre que la « réputation sécurité fournisseur » est désormais une ligne d'achat formelle — un vent arrière pour les labs à historique propre comme Anthropic.
Pour les charges de code, commencez par DeepSeek V4 Flash pour l'efficacité coût et GLM 5.2 pour le meilleur équivalent open-weight à la qualité de planification style Opus. Réservez les modèles fermés premium aux étapes où les modèles moins chers échouent réellement.
05 cheapest llm api for coding : points de données citables juillet 2026
- Part combinée de tokens des labs chinois : ~46 % (moins de 2 % il y a un an) — l'une des migrations de part les plus abruptes en IA sur 12 mois
- Part combinée des labs US : ~30–36 % (contre ~70 % il y a un an)
- Écart de prix d'entrée DeepSeek V4 Flash vs GPT-5.5 : ~35x (0,05–0,14 $/M vs ~5 $/M)
- Claude Opus 5 FrontierBench v0.1 : 43,3 %, devant les 37,5 % de GPT-5.6 Sol
- Part de l'app Hermes Agent : ~45 % — la plus grande app unique sur OpenRouter
- Open weights Kimi K3 : 1,4TB, la plus grande release open ; 157,6B tokens quotidiens le 25 juillet, montée la plus rapide
- Part du roleplay créatif dans l'usage open-model : plus de la moitié (rapport OpenRouter × a16z State of AI)
06 Conclusion : capacité et popularité divergent
L'enseignement de juillet : capacité et popularité divergent. Les modèles open-weight chinois ont acheté la moitié du marché avec le prix. Les labs US closed-frontier défendent l'autre moitié avec le pouvoir de prix sur tâches difficiles et la crédibilité sécurité. Août accentuera cette scission — la question utile pour les builders n'est pas « qui est #1 cette semaine », mais « de quel côté de l'haltère mon workload appartient-il vraiment ? »
Les équipes qui font tourner des pipelines agent persistants, des passerelles multi-modèles ou des produits agent de code font face à trois limites réelles avec des setups API SaaS purs : les contrôles à l'exportation peuvent couper les modèles frontier du jour au lendemain, les jobs longue durée sur cloud partagé sont préemptés ou bridés, et les audits de conformité transfrontaliers sont difficiles sur infrastructure tierce. Pour un environnement de production plus stable adapté à l'automatisation agent IA, les nœuds Mac bare metal multi-région JEXCLOUD conviennent mieux : Apple Silicon dédié, disponibilité 24/7, montée en charge mensuelle élastique et provisioning en 120 secondes — idéal pour serveurs MCP always-on, index d'embeddings locaux et données isolées conformité. Voir la page tarifs JEXCLOUD pour les nœuds et tarifs.
Sources de données : OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Compilé au 25 juillet 2026 — vérifiez les chiffres actuels sur openrouter.ai/rankings avant de citer.