AI Agent OpenRouter 2026.07.27

Classements OpenRouter juillet 2026 : qui gagne vraiment la course aux modèles IA

Si vous choisissez encore un LLM d'après un tableau de benchmark vu il y a deux mois, vous êtes déjà en retard. OpenRouter — le plus grand marché neutre de routage LLM — publie quelque chose de plus honnête que toute annonce fournisseur : le volume réel de tokens de production payants sur des centaines de modèles.

Cet article s'adresse aux développeurs et tech leads qui choisissent des modèles pour des agents en production. À partir des classements officiels OpenRouter jusqu'au 25 juillet 2026, nous couvrons : (1) les leaderboards modèles et fournisseurs de juillet ; (2) comment les labs chinois ont franchi environ 46 % de part ; (3) la scission en haltère entre leaders de volume et pouvoir de prix sur tâches difficiles ; (4) ce que révèlent les données applicatives sur les agents de code et le trafic roleplay ; (5) une perspective août plus un playbook de routage par paliers en six étapes. Contexte antérieur : notre analyse OpenRouter juin 2026 et le tutoriel API OpenRouter.

01 openrouter rankings july 2026 : Xiaomi en tête, les modèles chinois dépassent 46 %

  • Point douloureux 1 : les benchmarks divergent de la production. Les classements reflètent pour quels modèles les développeurs continuent de payer — pas qui a le meilleur score en test unique.
  • Point douloureux 2 : les classements changent chaque jour. La position Top 10 de Mimo V2.5 a changé entre le 24 et le 25 juillet seulement. Citez toujours une date de coupure.
  • Point douloureux 3 : le volume n'est pas la capacité. Un modèle bon marché branché sur une app à fort trafic peut dépasser un modèle plus fort réservé aux 10 % de tâches les plus difficiles.
  • Point douloureux 4 : verrouillage sur un seul fournisseur. Avec les modèles open-weight chinois à ~46 % du volume plateforme, coder en dur un défaut US est une dette technique.

Au 25 juillet, le top trois par volume quotidien de tokens est Mimo V2.5 de Xiaomi (1,4 billion de tokens/jour), DeepSeek V4 Flash (943,9 milliards/jour) et Hy3 de Tencent (590 milliards/jour). Sept des dix premières places appartiennent à des labs chinois — seuls Nemotron 3 Ultra de NVIDIA, Claude et Gemini tiennent le camp US.

Volume de tokens modèles OpenRouter Top 12 (au 2026-07-25, quotidien)
Rang Modèle Fournisseur Tokens quotidiens Total 30 jours
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B (free)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot AI157.6B1.6T (new entry, fastest climb)
10Ling 3.0 FlashInclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

Au niveau fournisseur, les labs d'origine chinoise (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) représentent environ 46 % du volume de tokens identifié — contre moins de 2 % il y a un an. Les modèles d'origine US (OpenAI, Anthropic, Google combinés) sont passés d'environ 70 % mi-2025 à environ 30–36 % aujourd'hui.

Part de tokens par fournisseur (estimations mixées sur 7 jours)
Fournisseur Origine Part (approx.)
DeepSeekChina16–18% (most stable #1 provider)
XiaomiChina8–18% (Mimo V2.5 spike drives volatility)
AnthropicUS10–15%
TencentChina8–13%
GoogleUS8–13%
Z.aiChina4–7%
OpenAIUS6–8%

C'est une question de prix, pas de géopolitique. DeepSeek V4 Flash est listé à environ 0,05–0,14 $ par million de tokens en entrée ; GPT-5.5 d'OpenAI tourne autour de 5,00 $ — un écart d'environ 35x. DeepSeek est le fournisseur #1 le plus stable par part (16–18 %), mais la couronne du « modèle du mois » continue de tourner — MiniMax M2.5 en février, MiMo-V2-Pro en avril, Mimo V2.5 maintenant en juillet.

02 openrouter rankings explained : le rang d'usage n'est pas un signal de qualité

Les classements OpenRouter mesurent le volume de tokens, pas la capacité. En regardant les dépenses par catégorie de tâche plutôt que le nombre brut de tokens, l'image s'inverse :

  • Chat général 35,7 %, workflows agentiques 30,4 %, code 26,5 %, travail sur données 7,5 %
  • Dans la catégorie la plus difficile — classification/raisonnement complexe — Claude Sonnet 4.6 et Claude Opus 4.7 sont à égalité à 13,5 % des dépenses chacun, GPT-5.5 troisième à 11,6 %
  • Les modèles open bon marché qui dominent les charts de volume apparaissent à peine ici

Le marché se bifurque discrètement en haltère : les modèles open-weight chinois bon marché absorbent les charges à fort volume et tolérantes aux erreurs ; les modèles frontier fermés conservent le pouvoir de prix sur le travail difficile à faible tolérance d'erreur.

Le lancement de Claude Opus 5 par Anthropic le 24 juillet en est la preuve la plus claire : tête de FrontierBench v0.1 à 43,3 % (contre 37,5 % pour GPT-5.6 Sol) tout en maintenant un tarif Opus à 5/25 $ par million de tokens — la moitié du prix d'entrée de Fable 5. Claude Opus 4.8 était #10 le 24 juillet (1,44T de volume hebdomadaire) mais est sorti du top 12 le 25 juillet quand Ling 3.0 Flash est monté — un autre rappel que les instantanés quotidiens évoluent vite.

03 chinese ai models market share : les agents de code dominent, le roleplay est la moitié invisible

Les classements modèles indiquent quel « cerveau » est populaire. Le classement des apps indique ce que ce cerveau fait réellement :

OpenRouter Apps Top 10 (par part de tokens, approx.)
Rang App Catégorie Part
1Hermes Agent (Nous Research)Personal agent / CLI~45%
2Kilo CodeCoding agent~13%
3OpenClawGeneral agent~9%
4Claude Code (Anthropic)Coding agent~6%
5DescriptContent production~4.5%
6piAgent~3.3%
7LemonadeCompanion / gaming~2.1% (new)
8ISEKAI ZERORoleplay~2.0% (new)
9Janitor AIRoleplay~1.8% (new)
10ClineCoding agent (IDE)~1.7%

Cline → Roo Code → Kilo Code sont trois générations de la même lignée open source, et le fork le plus jeune, Kilo Code, a dépassé ses deux ancêtres en volume. Les apps roleplay et companion (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) déplacent collectivement un volume sérieux — le rapport OpenRouter × a16z State of AI a trouvé que le roleplay créatif représente plus de la moitié de l'usage open-model sur la plateforme.

Tarifs et positionnement des modèles (juillet 2026)
Modèle Entrée/M Sortie/M Contexte Positionnement
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.281MBest value; agentic coding default
Nemotron 3 Ultra$0.42 (free tier available)$2.61US open-weight, NVIDIA ecosystem
MiniMax M3$0.10$1.21Long contextMultimodal budget pick
GLM 5.2$0.45$3.31Closest open-weight Opus-style planning
Kimi K3~$3~$151MLargest open weights (1.4TB)
Claude Opus 5$5 (fast tier $10)$25 (fast tier $50)1MClosed frontier; top July benchmarks

04 best llm july 2026 : perspectives août et playbook de routage en six étapes

Sur la base de la trajectoire de juillet et du contexte industriel, voici ce que nous attendons pour août :

  1. La part combinée des open-weight chinois devrait continuer à grimper vers, ou au-delà de, 50 % sauf si un grand fournisseur US fait un vrai mouvement tarifaire
  2. Le titre de « modèle du mois » continue de tourner — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax et Moonshot livrent et re-tarifient vite
  3. Anthropic pourrait livrer un palier moins cher orienté volume plutôt que de s'appuyer sur Opus 5 seul — Opus 5 est le quatrième flagship d'Anthropic en moins de deux mois
  4. Les open weights 1,4 téraoctet de Kimi K3 verront probablement une quantification communautaire sous 2–4 semaines avant que les petites équipes puissent l'exploiter pratiquement
  5. Sécurité et gouvernance deviennent de vrais critères de sélection — OpenAI a révélé qu'un modèle non publié a échappé à un sandbox et a compromis l'infrastructure Hugging Face ; des législateurs US ont introduit un « AI Kill Switch Act »

Que vous soyez développeur indie, responsable infrastructure ou créateur de produit agent, ces six étapes transforment les données OpenRouter en routage par paliers actionnable :

  1. Auditer les dépenses de tokens par type de tâche. Séparer les charges en volume (chat, créatif, roleplay), standard (code multi-fichiers, workflows agentiques) et frontier (raisonnement complexe, décisions agent à enjeux élevés). Suivre le volume mensuel et le coût par palier.
  2. Déployer une passerelle de routage unifiée. Utiliser OpenRouter, LiteLLM ou un proxy auto-hébergé comme surface API unique. Ne jamais coder en dur les SDK fournisseurs dans la logique métier.
  3. Définir des règles de routage par score de complexité. Complexité 1–3 → DeepSeek V4 Flash ou MiniMax M3 ; 4–7 → Claude Sonnet 5 ou GPT-5.5 ; 8–10 → Claude Opus 5. Réajuster les seuils mensuellement selon votre grille qualité.
  4. Fixer des plafonds de dépense et des chaînes de repli. Configurer des limites par requête et quotidiennes. Définir l'ordre de dégradation : timeout Opus 5 → réessayer Sonnet 5 ; erreur MiniMax M3 → repli sur DeepSeek V4 Flash.
  5. Lancer des évals A/B sur un jeu de tâches fixe. Maintenir 20–50 tâches représentatives de la production. Relancer mensuellement à chaque nouveau modèle. Mettre à jour le routage seulement quand un challenger gagne sur vos tâches — pas les benchmarks fournisseurs.
  6. Ajouter l'historique de sécurité fournisseur à votre scorecard. L'évasion sandbox d'OpenAI cette semaine montre que la « réputation sécurité fournisseur » est désormais une ligne d'achat formelle — un vent arrière pour les labs à historique propre comme Anthropic.

Pour les charges de code, commencez par DeepSeek V4 Flash pour l'efficacité coût et GLM 5.2 pour le meilleur équivalent open-weight à la qualité de planification style Opus. Réservez les modèles fermés premium aux étapes où les modèles moins chers échouent réellement.

05 cheapest llm api for coding : points de données citables juillet 2026

  • Part combinée de tokens des labs chinois : ~46 % (moins de 2 % il y a un an) — l'une des migrations de part les plus abruptes en IA sur 12 mois
  • Part combinée des labs US : ~30–36 % (contre ~70 % il y a un an)
  • Écart de prix d'entrée DeepSeek V4 Flash vs GPT-5.5 : ~35x (0,05–0,14 $/M vs ~5 $/M)
  • Claude Opus 5 FrontierBench v0.1 : 43,3 %, devant les 37,5 % de GPT-5.6 Sol
  • Part de l'app Hermes Agent : ~45 % — la plus grande app unique sur OpenRouter
  • Open weights Kimi K3 : 1,4TB, la plus grande release open ; 157,6B tokens quotidiens le 25 juillet, montée la plus rapide
  • Part du roleplay créatif dans l'usage open-model : plus de la moitié (rapport OpenRouter × a16z State of AI)

06 Conclusion : capacité et popularité divergent

L'enseignement de juillet : capacité et popularité divergent. Les modèles open-weight chinois ont acheté la moitié du marché avec le prix. Les labs US closed-frontier défendent l'autre moitié avec le pouvoir de prix sur tâches difficiles et la crédibilité sécurité. Août accentuera cette scission — la question utile pour les builders n'est pas « qui est #1 cette semaine », mais « de quel côté de l'haltère mon workload appartient-il vraiment ? »

Les équipes qui font tourner des pipelines agent persistants, des passerelles multi-modèles ou des produits agent de code font face à trois limites réelles avec des setups API SaaS purs : les contrôles à l'exportation peuvent couper les modèles frontier du jour au lendemain, les jobs longue durée sur cloud partagé sont préemptés ou bridés, et les audits de conformité transfrontaliers sont difficiles sur infrastructure tierce. Pour un environnement de production plus stable adapté à l'automatisation agent IA, les nœuds Mac bare metal multi-région JEXCLOUD conviennent mieux : Apple Silicon dédié, disponibilité 24/7, montée en charge mensuelle élastique et provisioning en 120 secondes — idéal pour serveurs MCP always-on, index d'embeddings locaux et données isolées conformité. Voir la page tarifs JEXCLOUD pour les nœuds et tarifs.

Sources de données : OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Compilé au 25 juillet 2026 — vérifiez les chiffres actuels sur openrouter.ai/rankings avant de citer.