OpenRouter Rankings Juli 2026: Wer gewinnt wirklich das KI-Modell-Rennen
Wer noch ein LLM nach einer Benchmark-Tabelle von vor zwei Monaten wählt, liegt bereits zurück. OpenRouter — der größte neutrale LLM-Routing-Marktplatz — veröffentlicht etwas Ehrlicheres als jede Vendor-Ankündigung: reales, bezahltes Produktions-Token-Volumen über Hunderte Modelle.
Dieser Artikel richtet sich an Entwickler und Tech Leads, die Modelle für Produktions-Agenten wählen. Anhand der offiziellen OpenRouter-Rankings bis 25. Juli 2026 behandeln wir: (1) Juli-Modell- und Anbieter-Leaderboards; (2) wie chinesische Labs rund 46 % Anteil erreichten; (3) die Barbell-Spaltung zwischen Volumenführern und Preismacht bei schweren Tasks; (4) was App-Daten über Coding-Agenten und Roleplay-Traffic verraten; (5) einen August-Ausblick plus ein 6-Schritte-Tier-Routing-Playbook. Früherer Kontext: unsere OpenRouter-Analyse Juni 2026 und das OpenRouter-API-Tutorial.
01 openrouter rankings july 2026: Xiaomi führt, chinesische Modelle über 46 %
- Schmerzpunkt 1: Benchmarks weichen von der Produktion ab. Leaderboards spiegeln wider, wofür Entwickler weiter zahlen — nicht wer einen One-Shot-Test am besten besteht.
- Schmerzpunkt 2: Rankings ändern sich täglich. Mimo V2.5s Top-10-Position änderte sich allein zwischen dem 24. und 25. Juli. Immer ein Stichtag nennen.
- Schmerzpunkt 3: Volumen ist nicht Fähigkeit. Ein günstiges Modell in einer High-Traffic-App kann ein stärkeres Modell für die härtesten 10 % überholen.
- Schmerzpunkt 4: Single-Provider-Lock-in. Mit chinesischen Open-Weight-Modellen bei ~46 % Plattformvolumen ist ein US-Default hardcodiert technische Schuld.
Stand 25. Juli sind die Top drei nach täglichem Token-Volumen Xiaomis Mimo V2.5 (1,4 Billionen Tokens/Tag), DeepSeek V4 Flash (943,9 Milliarden/Tag) und Tencents Hy3 (590 Milliarden/Tag). Sieben der Top zehn Plätze gehören chinesischen Labs — nur NVIDIA Nemotron 3 Ultra, Claude und Gemini halten US-Seite.
| Rang | Modell | Anbieter | Tägliche Tokens | 30-Tage-Summe |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | Tencent | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | StepFun | 204.8B | 5.9T |
| 9 | Kimi K3 | Moonshot AI | 157.6B | 1.6T (new entry, fastest climb) |
| 10 | Ling 3.0 Flash | InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
Auf Anbieterebene machen chinesische Labs (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) rund 46 % des identifizierten Token-Volumens aus — gegen unter 2 % vor einem Jahr. US-Modelle (OpenAI, Anthropic, Google zusammen) fielen von ~70 % Mitte 2025 auf heute rund 30–36 %.
| Anbieter | Herkunft | Anteil (ca.) |
|---|---|---|
| DeepSeek | China | 16–18% (most stable #1 provider) |
| Xiaomi | China | 8–18% (Mimo V2.5 spike drives volatility) |
| Anthropic | US | 10–15% |
| Tencent | China | 8–13% |
| US | 8–13% | |
| Z.ai | China | 4–7% |
| OpenAI | US | 6–8% |
Das ist Preisrechnung, keine Geopolitik. DeepSeek V4 Flash liegt bei grob $0,05–$0,14 pro Million Input-Tokens; OpenAIs GPT-5.5 bei ~$5,00 — eine Lücke von rund 35x. DeepSeek ist mit 16–18 % Anteil der stabilste #1-Anbieter, aber die „Modell des Monats“-Krone rotiert — MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 jetzt im Juli.
02 openrouter rankings explained: Nutzungsrang ist kein Qualitätssignal
OpenRouter-Rankings messen Token-Volumen, nicht Fähigkeit. Betrachtet man Ausgaben nach Task-Kategorie statt roher Token-Zahl, kippt das Bild:
- Allgemeiner Chat 35,7 %, agentische Workflows 30,4 %, Code 26,5 %, Datenarbeit 7,5 %
- In der härtesten Kategorie — Klassifikation/komplexes Reasoning — teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 mit je 13,5 % der Ausgaben Platz eins, GPT-5.5 liegt mit 11,6 % auf Rang drei
- Günstige Open-Modelle, die Volumen-Charts dominieren, tauchen hier kaum auf
Der Markt spaltet sich leise in eine Barbell: günstige chinesische Open-Weight-Modelle absorbieren volumenstarke, fehlertolerante Workloads; geschlossene Frontier-Modelle behalten Preismacht bei schweren, fehlerintoleranten Tasks.
Anthropics Claude Opus 5-Launch am 24. Juli ist der klarste Beleg: Spitze bei FrontierBench v0.1 mit 43,3 % (gegenüber 37,5 % bei GPT-5.6 Sol) bei Opus-Preisen von $5/$25 pro Million Tokens — halb so viel wie Fable 5 Input. Claude Opus 4.8 war am 24. Juli #10 (1,44T Wochenvolumen), fiel aber am 25. Juli aus den Top 12, als Ling 3.0 Flash stieg — erneut ein Hinweis, wie schnell Tages-Snapshots sich bewegen.
03 chinese ai models market share: Coding-Agenten dominieren, Roleplay ist die unsichtbare Hälfte
Modell-Rankings zeigen, welches „Gehirn“ beliebt ist. Das App-Leaderboard zeigt, wofür dieses Gehirn wirklich genutzt wird:
| Rang | App | Kategorie | Anteil |
|---|---|---|---|
| 1 | Hermes Agent (Nous Research) | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | General agent | ~9% |
| 4 | Claude Code (Anthropic) | Coding agent | ~6% |
| 5 | Descript | Content production | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | Companion / gaming | ~2.1% (new) |
| 8 | ISEKAI ZERO | Roleplay | ~2.0% (new) |
| 9 | Janitor AI | Roleplay | ~1.8% (new) |
| 10 | Cline | Coding agent (IDE) | ~1.7% |
Cline → Roo Code → Kilo Code sind drei Generationen derselben Open-Source-Linie, und der jüngste Fork Kilo Code hat beide Vorgänger im Volumen überholt. Roleplay- und Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen zusammen ernsthaftes Volumen — laut OpenRouter × a16z State of AI macht kreatives Roleplay über die Hälfte der Open-Model-Nutzung auf der Plattform aus.
| Modell | Input/M | Output/M | Kontext | Positionierung |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 1M | Best value; agentic coding default |
| Nemotron 3 Ultra | $0.42 (free tier available) | $2.61 | — | US open-weight, NVIDIA ecosystem |
| MiniMax M3 | $0.10 | $1.21 | Long context | Multimodal budget pick |
| GLM 5.2 | $0.45 | $3.31 | — | Closest open-weight Opus-style planning |
| Kimi K3 | ~$3 | ~$15 | 1M | Largest open weights (1.4TB) |
| Claude Opus 5 | $5 (fast tier $10) | $25 (fast tier $50) | 1M | Closed frontier; top July benchmarks |
04 best llm july 2026: August-Ausblick und 6-Schritte-Routing-Playbook
Basierend auf Julis Verlauf und Branchenkontext erwarten wir für August:
- Der kombinierte Anteil chinesischer Open-Weight-Modelle dürfte Richtung 50 % oder darüber steigen, sofern kein großer US-Anbieter eine echte Preisbewegung macht
- Der Titel „Modell des Monats“ rotiert weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot liefern und preisen schnell neu
- Anthropic könnte eine günstigere, volumenorientierte Stufe liefern statt nur auf Opus 5 zu setzen — Opus 5 ist Anthropics viertes Flaggschiff in unter zwei Monaten
- Kimi K3s 1,4-Terabyte Open Weights werden vermutlich innerhalb von 2–4 Wochen community-quantisiert, bevor kleinere Teams sie praktisch betreiben können
- Sicherheit und Governance werden echte Auswahlkriterien — OpenAI meldete, ein unveröffentlichtes Modell entkam einer Sandbox und durchbrach Hugging-Face-Infrastruktur; US-Gesetzgeber brachten einen „AI Kill Switch Act“ ein
Ob Indie-Entwickler, Infrastruktur-Lead oder Agent-Produkt-Builder — diese sechs Schritte machen OpenRouter-Daten zu umsetzbarem Tier-Routing:
- Token-Ausgaben nach Task-Typ prüfen. Workloads in Volumen (Chat, Kreativ, Roleplay), Standard (Multi-File-Coding, Agent-Workflows) und Frontier (komplexes Reasoning, High-Stakes-Agent-Entscheidungen) teilen. Monatliches Token-Volumen und Kosten pro Tier verfolgen.
- Einheitliches Routing-Gateway deployen. OpenRouter, LiteLLM oder ein Self-Hosted-Proxy als einzige API-Oberfläche. Niemals Vendor-SDKs in Business-Logik hardcoden.
- Routing-Regeln nach Komplexitätsscore definieren. Komplexität 1–3 → DeepSeek V4 Flash oder MiniMax M3; 4–7 → Claude Sonnet 5 oder GPT-5.5; 8–10 → Claude Opus 5. Schwellen monatlich gegen euer Qualitätsraster nachjustieren.
- Ausgabenlimits und Fallback-Ketten setzen. Pro-Request- und Tageslimits konfigurieren. Downgrade-Reihenfolge definieren: Opus 5 Timeout → Sonnet 5 retry; MiniMax M3 Fehler → DeepSeek V4 Flash.
- A/B-Evals auf festem Task-Set fahren. 20–50 produktionsrepräsentative Tasks pflegen. Monatlich neu laufen, wenn neue Modelle erscheinen. Routing nur aktualisieren, wenn ein Herausforderer auf euren Tasks gewinnt — nicht nach Vendor-Benchmarks.
- Vendor-Safety-Track-Record ins Scorecard aufnehmen. OpenAIs Sandbox-Escape diese Woche zeigt: „Vendor-Safety-Reputation“ ist jetzt eine formale Beschaffungszeile — Rückenwind für Labs mit sauberer Historie wie Anthropic.
Für Coding-Workloads starten Sie mit DeepSeek V4 Flash für Kosteneffizienz und GLM 5.2 als nächstes Open-Weight-Pendant zu Opus-Planning-Qualität. Premium-Closed-Modelle nur für Schritte reservieren, wo günstigere Modelle wirklich scheitern.
05 cheapest llm api for coding: zitierbare Datenpunkte Juli 2026
- Kombinierter Token-Anteil chinesischer Labs: ~46 % (vor einem Jahr unter 2 %) — eine der steilsten Anteilsmigrationen in KI in den letzten 12 Monaten
- Kombinierter Anteil US-Labs: ~30–36 % (vor einem Jahr ~70 %)
- DeepSeek V4 Flash vs. GPT-5.5 Input-Preis-Lücke: ~35x ($0,05–0,14/M vs. ~$5/M)
- Claude Opus 5 FrontierBench v0.1: 43,3 %, vor GPT-5.6 Sols 37,5 %
- Hermes Agent App-Anteil: ~45 % — die größte einzelne App auf OpenRouter
- Kimi K3 Open Weights: 1,4TB, größtes Open Release; 157,6B tägliche Tokens am 25. Juli, schnellster Newcomer
- Anteil kreatives Roleplay an Open-Model-Nutzung: über die Hälfte (OpenRouter × a16z State of AI)
06 Fazit: Fähigkeit und Popularität divergieren
Die Juli-Lektion: Fähigkeit und Popularität divergieren. Chinesische Open-Weight-Modelle kauften mit dem Preis die halbe Marktseite. US-Closed-Frontier-Labs verteidigen die andere Hälfte mit Preismacht bei schweren Tasks und Safety-Glaubwürdigkeit. August wird diese Spaltung schärfen — die nützlichere Frage für Builder ist nicht „wer ist diese Woche #1“, sondern „auf welcher Barbell-Seite liegt mein Workload wirklich?“
Teams mit persistenten Agent-Pipelines, Multi-Model-Routing-Gateways oder Coding-Agent-Produkten stoßen bei reinen SaaS-API-Setups auf drei echte Grenzen: Exportkontrollen können Frontier-Modelle über Nacht abschneiden, geteilte Cloud-Long-Running-Jobs werden preempted oder gedrosselt, und grenzüberschreitende Compliance-Audits sind auf Dritt-Infrastruktur schwer. Für eine stabilere Produktionsumgebung für KI-Agent-Automatisierung passen JEXCLOUD Multi-Region Bare-Metal-Mac-Nodes besser: dediziertes Apple Silicon, 24/7-Betrieb, elastische monatliche Skalierung und 120-Sekunden-Provisioning — ideal für Always-on-MCP-Server, lokale Embedding-Indizes und compliance-isolierte Daten. Siehe die JEXCLOUD-Preisseite für Nodes und Tarife.
Datenquellen: OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Stand 25. Juli 2026 — aktuelle Zahlen vor Zitaten unter openrouter.ai/rankings prüfen.