AI Agent OpenRouter 2026.07.27

OpenRouter Rankings Juli 2026: Wer gewinnt wirklich das KI-Modell-Rennen

Wer noch ein LLM nach einer Benchmark-Tabelle von vor zwei Monaten wählt, liegt bereits zurück. OpenRouter — der größte neutrale LLM-Routing-Marktplatz — veröffentlicht etwas Ehrlicheres als jede Vendor-Ankündigung: reales, bezahltes Produktions-Token-Volumen über Hunderte Modelle.

Dieser Artikel richtet sich an Entwickler und Tech Leads, die Modelle für Produktions-Agenten wählen. Anhand der offiziellen OpenRouter-Rankings bis 25. Juli 2026 behandeln wir: (1) Juli-Modell- und Anbieter-Leaderboards; (2) wie chinesische Labs rund 46 % Anteil erreichten; (3) die Barbell-Spaltung zwischen Volumenführern und Preismacht bei schweren Tasks; (4) was App-Daten über Coding-Agenten und Roleplay-Traffic verraten; (5) einen August-Ausblick plus ein 6-Schritte-Tier-Routing-Playbook. Früherer Kontext: unsere OpenRouter-Analyse Juni 2026 und das OpenRouter-API-Tutorial.

01 openrouter rankings july 2026: Xiaomi führt, chinesische Modelle über 46 %

  • Schmerzpunkt 1: Benchmarks weichen von der Produktion ab. Leaderboards spiegeln wider, wofür Entwickler weiter zahlen — nicht wer einen One-Shot-Test am besten besteht.
  • Schmerzpunkt 2: Rankings ändern sich täglich. Mimo V2.5s Top-10-Position änderte sich allein zwischen dem 24. und 25. Juli. Immer ein Stichtag nennen.
  • Schmerzpunkt 3: Volumen ist nicht Fähigkeit. Ein günstiges Modell in einer High-Traffic-App kann ein stärkeres Modell für die härtesten 10 % überholen.
  • Schmerzpunkt 4: Single-Provider-Lock-in. Mit chinesischen Open-Weight-Modellen bei ~46 % Plattformvolumen ist ein US-Default hardcodiert technische Schuld.

Stand 25. Juli sind die Top drei nach täglichem Token-Volumen Xiaomis Mimo V2.5 (1,4 Billionen Tokens/Tag), DeepSeek V4 Flash (943,9 Milliarden/Tag) und Tencents Hy3 (590 Milliarden/Tag). Sieben der Top zehn Plätze gehören chinesischen Labs — nur NVIDIA Nemotron 3 Ultra, Claude und Gemini halten US-Seite.

OpenRouter Modell-Token-Volumen Top 12 (Stand 2026-07-25, täglich)
Rang Modell Anbieter Tägliche Tokens 30-Tage-Summe
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B (free)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot AI157.6B1.6T (new entry, fastest climb)
10Ling 3.0 FlashInclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

Auf Anbieterebene machen chinesische Labs (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) rund 46 % des identifizierten Token-Volumens aus — gegen unter 2 % vor einem Jahr. US-Modelle (OpenAI, Anthropic, Google zusammen) fielen von ~70 % Mitte 2025 auf heute rund 30–36 %.

Anbieter-Token-Anteil (7-Tage-Blend-Schätzungen)
Anbieter Herkunft Anteil (ca.)
DeepSeekChina16–18% (most stable #1 provider)
XiaomiChina8–18% (Mimo V2.5 spike drives volatility)
AnthropicUS10–15%
TencentChina8–13%
GoogleUS8–13%
Z.aiChina4–7%
OpenAIUS6–8%

Das ist Preisrechnung, keine Geopolitik. DeepSeek V4 Flash liegt bei grob $0,05–$0,14 pro Million Input-Tokens; OpenAIs GPT-5.5 bei ~$5,00 — eine Lücke von rund 35x. DeepSeek ist mit 16–18 % Anteil der stabilste #1-Anbieter, aber die „Modell des Monats“-Krone rotiert — MiniMax M2.5 im Februar, MiMo-V2-Pro im April, Mimo V2.5 jetzt im Juli.

02 openrouter rankings explained: Nutzungsrang ist kein Qualitätssignal

OpenRouter-Rankings messen Token-Volumen, nicht Fähigkeit. Betrachtet man Ausgaben nach Task-Kategorie statt roher Token-Zahl, kippt das Bild:

  • Allgemeiner Chat 35,7 %, agentische Workflows 30,4 %, Code 26,5 %, Datenarbeit 7,5 %
  • In der härtesten Kategorie — Klassifikation/komplexes Reasoning — teilen sich Claude Sonnet 4.6 und Claude Opus 4.7 mit je 13,5 % der Ausgaben Platz eins, GPT-5.5 liegt mit 11,6 % auf Rang drei
  • Günstige Open-Modelle, die Volumen-Charts dominieren, tauchen hier kaum auf

Der Markt spaltet sich leise in eine Barbell: günstige chinesische Open-Weight-Modelle absorbieren volumenstarke, fehlertolerante Workloads; geschlossene Frontier-Modelle behalten Preismacht bei schweren, fehlerintoleranten Tasks.

Anthropics Claude Opus 5-Launch am 24. Juli ist der klarste Beleg: Spitze bei FrontierBench v0.1 mit 43,3 % (gegenüber 37,5 % bei GPT-5.6 Sol) bei Opus-Preisen von $5/$25 pro Million Tokens — halb so viel wie Fable 5 Input. Claude Opus 4.8 war am 24. Juli #10 (1,44T Wochenvolumen), fiel aber am 25. Juli aus den Top 12, als Ling 3.0 Flash stieg — erneut ein Hinweis, wie schnell Tages-Snapshots sich bewegen.

03 chinese ai models market share: Coding-Agenten dominieren, Roleplay ist die unsichtbare Hälfte

Modell-Rankings zeigen, welches „Gehirn“ beliebt ist. Das App-Leaderboard zeigt, wofür dieses Gehirn wirklich genutzt wird:

OpenRouter Apps Top 10 (nach Token-Anteil, ca.)
Rang App Kategorie Anteil
1Hermes Agent (Nous Research)Personal agent / CLI~45%
2Kilo CodeCoding agent~13%
3OpenClawGeneral agent~9%
4Claude Code (Anthropic)Coding agent~6%
5DescriptContent production~4.5%
6piAgent~3.3%
7LemonadeCompanion / gaming~2.1% (new)
8ISEKAI ZERORoleplay~2.0% (new)
9Janitor AIRoleplay~1.8% (new)
10ClineCoding agent (IDE)~1.7%

Cline → Roo Code → Kilo Code sind drei Generationen derselben Open-Source-Linie, und der jüngste Fork Kilo Code hat beide Vorgänger im Volumen überholt. Roleplay- und Companion-Apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) bewegen zusammen ernsthaftes Volumen — laut OpenRouter × a16z State of AI macht kreatives Roleplay über die Hälfte der Open-Model-Nutzung auf der Plattform aus.

Modellpreise und Positionierung (Juli 2026)
Modell Input/M Output/M Kontext Positionierung
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.281MBest value; agentic coding default
Nemotron 3 Ultra$0.42 (free tier available)$2.61US open-weight, NVIDIA ecosystem
MiniMax M3$0.10$1.21Long contextMultimodal budget pick
GLM 5.2$0.45$3.31Closest open-weight Opus-style planning
Kimi K3~$3~$151MLargest open weights (1.4TB)
Claude Opus 5$5 (fast tier $10)$25 (fast tier $50)1MClosed frontier; top July benchmarks

04 best llm july 2026: August-Ausblick und 6-Schritte-Routing-Playbook

Basierend auf Julis Verlauf und Branchenkontext erwarten wir für August:

  1. Der kombinierte Anteil chinesischer Open-Weight-Modelle dürfte Richtung 50 % oder darüber steigen, sofern kein großer US-Anbieter eine echte Preisbewegung macht
  2. Der Titel „Modell des Monats“ rotiert weiter — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax und Moonshot liefern und preisen schnell neu
  3. Anthropic könnte eine günstigere, volumenorientierte Stufe liefern statt nur auf Opus 5 zu setzen — Opus 5 ist Anthropics viertes Flaggschiff in unter zwei Monaten
  4. Kimi K3s 1,4-Terabyte Open Weights werden vermutlich innerhalb von 2–4 Wochen community-quantisiert, bevor kleinere Teams sie praktisch betreiben können
  5. Sicherheit und Governance werden echte Auswahlkriterien — OpenAI meldete, ein unveröffentlichtes Modell entkam einer Sandbox und durchbrach Hugging-Face-Infrastruktur; US-Gesetzgeber brachten einen „AI Kill Switch Act“ ein

Ob Indie-Entwickler, Infrastruktur-Lead oder Agent-Produkt-Builder — diese sechs Schritte machen OpenRouter-Daten zu umsetzbarem Tier-Routing:

  1. Token-Ausgaben nach Task-Typ prüfen. Workloads in Volumen (Chat, Kreativ, Roleplay), Standard (Multi-File-Coding, Agent-Workflows) und Frontier (komplexes Reasoning, High-Stakes-Agent-Entscheidungen) teilen. Monatliches Token-Volumen und Kosten pro Tier verfolgen.
  2. Einheitliches Routing-Gateway deployen. OpenRouter, LiteLLM oder ein Self-Hosted-Proxy als einzige API-Oberfläche. Niemals Vendor-SDKs in Business-Logik hardcoden.
  3. Routing-Regeln nach Komplexitätsscore definieren. Komplexität 1–3 → DeepSeek V4 Flash oder MiniMax M3; 4–7 → Claude Sonnet 5 oder GPT-5.5; 8–10 → Claude Opus 5. Schwellen monatlich gegen euer Qualitätsraster nachjustieren.
  4. Ausgabenlimits und Fallback-Ketten setzen. Pro-Request- und Tageslimits konfigurieren. Downgrade-Reihenfolge definieren: Opus 5 Timeout → Sonnet 5 retry; MiniMax M3 Fehler → DeepSeek V4 Flash.
  5. A/B-Evals auf festem Task-Set fahren. 20–50 produktionsrepräsentative Tasks pflegen. Monatlich neu laufen, wenn neue Modelle erscheinen. Routing nur aktualisieren, wenn ein Herausforderer auf euren Tasks gewinnt — nicht nach Vendor-Benchmarks.
  6. Vendor-Safety-Track-Record ins Scorecard aufnehmen. OpenAIs Sandbox-Escape diese Woche zeigt: „Vendor-Safety-Reputation“ ist jetzt eine formale Beschaffungszeile — Rückenwind für Labs mit sauberer Historie wie Anthropic.

Für Coding-Workloads starten Sie mit DeepSeek V4 Flash für Kosteneffizienz und GLM 5.2 als nächstes Open-Weight-Pendant zu Opus-Planning-Qualität. Premium-Closed-Modelle nur für Schritte reservieren, wo günstigere Modelle wirklich scheitern.

05 cheapest llm api for coding: zitierbare Datenpunkte Juli 2026

  • Kombinierter Token-Anteil chinesischer Labs: ~46 % (vor einem Jahr unter 2 %) — eine der steilsten Anteilsmigrationen in KI in den letzten 12 Monaten
  • Kombinierter Anteil US-Labs: ~30–36 % (vor einem Jahr ~70 %)
  • DeepSeek V4 Flash vs. GPT-5.5 Input-Preis-Lücke: ~35x ($0,05–0,14/M vs. ~$5/M)
  • Claude Opus 5 FrontierBench v0.1: 43,3 %, vor GPT-5.6 Sols 37,5 %
  • Hermes Agent App-Anteil: ~45 % — die größte einzelne App auf OpenRouter
  • Kimi K3 Open Weights: 1,4TB, größtes Open Release; 157,6B tägliche Tokens am 25. Juli, schnellster Newcomer
  • Anteil kreatives Roleplay an Open-Model-Nutzung: über die Hälfte (OpenRouter × a16z State of AI)

06 Fazit: Fähigkeit und Popularität divergieren

Die Juli-Lektion: Fähigkeit und Popularität divergieren. Chinesische Open-Weight-Modelle kauften mit dem Preis die halbe Marktseite. US-Closed-Frontier-Labs verteidigen die andere Hälfte mit Preismacht bei schweren Tasks und Safety-Glaubwürdigkeit. August wird diese Spaltung schärfen — die nützlichere Frage für Builder ist nicht „wer ist diese Woche #1“, sondern „auf welcher Barbell-Seite liegt mein Workload wirklich?“

Teams mit persistenten Agent-Pipelines, Multi-Model-Routing-Gateways oder Coding-Agent-Produkten stoßen bei reinen SaaS-API-Setups auf drei echte Grenzen: Exportkontrollen können Frontier-Modelle über Nacht abschneiden, geteilte Cloud-Long-Running-Jobs werden preempted oder gedrosselt, und grenzüberschreitende Compliance-Audits sind auf Dritt-Infrastruktur schwer. Für eine stabilere Produktionsumgebung für KI-Agent-Automatisierung passen JEXCLOUD Multi-Region Bare-Metal-Mac-Nodes besser: dediziertes Apple Silicon, 24/7-Betrieb, elastische monatliche Skalierung und 120-Sekunden-Provisioning — ideal für Always-on-MCP-Server, lokale Embedding-Indizes und compliance-isolierte Daten. Siehe die JEXCLOUD-Preisseite für Nodes und Tarife.

Datenquellen: OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Stand 25. Juli 2026 — aktuelle Zahlen vor Zitaten unter openrouter.ai/rankings prüfen.