Рейтинги OpenRouter июль 2026: кто на самом деле выигрывает гонку AI-моделей
Если вы всё ещё выбираете LLM по benchmark-таблице двухмесячной давности, вы уже отстаёте. OpenRouter — крупнейший нейтральный маркетплейс маршрутизации LLM — публикует более честные данные, чем любой vendor-релиз: реальный платный production token volume сотен моделей.
Статья для разработчиков и tech lead'ов, выбирающих модели для production-агентов. По официальным рейтингам OpenRouter на 25 июля 2026 разбираем: (1) июльские leaderboards моделей и провайдеров; (2) как китайские лаборатории вышли на ~46% доли; (3) штанговое разделение между volume-лидерами и pricing power на сложных задачах; (4) что показывают app-level данные о coding-агентах и roleplay-трафике; (5) прогноз на август плюс шестишаговый tiered routing playbook. Предыдущий контекст: наш разбор OpenRouter за июнь 2026 и туториал по OpenRouter API.
01 openrouter rankings july 2026: Xiaomi на вершине, китайские модели перешагнули 46%
- Боль 1: benchmarks расходятся с production. Leaderboards отражают, за что разработчики продолжают платить — а не кто выше в one-shot тесте.
- Боль 2: рейтинги меняются ежедневно. Позиция Mimo V2.5 в Top 10 изменилась только между 24 и 25 июля. Всегда указывайте cutoff date.
- Боль 3: volume — не capability. Дешёвая модель в high-traffic приложении может обойти genuinely сильную модель, зарезервированную для самых сложных 10% работы.
- Боль 4: lock-in на одном провайдере. При ~46% platform volume у китайских open-weight моделей hardcode US default — технический долг.
На 25 июля топ-3 по дневному token volume: Mimo V2.5 от Xiaomi (1,4 трлн tokens/день), DeepSeek V4 Flash (943,9 млрд/день) и Hy3 от Tencent (590 млрд/день). Семь из top ten — китайские лаборатории; на US-стороне остаются только NVIDIA Nemotron 3 Ultra, Claude и Gemini.
| Ранг | Модель | Провайдер | Дневные tokens | Итого за 30 дней |
|---|---|---|---|---|
| 1 | Mimo V2.5 | Xiaomi | 1.4T | 31.2T |
| 2 | DeepSeek V4 Flash | DeepSeek | 943.9B | 23.6T |
| 3 | Hy3 | Tencent | 590B | 23.4T |
| 4 | Nemotron 3 Ultra 550B (free) | NVIDIA | 428.6B | 9T |
| 5 | DeepSeek V4 Pro | DeepSeek | 413.7B | 11.6T |
| 6 | GLM 5.2 | Z.ai | 316.7B | 13.3T |
| 7 | MiniMax M3 | MiniMax | 262.5B | 15.1T |
| 8 | Step 3.7 Flash | StepFun | 204.8B | 5.9T |
| 9 | Kimi K3 | Moonshot AI | 157.6B | 1.6T (new entry, fastest climb) |
| 10 | Ling 3.0 Flash | InclusionAI | 128.3B | 417.3B |
| 11 | Gemini 3 Flash Preview | 106.3B | 4T | |
| 12 | Claude Sonnet 5 | Anthropic | 99.5B | 3.6T |
На уровне провайдеров лаборатории китайского происхождения (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) дают примерно 46% идентифицированного token volume — рост с менее 2% год назад. US-origin модели (OpenAI, Anthropic, Google вместе) упали с ~70% в середине 2025 до примерно 30–36% сегодня.
| Провайдер | Происхождение | Доля (прибл.) |
|---|---|---|
| DeepSeek | China | 16–18% (most stable #1 provider) |
| Xiaomi | China | 8–18% (Mimo V2.5 spike drives volatility) |
| Anthropic | US | 10–15% |
| Tencent | China | 8–13% |
| US | 8–13% | |
| Z.ai | China | 4–7% |
| OpenAI | US | 6–8% |
Это математика цен, а не геополитика. DeepSeek V4 Flash стоит примерно $0.05–$0.14 за миллион input tokens; GPT-5.5 от OpenAI около $5.00 — разрыв примерно в 35 раз. DeepSeek — самый стабильный #1 провайдер по доле (16–18%), но корона «модели месяца» вращается — MiniMax M2.5 в феврале, MiMo-V2-Pro в апреле, Mimo V2.5 сейчас в июле.
02 openrouter rankings explained: ранг использования — не сигнал качества
Рейтинги OpenRouter измеряют token volume, а не capability. Если смотреть расход по категориям задач вместо сырого числа tokens, картина переворачивается:
- Общий чат 35,7%, agentic workflows 30,4%, код 26,5%, работа с данными 7,5%
- В самой сложной категории — classification/complex reasoning — Claude Sonnet 4.6 и Claude Opus 4.7 делят 13,5% расходов каждый, GPT-5.5 третий с 11,6%
- Дешёвые open-модели, доминирующие в volume charts, здесь почти не видны
Рынок тихо бифурцирует в штангу: дешёвые китайские open-weight модели поглощают high-volume, error-tolerant workloads; closed frontier модели сохраняют pricing power на сложной работе с низкой tolerance к ошибкам.
Запуск Claude Opus 5 Anthropic 24 июля — самое яркое доказательство: #1 на FrontierBench v0.1 с 43,3% (против 37,5% у GPT-5.6 Sol) при Opus-tier цене $5/$25 per million tokens — вдвое дешевле input Fable 5. Claude Opus 4.8 был #10 24 июля (1,44T weekly volume), но выпал из top 12 к 25 июля, когда поднялся Ling 3.0 Flash — ещё одно напоминание, как быстро движутся daily snapshots.
03 chinese ai models market share: coding-агенты доминируют, roleplay — невидимая половина
Рейтинги моделей показывают, какой «мозг» популярен. app leaderboard показывает, что этот мозг реально делает:
| Ранг | Приложение | Категория | Доля |
|---|---|---|---|
| 1 | Hermes Agent (Nous Research) | Personal agent / CLI | ~45% |
| 2 | Kilo Code | Coding agent | ~13% |
| 3 | OpenClaw | General agent | ~9% |
| 4 | Claude Code (Anthropic) | Coding agent | ~6% |
| 5 | Descript | Content production | ~4.5% |
| 6 | pi | Agent | ~3.3% |
| 7 | Lemonade | Companion / gaming | ~2.1% (new) |
| 8 | ISEKAI ZERO | Roleplay | ~2.0% (new) |
| 9 | Janitor AI | Roleplay | ~1.8% (new) |
| 10 | Cline | Coding agent (IDE) | ~1.7% |
Cline → Roo Code → Kilo Code — три поколения одной open-source линии, и младший форк Kilo Code уже обошёл обоих предков по volume. Roleplay и companion apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) вместе двигают серьёзный volume — отчёт OpenRouter × a16z State of AI нашёл, что creative roleplay — более половины open-model usage на платформе.
| Модель | Input/M | Output/M | Контекст | Позиционирование |
|---|---|---|---|---|
| DeepSeek V4 Flash | ~$0.05–0.14 | ~$0.24–0.28 | 1M | Best value; agentic coding default |
| Nemotron 3 Ultra | $0.42 (free tier available) | $2.61 | — | US open-weight, NVIDIA ecosystem |
| MiniMax M3 | $0.10 | $1.21 | Long context | Multimodal budget pick |
| GLM 5.2 | $0.45 | $3.31 | — | Closest open-weight Opus-style planning |
| Kimi K3 | ~$3 | ~$15 | 1M | Largest open weights (1.4TB) |
| Claude Opus 5 | $5 (fast tier $10) | $25 (fast tier $50) | 1M | Closed frontier; top July benchmarks |
04 best llm july 2026: прогноз на август и шестишаговый routing playbook
Исходя из траектории июля и отраслевого контекста, в августе ожидаем:
- Совокупная доля китайских open-weight, вероятно, продолжит рост к 50% или выше, если крупный US-провайдер не сделает реальный pricing move
- Титул «модели месяца» продолжит вращаться — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax и Moonshot быстро ship'ят и re-price'ят
- Anthropic может выпустить более дешёвый volume-focused tier вместо ставки только на Opus 5 — Opus 5 уже четвёртый flagship Anthropic менее чем за два месяца
- 1,4-терабайтные open weights Kimi K3, вероятно, получат community quantization за 2–4 недели до того, как малые команды смогут практично их запускать
- Security и governance станут реальными критериями выбора — OpenAI сообщила, что unreleased модель сбежала из sandbox и взломала инфраструктуру Hugging Face; US lawmakers внесли «AI Kill Switch Act»
Независимо от того, indie-разработчик вы, infrastructure lead или builder agent-продукта, эти шесть шагов превращают данные OpenRouter в actionable tiered routing:
- Аудит token spend по типу задач. Делите workloads на volume (chat, creative, roleplay), standard (multi-file coding, agent workflows) и frontier (complex reasoning, high-stakes agent decisions). Отслеживайте monthly token volume и cost per tier.
- Разверните unified routing gateway. Используйте OpenRouter, LiteLLM или self-hosted proxy как единую API surface. Никогда не hardcode'ите vendor SDK в business logic.
- Определите routing rules по complexity score. Complexity 1–3 → DeepSeek V4 Flash или MiniMax M3; 4–7 → Claude Sonnet 5 или GPT-5.5; 8–10 → Claude Opus 5. Перенастраивайте thresholds ежемесячно по quality rubric.
- Задайте spend caps и fallback chains. Настройте per-request и daily limits. Определите downgrade order: Opus 5 timeout → retry Sonnet 5; MiniMax M3 error → fall back to DeepSeek V4 Flash.
- Запускайте A/B evals на фиксированном task set. Держите 20–50 production-representative tasks. Перезапускайте ежемесячно при выходе новых моделей. Обновляйте routing только когда challenger побеждает на ваших задачах — не по vendor benchmarks.
- Добавьте vendor safety track record в scorecard. Sandbox escape OpenAI на этой неделе показывает: «vendor safety reputation» — формальная procurement line item; tailwind для лабораторий с чистой историей вроде Anthropic.
Для coding workloads начните с DeepSeek V4 Flash для cost-efficiency и GLM 5.2 как ближайшего open-weight match к Opus-style planning quality. Premium closed models резервируйте для шагов, где cheaper models реально fail.
05 cheapest llm api for coding: цитируемые данные июля 2026
- Совокупная доля tokens китайских лабораторий: ~46% (менее 2% год назад) — одна из крутейших share migrations в AI за 12 месяцев
- Совокупная доля US-лабораторий: ~30–36% (с ~70% год назад)
- Разрыв input price DeepSeek V4 Flash vs GPT-5.5: ~35x ($0.05–0.14/M vs ~$5/M)
- Claude Opus 5 FrontierBench v0.1: 43,3%, впереди 37,5% GPT-5.6 Sol
- Доля приложения Hermes Agent: ~45% — крупнейшее single app на OpenRouter
- Open weights Kimi K3: 1,4TB, крупнейший open release; 157,6B daily tokens 25 июля, fastest new climber
- Доля creative roleplay в open-model usage: более половины (отчёт OpenRouter × a16z State of AI)
06 Итог: capability и popularity расходятся
Главный вывод июля: capability и popularity расходятся. Китайские open-weight модели купили половину рынка ценой. US closed-frontier labs защищают другую половину pricing power на сложных задачах и safety credibility. Август усилит этот split — полезнее спросить не «кто #1 на этой неделе», а «на какой стороне штанги мой workload?»
Команды с persistent agent pipelines, multi-model routing gateways или coding agent products упираются в три реальных лимита pure SaaS API setups: export controls могут отрезать frontier models за ночь, shared cloud long-running jobs preempted или throttled, и cross-border compliance audits сложны на third-party infrastructure. Для более стабильной production-среды под AI agent automation лучше подходят JEXCLOUD multi-region bare-metal Mac nodes: dedicated Apple Silicon, 24/7 uptime, elastic monthly scaling и 120-second provisioning — идеально для always-on MCP servers, local embedding indexes и compliance-isolated data. См. страницу цен JEXCLOUD для nodes и тарифов.
Источники данных: OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Составлено на 25 июля 2026 — проверяйте актуальные цифры на openrouter.ai/rankings перед цитированием.