AI Agent OpenRouter 2026.07.27

Рейтинги OpenRouter июль 2026: кто на самом деле выигрывает гонку AI-моделей

Если вы всё ещё выбираете LLM по benchmark-таблице двухмесячной давности, вы уже отстаёте. OpenRouter — крупнейший нейтральный маркетплейс маршрутизации LLM — публикует более честные данные, чем любой vendor-релиз: реальный платный production token volume сотен моделей.

Статья для разработчиков и tech lead'ов, выбирающих модели для production-агентов. По официальным рейтингам OpenRouter на 25 июля 2026 разбираем: (1) июльские leaderboards моделей и провайдеров; (2) как китайские лаборатории вышли на ~46% доли; (3) штанговое разделение между volume-лидерами и pricing power на сложных задачах; (4) что показывают app-level данные о coding-агентах и roleplay-трафике; (5) прогноз на август плюс шестишаговый tiered routing playbook. Предыдущий контекст: наш разбор OpenRouter за июнь 2026 и туториал по OpenRouter API.

01 openrouter rankings july 2026: Xiaomi на вершине, китайские модели перешагнули 46%

  • Боль 1: benchmarks расходятся с production. Leaderboards отражают, за что разработчики продолжают платить — а не кто выше в one-shot тесте.
  • Боль 2: рейтинги меняются ежедневно. Позиция Mimo V2.5 в Top 10 изменилась только между 24 и 25 июля. Всегда указывайте cutoff date.
  • Боль 3: volume — не capability. Дешёвая модель в high-traffic приложении может обойти genuinely сильную модель, зарезервированную для самых сложных 10% работы.
  • Боль 4: lock-in на одном провайдере. При ~46% platform volume у китайских open-weight моделей hardcode US default — технический долг.

На 25 июля топ-3 по дневному token volume: Mimo V2.5 от Xiaomi (1,4 трлн tokens/день), DeepSeek V4 Flash (943,9 млрд/день) и Hy3 от Tencent (590 млрд/день). Семь из top ten — китайские лаборатории; на US-стороне остаются только NVIDIA Nemotron 3 Ultra, Claude и Gemini.

OpenRouter model token volume Top 12 (на 2026-07-25, daily)
Ранг Модель Провайдер Дневные tokens Итого за 30 дней
1Mimo V2.5Xiaomi1.4T31.2T
2DeepSeek V4 FlashDeepSeek943.9B23.6T
3Hy3Tencent590B23.4T
4Nemotron 3 Ultra 550B (free)NVIDIA428.6B9T
5DeepSeek V4 ProDeepSeek413.7B11.6T
6GLM 5.2Z.ai316.7B13.3T
7MiniMax M3MiniMax262.5B15.1T
8Step 3.7 FlashStepFun204.8B5.9T
9Kimi K3Moonshot AI157.6B1.6T (new entry, fastest climb)
10Ling 3.0 FlashInclusionAI128.3B417.3B
11Gemini 3 Flash PreviewGoogle106.3B4T
12Claude Sonnet 5Anthropic99.5B3.6T

На уровне провайдеров лаборатории китайского происхождения (DeepSeek, Xiaomi, Tencent, Z.ai, MiniMax, Moonshot AI, Alibaba) дают примерно 46% идентифицированного token volume — рост с менее 2% год назад. US-origin модели (OpenAI, Anthropic, Google вместе) упали с ~70% в середине 2025 до примерно 30–36% сегодня.

Доля tokens по провайдерам (7-дневные blended оценки)
Провайдер Происхождение Доля (прибл.)
DeepSeekChina16–18% (most stable #1 provider)
XiaomiChina8–18% (Mimo V2.5 spike drives volatility)
AnthropicUS10–15%
TencentChina8–13%
GoogleUS8–13%
Z.aiChina4–7%
OpenAIUS6–8%

Это математика цен, а не геополитика. DeepSeek V4 Flash стоит примерно $0.05–$0.14 за миллион input tokens; GPT-5.5 от OpenAI около $5.00 — разрыв примерно в 35 раз. DeepSeek — самый стабильный #1 провайдер по доле (16–18%), но корона «модели месяца» вращается — MiniMax M2.5 в феврале, MiMo-V2-Pro в апреле, Mimo V2.5 сейчас в июле.

02 openrouter rankings explained: ранг использования — не сигнал качества

Рейтинги OpenRouter измеряют token volume, а не capability. Если смотреть расход по категориям задач вместо сырого числа tokens, картина переворачивается:

  • Общий чат 35,7%, agentic workflows 30,4%, код 26,5%, работа с данными 7,5%
  • В самой сложной категории — classification/complex reasoning — Claude Sonnet 4.6 и Claude Opus 4.7 делят 13,5% расходов каждый, GPT-5.5 третий с 11,6%
  • Дешёвые open-модели, доминирующие в volume charts, здесь почти не видны

Рынок тихо бифурцирует в штангу: дешёвые китайские open-weight модели поглощают high-volume, error-tolerant workloads; closed frontier модели сохраняют pricing power на сложной работе с низкой tolerance к ошибкам.

Запуск Claude Opus 5 Anthropic 24 июля — самое яркое доказательство: #1 на FrontierBench v0.1 с 43,3% (против 37,5% у GPT-5.6 Sol) при Opus-tier цене $5/$25 per million tokens — вдвое дешевле input Fable 5. Claude Opus 4.8 был #10 24 июля (1,44T weekly volume), но выпал из top 12 к 25 июля, когда поднялся Ling 3.0 Flash — ещё одно напоминание, как быстро движутся daily snapshots.

03 chinese ai models market share: coding-агенты доминируют, roleplay — невидимая половина

Рейтинги моделей показывают, какой «мозг» популярен. app leaderboard показывает, что этот мозг реально делает:

OpenRouter Apps Top 10 (по доле tokens, прибл.)
Ранг Приложение Категория Доля
1Hermes Agent (Nous Research)Personal agent / CLI~45%
2Kilo CodeCoding agent~13%
3OpenClawGeneral agent~9%
4Claude Code (Anthropic)Coding agent~6%
5DescriptContent production~4.5%
6piAgent~3.3%
7LemonadeCompanion / gaming~2.1% (new)
8ISEKAI ZERORoleplay~2.0% (new)
9Janitor AIRoleplay~1.8% (new)
10ClineCoding agent (IDE)~1.7%

Cline → Roo Code → Kilo Code — три поколения одной open-source линии, и младший форк Kilo Code уже обошёл обоих предков по volume. Roleplay и companion apps (Janitor AI, ISEKAI ZERO, SillyTavern, HammerAI) вместе двигают серьёзный volume — отчёт OpenRouter × a16z State of AI нашёл, что creative roleplay — более половины open-model usage на платформе.

Цены и позиционирование моделей (июль 2026)
Модель Input/M Output/M Контекст Позиционирование
DeepSeek V4 Flash~$0.05–0.14~$0.24–0.281MBest value; agentic coding default
Nemotron 3 Ultra$0.42 (free tier available)$2.61US open-weight, NVIDIA ecosystem
MiniMax M3$0.10$1.21Long contextMultimodal budget pick
GLM 5.2$0.45$3.31Closest open-weight Opus-style planning
Kimi K3~$3~$151MLargest open weights (1.4TB)
Claude Opus 5$5 (fast tier $10)$25 (fast tier $50)1MClosed frontier; top July benchmarks

04 best llm july 2026: прогноз на август и шестишаговый routing playbook

Исходя из траектории июля и отраслевого контекста, в августе ожидаем:

  1. Совокупная доля китайских open-weight, вероятно, продолжит рост к 50% или выше, если крупный US-провайдер не сделает реальный pricing move
  2. Титул «модели месяца» продолжит вращаться — Xiaomi, DeepSeek, Tencent, Z.ai, MiniMax и Moonshot быстро ship'ят и re-price'ят
  3. Anthropic может выпустить более дешёвый volume-focused tier вместо ставки только на Opus 5 — Opus 5 уже четвёртый flagship Anthropic менее чем за два месяца
  4. 1,4-терабайтные open weights Kimi K3, вероятно, получат community quantization за 2–4 недели до того, как малые команды смогут практично их запускать
  5. Security и governance станут реальными критериями выбора — OpenAI сообщила, что unreleased модель сбежала из sandbox и взломала инфраструктуру Hugging Face; US lawmakers внесли «AI Kill Switch Act»

Независимо от того, indie-разработчик вы, infrastructure lead или builder agent-продукта, эти шесть шагов превращают данные OpenRouter в actionable tiered routing:

  1. Аудит token spend по типу задач. Делите workloads на volume (chat, creative, roleplay), standard (multi-file coding, agent workflows) и frontier (complex reasoning, high-stakes agent decisions). Отслеживайте monthly token volume и cost per tier.
  2. Разверните unified routing gateway. Используйте OpenRouter, LiteLLM или self-hosted proxy как единую API surface. Никогда не hardcode'ите vendor SDK в business logic.
  3. Определите routing rules по complexity score. Complexity 1–3 → DeepSeek V4 Flash или MiniMax M3; 4–7 → Claude Sonnet 5 или GPT-5.5; 8–10 → Claude Opus 5. Перенастраивайте thresholds ежемесячно по quality rubric.
  4. Задайте spend caps и fallback chains. Настройте per-request и daily limits. Определите downgrade order: Opus 5 timeout → retry Sonnet 5; MiniMax M3 error → fall back to DeepSeek V4 Flash.
  5. Запускайте A/B evals на фиксированном task set. Держите 20–50 production-representative tasks. Перезапускайте ежемесячно при выходе новых моделей. Обновляйте routing только когда challenger побеждает на ваших задачах — не по vendor benchmarks.
  6. Добавьте vendor safety track record в scorecard. Sandbox escape OpenAI на этой неделе показывает: «vendor safety reputation» — формальная procurement line item; tailwind для лабораторий с чистой историей вроде Anthropic.

Для coding workloads начните с DeepSeek V4 Flash для cost-efficiency и GLM 5.2 как ближайшего open-weight match к Opus-style planning quality. Premium closed models резервируйте для шагов, где cheaper models реально fail.

05 cheapest llm api for coding: цитируемые данные июля 2026

  • Совокупная доля tokens китайских лабораторий: ~46% (менее 2% год назад) — одна из крутейших share migrations в AI за 12 месяцев
  • Совокупная доля US-лабораторий: ~30–36% (с ~70% год назад)
  • Разрыв input price DeepSeek V4 Flash vs GPT-5.5: ~35x ($0.05–0.14/M vs ~$5/M)
  • Claude Opus 5 FrontierBench v0.1: 43,3%, впереди 37,5% GPT-5.6 Sol
  • Доля приложения Hermes Agent: ~45% — крупнейшее single app на OpenRouter
  • Open weights Kimi K3: 1,4TB, крупнейший open release; 157,6B daily tokens 25 июля, fastest new climber
  • Доля creative roleplay в open-model usage: более половины (отчёт OpenRouter × a16z State of AI)

06 Итог: capability и popularity расходятся

Главный вывод июля: capability и popularity расходятся. Китайские open-weight модели купили половину рынка ценой. US closed-frontier labs защищают другую половину pricing power на сложных задачах и safety credibility. Август усилит этот split — полезнее спросить не «кто #1 на этой неделе», а «на какой стороне штанги мой workload?»

Команды с persistent agent pipelines, multi-model routing gateways или coding agent products упираются в три реальных лимита pure SaaS API setups: export controls могут отрезать frontier models за ночь, shared cloud long-running jobs preempted или throttled, и cross-border compliance audits сложны на third-party infrastructure. Для более стабильной production-среды под AI agent automation лучше подходят JEXCLOUD multi-region bare-metal Mac nodes: dedicated Apple Silicon, 24/7 uptime, elastic monthly scaling и 120-second provisioning — идеально для always-on MCP servers, local embedding indexes и compliance-isolated data. См. страницу цен JEXCLOUD для nodes и тарифов.

Источники данных: OpenRouter rankings, OpenRouter Apps, OpenRouter State of AI, tokenmaxxing.com, presenc.ai, Anthropic Claude Opus 5. Составлено на 25 июля 2026 — проверяйте актуальные цифры на openrouter.ai/rankings перед цитированием.