AI Agent 2026.08.17

Рост цен DeepSeek + открытые веса флагмана Alibaba 2,4T + скачок GLM-5.3: почему китайские модели в августе коллективно сменили строй?

За пять дней, с 12 по 17 августа, китайский контур больших моделей сделал три вещи, которые выглядят противоречиво и при этом рифмуются: DeepSeek объявил рост API до более чем 1100% на отдельных статьях, Alibaba в том же окне выложила никогда ранее не открывавшиеся веса флагмана уровня Qwen-Max на 2,4 трлн параметров, Zhipu тем же базисом, только за счёт пост-обучения, подняла coding-скоры в несколько раз. Три компании, три ставки — один сигнал: китайские модели уходят от гонки «кто дешевле» к борьбе за право назначать цену.

Статья закрывает три вопроса: ① что случилось за эти две недели и как читать цифры; ② на что отдельно ставят time-of-day тариф DeepSeek, кастомная лицензия Alibaba и пост-обучение GLM-5.3 на том же базисе; ③ остаётся ли DeepSeek самым дешёвым флагманом после роста и как разбирать счёт, читать LICENSE и сдвигать нагрузку с пиковых часов. Связанные разборы: релиз Qwen3.8-Max, официальный V4 Flash и снижение цен GPT-5.6.

01 Китайские модели в августе сменили строй: таймлайн и pain points

Если сжать две недели в одну таблицу, ритм становится читаемым:

Таймлайн открытых весов и ценообразования, июль–август 2026
Дата Событие
16 июляMoonshot AI открыла веса Kimi K3 (2,8 трлн параметров); ранее это уже вызвало security-внимание США
2–3 августаAlibaba сначала анонсировала, затем вывела в облачный API Qwen3.8-Max
10 августаMeta выпустила open-weight модель Muse Glimmer (30 млрд параметров, Apache 2.0) и анонсировала веса флагмана Muse Spark 1.2 как «скоро»
12 августаAlibaba официально выложила веса Qwen3.8-2.4T-A95B на ModelScope / Hugging Face; в тот же день xAI выпустила Grok 4.6
13 августаDeepSeek-V4-Pro вышел в GA и объявил рост API с 17 августа; Google выпустила подешевевший Gemini 3.7 Flash
14 августаZhipu выпустила GLM-5.3 на том же базисе GLM-5.2 (743 млрд параметров)
17 августа, 00:00 (пекинское время)Новый прайс DeepSeek вступил в силу

Отодвинуть кадр ещё дальше: 30 июля OpenAI уже срезал самый дешёвый ярус GPT-5.6 Luna на 80%, 6–7 августа сделал Luna дефолтом для бесплатных пользователей и открыл безлимитный текстовый чат. Пока китайские вендоры добавляют рост цен и открытые веса, американские добавляют бесплатность и снижение цен. Это не совпадение, а две стороны одной ценовой игры. Фон Kimi K3: полное открытие весов Kimi K3; прежний каркас пик/непик DeepSeek: V4 GA и пик/непик биллинг.

Pain points для читателя и закупочной команды:

  • Headline-кратности путают статьи счёта: медиа пишут «рост в 11 раз», «более 1100%», «350%» — это cache-hit input, output и cache-miss input. Считать счёт по заголовку нельзя.
  • Гипотеза «официал всегда дешевле» сломана: в пиковые часы официальный прайс DeepSeek уже выше части reseller-площадок. Сдвиг с пика и выбор канала впервые стали обязательной работой.
  • Открытые веса ≠ Apache 2.0: веса Qwen3.8-Max можно скачать, но кастомная лицензия режет высокодоходный MaaS / AI-рабочий ассистент.
  • Гео-запрет разгоняется быстрее LICENSE: в сети утверждали, что Alibaba запретила скачивание пользователям из США, ЕС, Великобритании и Южной Кореи. В тексте нет территориальных ограничений.

Три компании, три ставки — один сигнал: китайские модели уходят от гонки «кто дешевле» к борьбе за право назначать цену.

02 Рост цен DeepSeek, открытые веса Qwen, GLM-5.3: ключевые цифры

Новый прайс DeepSeek действует с 17 августа, 00:00. Пиковые часы по пекинскому времени: 9–12 и 14–18.

Детализация роста цен DeepSeek (за миллион tokens; пик по пекинскому времени 9–12 и 14–18)
Статья биллинга До роста Непиковые часы (новые) Пиковые часы (новые) Рост (пик)
V4-Flash cache-hit input¥0.02¥0.05¥0.10около 400%
V4-Flash cache-miss input¥1.0¥1.5¥3.0200%
V4-Flash output¥2.0¥4.5¥9.0350%
V4-Pro cache-hit input¥0.025¥0.15¥0.30около 1100%
V4-Pro cache-miss input¥3.0¥4.5¥9.0200%
V4-Pro output¥6.0¥13.5¥27.0350%

Источник: официальный анонс DeepSeek, перекрёстно сверено с Wall Street CN, IT之家 и V2EX. Максимальный рост — на cache-hit (до примерно 12× / 1100%+), но абсолютные суммы малы. Для тяжёлых вызовов больнее output (350%) и cache-miss input. Независимая оценка реалистичной тяжёлой нагрузки (около 84 млн tokens/мес, в основном непик, примерно половина cache hit) даёт рост счёта ближе к 1,8× — реально, но далеко от самого пугающего headline.

Qwen3.8-2.4T-A95B (открытые веса Qwen3.8-Max): ключевые спецификации
Параметр Значение
Масштаб параметров2,4 трлн всего, 95 млрд активных (MoE, 512 экспертов, 10 routed + 1 shared)
Контекстное окноОткрытые веса: нативно 262 144 tokens, расширяемо примерно до 1,01 млн; облачный Max по умолчанию 1 млн tokens
Ритм релиза2 августа анонс → 3 августа API → 12 августа открытые веса
API (международный сайт)вход $2 / M tokens, выход $6 / M tokens
ЛицензияНе Apache 2.0, кастомная «Qwen3.8-Max License»
ЗначениеВпервые Alibaba открыла веса модели уровня Max (флагман); Qwen3.5 / 3.6 / 3.7 Max оставались закрытым API
GLM-5.3 vs GLM-5.2: тот же базис, только пост-обучение
Бенчмарк GLM-5.2 GLM-5.3 Изменение
Terminal-Bench 3.04.6%28.3%+23.7
DeepSWE v1.146.2%66.9%+20.7
Agents' Last Exam(CLI)23.8%28.5%+4.7
CyberGym77.2%84.5%+7.3
AutomationBench26.2%48.2%+22.0

Это собственные цифры Zhipu, независимого ретеста третьей стороны пока нет. На Terminal-Bench 3.0 GLM-5.3 всё ещё ниже GPT-5.6 Sol (34.6%) и Claude Fable 5 (33.7%): не абсолютный топ, а первый эшелон open-weight моделей.

03 DeepSeek, Alibaba, Zhipu: три ставки, три логики

1. DeepSeek: от плоского демпинга к time-of-day тарифу — дефицит compute вынесен на прайс-лист

Рост цен DeepSeek легко прочитать как «просто подняли». Структура говорит иначе: это прозрачность compute-счёта. Долгое время DeepSeek держал единую низкую цену без окон, покупая объём пользователей и размазывая стоимость через cache hit и сдвиг с пика. Когда вызовы росли экспоненциально, а GPU-ёмкость нет, схема не выдержала. Формула анонса «поощряем более гибкое планирование нагрузки» переводится так: «пикового compute уже не хватает, сдвиньте нагрузку сами».

Деталь, которую легко пропустить: после роста официальный API DeepSeek в пиковые часы уже дороже части reseller-площадок (GMI Cloud, Novita и другие сейчас котируют ниже официального пика). Гипотеза «официал всегда дешевле» — часть рва DeepSeek — сломана впервые.

2. Alibaba: веса открывают экосистему, кастомная лицензия удерживает выручку

Открытие Qwen3.8-Max — не благотворительность. Alibaba сделала две вещи сразу: выложила веса на 2,4 трлн параметров и приложила к ним лицензию, отличную от привычного Apache 2.0. MaaS или AI-рабочий ассистент с выручкой выше $50 млн за 12 месяцев обязан отдельно договариваться о коммерческой лицензии; продукт с MAU выше 100 млн или месячной выручкой выше $20 млн обязан заметно показать имя модели в интерфейсе.

Логика связки: открытыми весами купить экосистему и репутацию (особенно у зарубежных разработчиков, чтобы снять ярлык «китайская модель несерьёзна»), а на клиентах, которые реально генерируют кэш, оставить рычаг цены. Поэтому это и Muse Glimmer от Meta (чистый Apache 2.0, без доп. оговорок) — разные порядки «открытости».

Нужно снять один устойчивый слух: в сети утверждали, что лицензия Alibaba запрещает скачивание пользователям из США, ЕС, Великобритании и Южной Кореи. Это ложь. В официальном тексте нет территориальных ограничений. Слухи распространяются быстрее, чем чтение LICENSE. Первичные тексты: репозиторий на Hugging Face и оригинал LICENSE.

3. Zhipu GLM-5.3: базис не меняли, сменили «рецепт пост-обучения» — масштабирование pretrain больше не единственный рычаг

В GLM-5.3 важнее не сам скор, а метод: базис тот же, что у GLM-5.2 (743 млрд параметров), без нового pretrain. Только масштабирование RL-сред на пост-обучении подняло Terminal-Bench 3.0 с 4.6% до 28.3% — почти 6×. Это подтверждает тренд последних месяцев: когда предельная отдача Scaling Law на pretrain падает, масштабирование RL в пост-обучении становится отдельным рычагом, и порог входа у него заметно ниже, чем у нового базиса на сотни миллиардов параметров. Средние лаборатории могут догонять топ «чистовой отделкой». Официальная страница: Z.ai GLM-5.3.

peak_window_check.sh
TZ=Asia/Shanghai date +%H:%M
# peak if 09:00-12:00 or 14:00-18:00 Beijing
# shift batch / eval jobs off these windows
# do not quote 1100% as your real bill delta
curl -s https://api-docs.deepseek.com/quick_start/pricing

DeepSeek вынес дефицит compute на прайс-лист. Alibaba обменяла веса на экосистему и оставила рычаг в лицензии. Zhipu показала, что масштабирование пост-обучения работает как самостоятельный рычаг.

04 После роста цен DeepSeek всё ещё самый дешёвый флагман?

Вход / выход флагманского яруса после роста (за миллион tokens)
Модель Вход Выход Открытые веса
DeepSeek V4-Pro (пик)¥9.0 (около $1.26)¥27.0 (около $3.78)веса не открыты
DeepSeek V4-Pro (непик)¥4.5 (около $0.63)¥13.5 (около $1.89)веса не открыты
Qwen3.8-Max (международный сайт)$2$6открыты (кастомная лицензия)
OpenAI GPT-5.6 Luna$0.20$1.20закрыта
Claude Opus 5 (по кратности, раскрытой Alibaba)около $5около $25закрыта

Курс примерно ¥7.15 / $1, ориентир, факт — по официальным анонсам. После роста непик DeepSeek V4-Pro всё ещё заметно ниже Claude Opus 5, но это уже не «самый дешёвый на поле»: международный Qwen3.8-Max и Luna от OpenAI дешевле непика DeepSeek хотя бы по одной оси. Равенство «китайская = самая дешёвая» рассыпается, ценовая конкуренция уходит в слои.

«Китайская = самая дешёвая» в целом держалось с 2025 до начала 2026. На 17 августа 2026 это уже нельзя брать как безусловную гипотезу.

05 Споры, война на двух фронтах и чеклист из шести шагов

Споры и детали, которые нельзя принимать на веру

  • Путаница калибра роста: разные медиа пишут «в 11 раз», «более 1100%», «350%». Все формулировки верны, но это разные статьи (cache-hit input vs output vs cache-miss input). Смотрите, какая именно строка.
  • Утверждения про сервис на китайском чипе Zhenwu M890: ряд китайских финансовых СМИ писал, что часть инференса Qwen3.8-Max идёт на собственном чипе Zhenwu M890 и суперноде «Паньгу AL128». Деталь есть только в пересказах, без отдельной технической документации Alibaba и без стороннего бенчмарка. Помечать как не подтверждено независимо.
  • Утверждение, что GLM-5.3 «нашла серьёзную уязвимость в Cursor»: из репортажа VentureBeat и раскрытия Zhipu. Технические детали уязвимости не опубликованы, достоверность и радиус ждут подтверждения сторонней security-лаборатории. Это одностороннее раскрытие вендора.
  • Возможные ответные экспортные ограничения Минкоммерции КНР: часть репортажей предполагает контрмеры по AI / полупроводникам. Официального подтверждения нет — медиа-гипотеза / слух, только как фон.

Влияние и фон: это не изолированные новости, а война на двух фронтах

Соберите события в более широкий кадр. За последний месяц топ китайских лабораторий держал плотность «три обновления в неделю» — помимо DeepSeek, Alibaba и Zhipu выходили Moonshot Kimi K3 (16 июля, открытые веса 2,8 трлн) и MiniMax H3. Китайские финансовые СМИ читают это как «плотная серия китайских open-weight релизов, которая заставляет глобальный AI-рынок пересчитать цены».

Американские вендоры идут другой дорогой: 30 июля OpenAI резко снизил цены (Luna −80%), 6–7 августа сделал подешевевшую Luna дефолтом бесплатных пользователей и открыл безлимитный текст; 13 августа Google выпустила Gemini 3.7 Flash вдвое дешевле. Китайские лаборатории делают «открытый флагман + ступенчатый рост цен», американские — «бесплатность на потребителе + снижение как оборона». Две траектории одновременно, и август 2026 становится узлом, где пересобирается логика ценообразования отрасли.

Есть и геополитический слой. Открытие Kimi K3 уже вызвало security-внимание США; выбор Alibaba открыть флагман на 2,4 трлн именно в этом окне часть аналитиков читает как попытку закрепить международное влияние и нарратив технологического паритета до возможного ужесточения регуляторики. Это интерпретация, не установленный факт, но фон выбора момента этой волны открытых весов игнорировать нельзя.

Чеклист из шести шагов (для разработчиков и закупки):

  1. Разберите счёт по статьям: отдельно cache-hit input, cache-miss input и output. Не ставьте «1100%» как свой реальный множитель.
  2. Сверьте пиковые часы по пекинскому времени: batch Agent / eval вынесите из окон 9–12 и 14–18, берите непик.
  3. Сначала читайте LICENSE: канон — файл в репозитории Hugging Face / ModelScope, не репосты про «запрет США/ЕС/Великобритании/Кореи».
  4. Сверьте пороги выручки и MAU: MaaS / AI-рабочий ассистент с доходом выше $50 млн за любые 12 месяцев — отдельная лицензия; MAU выше 100 млн или месячная выручка выше $20 млн — заметное имя модели.
  5. Сравните горизонтально, потом фиксируйте вендора: непик/пик DeepSeek, международный Qwen $2/$6, GPT-5.6 Luna $0.20/$1.20 и reseller-котировки, которые уже ниже официального пика.
  6. Выберите стабильный хост для сдвига с пика: локальный съём весов 2.4T, long-context eval или 7×24 Agent-планирование — лучше выделенный bare-metal Mac, не oversold shared cloud.
aug2026_price_war_watchlist.md
# Aug 2026 China open-weight + pricing watchlist
1. split bill: cache-hit / cache-miss / output
2. shift jobs off Beijing 09-12 and 14-18
3. read Qwen3.8-Max LICENSE, not rumor threads
4. check $50M MaaS / 100M MAU / $20M monthly triggers
5. compare Luna $0.20/$1.20 vs Qwen $2/$6 vs DS off-peak
6. avoid shared-cloud for 2.4T / long-context evals
next: isolated Apple Silicon host

Цитируемые жёсткие цифры (срез 2026-08-17):

  • V4-Pro cache-hit input, пик: ¥0.025 → ¥0.30, около 1100% (headline относится только к этой строке)
  • V4-Pro output, пик: ¥6.0 → ¥27.0, 350% (обычно сильнее бьёт по реальному счёту)
  • Qwen3.8-2.4T-A95B: 2,4 трлн всего / 95 млрд активных, нативно 262 144 tokens, кастомная лицензия
  • GLM-5.3 Terminal-Bench 3.0: 4.6% → 28.3%, тот же базис 743 млрд, без нового pretrain
  • Пороги лицензии: MaaS / AI-рабочий ассистент с выручкой выше $50 млн за любые 12 месяцев — отдельная лицензия; MAU выше 100 млн или месячная выручка выше $20 млн — заметное имя модели

06 FAQ и production-итог

Q1: После этого роста цен DeepSeek пользоваться им станет дороже?
Зависит от сценария. Если вызовы в основном попадают в непиковые часы (не 9–12 и 14–18 по пекинскому времени) и доля cache hit высокая, реальный рост заметно ниже headline-цифр «350%» и «1100%» (оценки для тяжёлой нагрузки дают около 1,8×). Если вызовы сконцентрированы в пиковые часы и cache hit низкий, рост приблизится к headline или совпадёт с ним.

Q2: Можно ли индивидуальному разработчику бесплатно коммерчески использовать открытые веса Qwen3.8-Max?
Для личных проектов и внутреннего использования почти без ограничений. Если бизнес — «Model-as-a-Service» или «AI-рабочий ассистент» и выручка этого направления за любые 12 месяцев превысила $50 млн, нужна отдельная коммерческая лицензия Alibaba. При MAU выше 100 млн или месячной выручке выше $20 млн имя модели нужно заметно указать в интерфейсе.

Q3: GLM-5.3 и GLM-5.2 — одна и та же модель? Почему она так резко стала сильнее?
Базовая модель та же (743 млрд параметров), Zhipu не переобучала pretrain. Скачок дало масштабирование RL-сред на этапе пост-обучения: само пост-обучение стало независимым рычагом, без нового более крупного базиса.

Q4: Правда ли, что лицензия Qwen3.8-Max запрещает скачивание пользователям из США и ЕС?
Нет. Это недостоверная информация. В официальном тексте лицензии нет территориальных ограничений. Ограничения завязаны на выручку коммерческих сервисов, не на регион пользователя.

Q5: Значит ли открытие Muse Glimmer от Meta, что дух open source эпохи Llama вернулся?
Пока это лишь «частичный возврат». Muse Glimmer — дистиллированная модель на 30 млрд параметров. Флагманский closed model Muse Spark 1.2 ещё не открыт; Цукерберг только «анонсировал» будущие веса. Если этот шаг реально случится, это будет первый случай, когда американский вендор переведёт флагманский closed model в open weights. Пока нужно следить за фактом, не за пресс-релизом.

Источники: официальный анонс роста цен DeepSeek, перекрёстно сверено с Wall Street CN, IT之家, AIGC-навигатором и обсуждениями V2EX; официальные репозитории Qwen (Hugging Face / ModelScope) и репортаж South China Morning Post (SCMP) по условиям лицензии; официальная техническая страница Zhipu (Z.ai) по GLM-5.3 плюс материалы VentureBeat и StableLearn; официальный блог Meta AI Research и репортаж VentureBeat по Muse Glimmer; сводные материалы Yicai / 第一财经 и Sohu Finance о плотности китайских релизов. Цифры собраны по открытым данным на момент публикации. Цены, лицензию и бенчмарки перед перепечаткой сверяйте с последним официальным анонсом; детали про чипы, уязвимость Cursor и экспортный контроль в тексте помечены как не подтверждённые независимо.

Shared cloud на long-context eval или локальном съёме весов 2.4T часто даёт jitter канала и oversell. Сдвиг Agent с пика на собранных наспех нодах рвёт long connections и почти не даёт настоящей изоляции. Высокопамятный инференс и 7×24-планирование на нестабильном shared instance трясут и счёт, и success rate. Для более стабильного production-хоста под оценку открытых весов и off-peak автоматизацию Agent обычно лучше подходит мультирегиональный bare-metal Mac JEXCLOUD: выделенный Apple Silicon, root, 7×24, помесячная гибкость, выдача около 120 секунд. Ноды и цены: страница тарифов JEXCLOUD.