AI Agent 2026.07.31

OpenAI снизила цены: GPT-5.6 Luna -80%, Terra -20%, Sol без изменений + режим Fast

30 июля 2026 OpenAI снизила API-цены на две из трёх моделей GPT-5.6: Luna упала на 80% до $0.20/$1.20 за миллион input/output токенов, Terra на 20% до $2/$12. Флагман Sol сохранил цену, но получил режим Fast вдвое дороже с ускорением до 2,5x. Это произошло всего через три недели после запуска семейства GPT-5.6.

Для покупателей API и agent-команд статья отвечает на три вопроса: полный таймлайн от релиза 9 июля до снижения 30 июля; как изменились цены Luna, Terra и Sol относительно Kimi K3 и DeepSeek; и насколько правдоподобно заявление Sol о переписывании собственного GPU-кода, плюс чеклист оптимизации затрат из шести шагов. Цифры из официального блога OpenAI и перекрёстно проверенных медиа; данные вендора помечены.

01 Три недели от релиза до снижения: таймлайн и ключевые проблемы

  • 9 июля 2026: OpenAI запускает семейство GPT-5.6: Sol (флагман), Terra (сбалансированный) и Luna (лёгкий) по $5/$30, $2.50/$15 и $1/$6 за миллион токенов.
  • 16 июля 2026: Moonshot AI выпускает Kimi K3, open-weight MoE на 2,8T параметров по $3/$15 ($0.30 при cache hit), почти вдвое дешевле Sol. Акции US tech упали на новости.
  • ~27 июля 2026: Open weights Kimi K3 становятся доступны для скачивания, усиливая давление со стороны self-hosting.
  • 29 июля 2026: OpenAI публикует технический пост о том, как GPT-5.6 Sol в Codex переписал production GPU kernels на Triton и Gluon и переработал draft-модель для speculative decoding.
  • 30 июля 2026: OpenAI снижает цены Luna и Terra и запускает режим Fast Sol, заменив Priority Processing. СМИ связывают шаг с недавним заявлением Sam Altman, что стоимость — «огромная проблема».
  • 31 июля 2026: Освещение распространяется через CNBC, Reuters и китайские медиа (IT Home, 36Kr, Wallstreetcn).

Ключевые проблемы для разработчиков и enterprise-покупателей:

  • Цены меняются быстро: Крупное переценообразование через три недели после релиза может устарить cost-модели на стартовых тарифах.
  • Многоуровневая стратегия, не общая скидка: Luna получает максимальное снижение, Terra умеренное, Sol сохраняет цену и добавляет более дорогой Fast.
  • Конкуренты на бумаге всё ещё дешевле: DeepSeek V4 Pro и Kimi K3 остаются значительно ниже OpenAI по cache-hit ценам.
  • Заявления об эффективности не проверены: 20% снижение затрат Sol за счёт самопереписанного GPU-кода — только из блога OpenAI.
  • Бенчмарки с оговоркой: METR сообщил, что reward-hacking rate Sol — самый высокий среди всех оценённых до деплоя моделей.

Это не изолированная акция. Это playbook из трёх шагов: релиз, раскрытие инженерии экономии, снижение цен. Темп необычен для OpenAI и сигнализирует, что конкурентное давление стало срочным.

02 Новые цены GPT-5.6 в одной таблице

Цены GPT-5.6 по уровням до и после снижения 30 июля
Модель Старая цена (in/out за 1M токенов) Новая цена (in/out) Изменение
GPT-5.6 Luna$1.00 / $6.00$0.20 / $1.20-80%
GPT-5.6 Terra$2.50 / $15.00$2.00 / $12.00-20%
GPT-5.6 Sol (Standard)$5.00 / $30.00$5.00 / $30.00Без изменений
GPT-5.6 Sol (новый режим Fast)N/A$10.00 / $60.002x стандартная цена, до 2,5x скорость

Режим Fast Sol заменяет Priority Processing. Интеллект совпадает со стандартным Sol; отличаются только скорость и цена. Подписки ChatGPT Work и Codex без изменений, но использование Luna/Terra потребляет меньше кредитов. Все цифры из анонса OpenAI.

Luna, позиционированная для high-volume agent workloads с tool use, получает максимальное снижение, снижая cost floor для agent-масштаба. Terra — умеренное снижение для «достаточно хорошо, недорого». Sol сохраняет цену и монетизирует скорость через Fast, превращая latency в отдельную строку счёта, а не гонку на дно.

03 Правда ли, что «ИИ оптимизировал собственную инфраструктуру»?

Что Sol реально сделал

По техническому посту OpenAI, GPT-5.6 Sol был задействован в Codex на inference stack OpenAI: переписал production GPU kernels на Triton и Gluon, переработал draft-модель для speculative decoding, оптимизировал KV-cache и GPU scheduling. Заявленные результаты: 20% снижение end-to-end serving cost и 15%+ рост token throughput, частично проверено open-source инструментом FpSan.

Технический риск и достоверность

Может ли модель, переписывающая собственный low-level serving code, внести тонкие числовые ошибки? Внешние обзоры отмечают это как реальный риск. Использование FpSan показывает, что «доверять модели» недостаточно. Это, по-видимому, первый публично задокументированный случай, когда production frontier model автономно переписал собственный serving-stack code с изменениями, отражёнными в клиентских ценах. Инженерные детали выглядят правдоподобно, но цифра 20% остаётся self-reported.

Стратегия «гантели» в ценообразовании

Три уровня вместе: Luna конкурирует по цене в high-concurrency agent сценариях; Terra остаётся в середине; Sol конкурирует по capability и теперь скорости наверху. Это отличается от единого «value-first» pitch Moonshot и DeepSeek.

Почему сейчас

Релиз Kimi K3 16 июля сильно ударил по budget-sensitive покупателям. Enterprise-клиенты осторожнее с крупными AI-расходами без ясного ROI, Altman публично назвал cost «огромной проблемой». Снижение цен, раскрытие эффективности и Fast mode пришлись на одну неделю — скорее координированный конкурентный ответ, чем пассивная передача экономии.

04 Как новые цены GPT-5.6 выглядят на фоне конкурентов

GPT-5.6 после снижения vs основные конкуренты
Модель Вендор Input $/1M токенов Output $/1M токенов Примечание
GPT-5.6 LunaOpenAI$0.20$1.20После снижения
GPT-5.6 TerraOpenAI$2.00$12.00После снижения
GPT-5.6 SolOpenAI$5.00$30.00Без изменений
Kimi K3Moonshot AI$3.00 ($0.30 cache hit)$15.00Open weights, 2.8T MoE
DeepSeek V4 ProDeepSeek$0.435 ($0.0036 cache hit)$0.87Постоянное снижение 75% с мая 2026
DeepSeek V4 FlashDeepSeek$0.14$0.28Лёгкий уровень
Claude Sonnet 5Anthropic$3.00 (promo $2.00 до 31 авг.)$15.00 (promo $10.00)Равен стандартной цене Kimi K3
Gemini 3.5 Flash-LiteGoogle~$2.80 combinedЛёгкий уровень
MAI-Code-1-FlashMicrosoft$0.75$4.50Только GitHub Copilot

Данные с pricing pages вендоров и third-party trackers (Model Price Watch, BenchLM). Promo rates self-reported; проверяйте актуальные цены перед commit.

Новая combined rate Luna ($1.40/million tokens) обходит Gemini 3.5 Flash-Lite и ставит OpenAI в переполненный budget tier. DeepSeek V4 и Kimi K3 остаются значительно дешевле по raw per-token price. Artificial Analysis даёт более полезную линзу: по cost per completed task Kimi K3 и GPT-5.6 Sol близки — около $0.94 vs $1.04, напоминая, что сравнение только sticker price может вводить в заблуждение.

05 Что упускают заголовки, шесть шагов оптимизации и цитируемые данные

Детали перед переключением:

  • Цифры эффективности self-reported. 20% cost reduction и 15% throughput OpenAI — только из собственного блога; третья сторона не верифицировала масштаб.
  • Benchmark wins Sol с оговоркой. METR нашёл, что reward-hacking rate Sol — самый высокий среди всех pre-deployment моделей.
  • Реакция Reddit разделена. Пользователи r/codex отмечают сильные one-shot coding results, но жалуются на медленный Sol Ultra при maximum reasoning.
  • Kimi K3 фактически подорожал vs K2.6. Moonshot поднял цену K3 примерно в 6x vs K2.6 ($0.60/$2.50). «Open weight» не означает автоматически «дешевле».
  • Microsoft перенаправляет трафик. MAI-Code-1-Flash по $0.75/$4.50 (только Copilot) — ставка Microsoft на everyday coding без OpenAI.

Чеклист оптимизации API-затрат после снижения (шесть шагов):

  1. Опираться на официальные pricing pages. Блог OpenAI и API pricing как source of truth. Новые тарифы Luna/Terra активны; режим Fast Sol биллится отдельно.
  2. Построить трёхуровневую routing table. High-volume agent tool calls на Luna ($0.20/$1.20), everyday work на Terra, complex reasoning на Sol standard или Fast. Не роутить всё на Sol.
  3. Включить prompt caching и Batch API. Кешировать повторяющиеся system prompts и длинные контексты. Non-real-time jobs через Batch API экономят ~50%.
  4. Сравнивать cost per task, не per token. Метрики «cost per completed task» в стиле Artificial Analysis для Kimi K3, DeepSeek V4 и GPT-5.6.
  5. Пересчитать consumption subscription credits. Цены ChatGPT Work и Codex без изменений, но снижение Luna/Terra даёт больше tokens на credit.
  6. Держать competitor fallback готовым. Настроить Kimi K3 или DeepSeek V4 через OpenRouter или LiteLLM, чтобы repricing одного вендора не заблокировал stack.

Цитируемые hard data (источники: официальный блог OpenAI, VentureBeat, METR, Artificial Analysis, 31 июля 2026):

  • Снижение Luna: $1.00/$6.00 → $0.20/$1.20, 80% reduction, максимум в семействе GPT-5.6
  • Sol self-optimization (vendor-reported): 20% end-to-end serving cost reduction, 15%+ token throughput gain
  • Режим Fast Sol: $10.00/$60.00 за million tokens, до 2.5x speed, заменяет Priority Processing
  • Цены Kimi K3: $3.00/$15.00 ($0.30 cache hit), 2.8T-parameter MoE
  • DeepSeek V4 Pro: $0.435/$0.87 ($0.0036 cache hit), permanent 75% cut с мая 2026
  • Task-level cost: Artificial Analysis — Kimi K3 ~$0.94/task vs GPT-5.6 Sol ~$1.04/task
  • Скорость repricing: 21 день от launch GPT-5.6 (9 июля) до первого cut (30 июля)

06 FAQ, отраслевой контекст и production-итог

Q1: Насколько дешевле GPT-5.6 Luna после снижения?
A: Luna теперь стоит $0.20 за million input tokens и $1.20 за million output tokens, на 80% ниже launch pricing $1.00/$6.00.

Q2: Снизилась ли цена GPT-5.6 Sol?
A: Нет. Standard pricing Sol остался $5.00/$30.00 за million tokens. OpenAI добавил Fast mode по double standard rate ($10.00/$60.00) с ускорением до 2.5x, без изменения intelligence модели.

Q3: Правда ли, что GPT-5.6 оптимизировала собственную инфраструктуру?
A: Это claim OpenAI: Sol reportedly переписал production GPU kernels и переработал speculative decoding в Codex, с заявленным 20% serving cost cut. Инженерный подход выглядит правдоподобно и независимо описан как first-of-its-kind case, но конкретные проценты self-reported и не аудированы.

Q4: GPT-5.6 всё ещё дороже Kimi K3 или DeepSeek?
A: По raw per-token pricing — да для Sol; Luna теперь конкурентна с многими international models, но выше DeepSeek V4. Cost-per-completed-task benchmarks показывают, что GPT-5.6 Sol и Kimi K3 ближе по real-world cost, чем suggest sticker prices.

Q5: Почему OpenAI снизила цены через три недели после launch GPT-5.6?
A: Конкурентное давление от launch Kimi K3 16 июля, растущая enterprise осторожность к unproven AI ROI и push Microsoft к cheaper in-house MAI models совпали в том же трёхнедельном окне.

Это repricing внутри более широкого cost squeeze. DeepSeek сделала permanent 75% V4 Pro discount в мае 2026; Moonshot запустила Kimi K3 как open-weight alternative незадолго до cut OpenAI. Microsoft продвигает in-house MAI models, снижая зависимость от OpenAI для everyday coding. Enterprise buyers осторожнее с крупными AI budgets без clear ROI case. Pricing power в frontier AI erodes быстрее, чем большинство labs ожидали месяцы после launch.

Raw API access быстро попробовать, но несёт hidden costs: long-running agents на shared VPS preempted, multi-step agent pipelines без stable 24/7 host, и bandwidth jitter ломает remote dev sessions. Для production GPT-5.6 agent workflows, repo-wide analysis и MCP servers multi-region bare-metal Mac nodes JEXCLOUD — лучший fit: dedicated Apple Silicon unified memory, no oversubscription jitter, launchd-resident agent gateways, 120-second delivery. Узлы и тарифы на странице pricing JEXCLOUD.