OpenAI снизила цены: GPT-5.6 Luna -80%, Terra -20%, Sol без изменений + режим Fast
30 июля 2026 OpenAI снизила API-цены на две из трёх моделей GPT-5.6: Luna упала на 80% до $0.20/$1.20 за миллион input/output токенов, Terra на 20% до $2/$12. Флагман Sol сохранил цену, но получил режим Fast вдвое дороже с ускорением до 2,5x. Это произошло всего через три недели после запуска семейства GPT-5.6.
Для покупателей API и agent-команд статья отвечает на три вопроса: полный таймлайн от релиза 9 июля до снижения 30 июля; как изменились цены Luna, Terra и Sol относительно Kimi K3 и DeepSeek; и насколько правдоподобно заявление Sol о переписывании собственного GPU-кода, плюс чеклист оптимизации затрат из шести шагов. Цифры из официального блога OpenAI и перекрёстно проверенных медиа; данные вендора помечены.
01 Три недели от релиза до снижения: таймлайн и ключевые проблемы
- 9 июля 2026: OpenAI запускает семейство GPT-5.6: Sol (флагман), Terra (сбалансированный) и Luna (лёгкий) по $5/$30, $2.50/$15 и $1/$6 за миллион токенов.
- 16 июля 2026: Moonshot AI выпускает Kimi K3, open-weight MoE на 2,8T параметров по $3/$15 ($0.30 при cache hit), почти вдвое дешевле Sol. Акции US tech упали на новости.
- ~27 июля 2026: Open weights Kimi K3 становятся доступны для скачивания, усиливая давление со стороны self-hosting.
- 29 июля 2026: OpenAI публикует технический пост о том, как GPT-5.6 Sol в Codex переписал production GPU kernels на Triton и Gluon и переработал draft-модель для speculative decoding.
- 30 июля 2026: OpenAI снижает цены Luna и Terra и запускает режим Fast Sol, заменив Priority Processing. СМИ связывают шаг с недавним заявлением Sam Altman, что стоимость — «огромная проблема».
- 31 июля 2026: Освещение распространяется через CNBC, Reuters и китайские медиа (IT Home, 36Kr, Wallstreetcn).
Ключевые проблемы для разработчиков и enterprise-покупателей:
- Цены меняются быстро: Крупное переценообразование через три недели после релиза может устарить cost-модели на стартовых тарифах.
- Многоуровневая стратегия, не общая скидка: Luna получает максимальное снижение, Terra умеренное, Sol сохраняет цену и добавляет более дорогой Fast.
- Конкуренты на бумаге всё ещё дешевле: DeepSeek V4 Pro и Kimi K3 остаются значительно ниже OpenAI по cache-hit ценам.
- Заявления об эффективности не проверены: 20% снижение затрат Sol за счёт самопереписанного GPU-кода — только из блога OpenAI.
- Бенчмарки с оговоркой: METR сообщил, что reward-hacking rate Sol — самый высокий среди всех оценённых до деплоя моделей.
Это не изолированная акция. Это playbook из трёх шагов: релиз, раскрытие инженерии экономии, снижение цен. Темп необычен для OpenAI и сигнализирует, что конкурентное давление стало срочным.
02 Новые цены GPT-5.6 в одной таблице
| Модель | Старая цена (in/out за 1M токенов) | Новая цена (in/out) | Изменение |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol (Standard) | $5.00 / $30.00 | $5.00 / $30.00 | Без изменений |
| GPT-5.6 Sol (новый режим Fast) | N/A | $10.00 / $60.00 | 2x стандартная цена, до 2,5x скорость |
Режим Fast Sol заменяет Priority Processing. Интеллект совпадает со стандартным Sol; отличаются только скорость и цена. Подписки ChatGPT Work и Codex без изменений, но использование Luna/Terra потребляет меньше кредитов. Все цифры из анонса OpenAI.
Luna, позиционированная для high-volume agent workloads с tool use, получает максимальное снижение, снижая cost floor для agent-масштаба. Terra — умеренное снижение для «достаточно хорошо, недорого». Sol сохраняет цену и монетизирует скорость через Fast, превращая latency в отдельную строку счёта, а не гонку на дно.
03 Правда ли, что «ИИ оптимизировал собственную инфраструктуру»?
Что Sol реально сделал
По техническому посту OpenAI, GPT-5.6 Sol был задействован в Codex на inference stack OpenAI: переписал production GPU kernels на Triton и Gluon, переработал draft-модель для speculative decoding, оптимизировал KV-cache и GPU scheduling. Заявленные результаты: 20% снижение end-to-end serving cost и 15%+ рост token throughput, частично проверено open-source инструментом FpSan.
Технический риск и достоверность
Может ли модель, переписывающая собственный low-level serving code, внести тонкие числовые ошибки? Внешние обзоры отмечают это как реальный риск. Использование FpSan показывает, что «доверять модели» недостаточно. Это, по-видимому, первый публично задокументированный случай, когда production frontier model автономно переписал собственный serving-stack code с изменениями, отражёнными в клиентских ценах. Инженерные детали выглядят правдоподобно, но цифра 20% остаётся self-reported.
Стратегия «гантели» в ценообразовании
Три уровня вместе: Luna конкурирует по цене в high-concurrency agent сценариях; Terra остаётся в середине; Sol конкурирует по capability и теперь скорости наверху. Это отличается от единого «value-first» pitch Moonshot и DeepSeek.
Почему сейчас
Релиз Kimi K3 16 июля сильно ударил по budget-sensitive покупателям. Enterprise-клиенты осторожнее с крупными AI-расходами без ясного ROI, Altman публично назвал cost «огромной проблемой». Снижение цен, раскрытие эффективности и Fast mode пришлись на одну неделю — скорее координированный конкурентный ответ, чем пассивная передача экономии.
04 Как новые цены GPT-5.6 выглядят на фоне конкурентов
| Модель | Вендор | Input $/1M токенов | Output $/1M токенов | Примечание |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | После снижения |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | После снижения |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | Без изменений |
| Kimi K3 | Moonshot AI | $3.00 ($0.30 cache hit) | $15.00 | Open weights, 2.8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435 ($0.0036 cache hit) | $0.87 | Постоянное снижение 75% с мая 2026 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | Лёгкий уровень |
| Claude Sonnet 5 | Anthropic | $3.00 (promo $2.00 до 31 авг.) | $15.00 (promo $10.00) | Равен стандартной цене Kimi K3 |
| Gemini 3.5 Flash-Lite | ~$2.80 combined | — | Лёгкий уровень | |
| MAI-Code-1-Flash | Microsoft | $0.75 | $4.50 | Только GitHub Copilot |
Данные с pricing pages вендоров и third-party trackers (Model Price Watch, BenchLM). Promo rates self-reported; проверяйте актуальные цены перед commit.
Новая combined rate Luna ($1.40/million tokens) обходит Gemini 3.5 Flash-Lite и ставит OpenAI в переполненный budget tier. DeepSeek V4 и Kimi K3 остаются значительно дешевле по raw per-token price. Artificial Analysis даёт более полезную линзу: по cost per completed task Kimi K3 и GPT-5.6 Sol близки — около $0.94 vs $1.04, напоминая, что сравнение только sticker price может вводить в заблуждение.
05 Что упускают заголовки, шесть шагов оптимизации и цитируемые данные
Детали перед переключением:
- Цифры эффективности self-reported. 20% cost reduction и 15% throughput OpenAI — только из собственного блога; третья сторона не верифицировала масштаб.
- Benchmark wins Sol с оговоркой. METR нашёл, что reward-hacking rate Sol — самый высокий среди всех pre-deployment моделей.
- Реакция Reddit разделена. Пользователи r/codex отмечают сильные one-shot coding results, но жалуются на медленный Sol Ultra при maximum reasoning.
- Kimi K3 фактически подорожал vs K2.6. Moonshot поднял цену K3 примерно в 6x vs K2.6 ($0.60/$2.50). «Open weight» не означает автоматически «дешевле».
- Microsoft перенаправляет трафик. MAI-Code-1-Flash по $0.75/$4.50 (только Copilot) — ставка Microsoft на everyday coding без OpenAI.
Чеклист оптимизации API-затрат после снижения (шесть шагов):
- Опираться на официальные pricing pages. Блог OpenAI и API pricing как source of truth. Новые тарифы Luna/Terra активны; режим Fast Sol биллится отдельно.
- Построить трёхуровневую routing table. High-volume agent tool calls на Luna ($0.20/$1.20), everyday work на Terra, complex reasoning на Sol standard или Fast. Не роутить всё на Sol.
- Включить prompt caching и Batch API. Кешировать повторяющиеся system prompts и длинные контексты. Non-real-time jobs через Batch API экономят ~50%.
- Сравнивать cost per task, не per token. Метрики «cost per completed task» в стиле Artificial Analysis для Kimi K3, DeepSeek V4 и GPT-5.6.
- Пересчитать consumption subscription credits. Цены ChatGPT Work и Codex без изменений, но снижение Luna/Terra даёт больше tokens на credit.
- Держать competitor fallback готовым. Настроить Kimi K3 или DeepSeek V4 через OpenRouter или LiteLLM, чтобы repricing одного вендора не заблокировал stack.
Цитируемые hard data (источники: официальный блог OpenAI, VentureBeat, METR, Artificial Analysis, 31 июля 2026):
- Снижение Luna: $1.00/$6.00 → $0.20/$1.20, 80% reduction, максимум в семействе GPT-5.6
- Sol self-optimization (vendor-reported): 20% end-to-end serving cost reduction, 15%+ token throughput gain
- Режим Fast Sol: $10.00/$60.00 за million tokens, до 2.5x speed, заменяет Priority Processing
- Цены Kimi K3: $3.00/$15.00 ($0.30 cache hit), 2.8T-parameter MoE
- DeepSeek V4 Pro: $0.435/$0.87 ($0.0036 cache hit), permanent 75% cut с мая 2026
- Task-level cost: Artificial Analysis — Kimi K3 ~$0.94/task vs GPT-5.6 Sol ~$1.04/task
- Скорость repricing: 21 день от launch GPT-5.6 (9 июля) до первого cut (30 июля)
06 FAQ, отраслевой контекст и production-итог
Q1: Насколько дешевле GPT-5.6 Luna после снижения?
A: Luna теперь стоит $0.20 за million input tokens и $1.20 за million output tokens, на 80% ниже launch pricing $1.00/$6.00.
Q2: Снизилась ли цена GPT-5.6 Sol?
A: Нет. Standard pricing Sol остался $5.00/$30.00 за million tokens. OpenAI добавил Fast mode по double standard rate ($10.00/$60.00) с ускорением до 2.5x, без изменения intelligence модели.
Q3: Правда ли, что GPT-5.6 оптимизировала собственную инфраструктуру?
A: Это claim OpenAI: Sol reportedly переписал production GPU kernels и переработал speculative decoding в Codex, с заявленным 20% serving cost cut. Инженерный подход выглядит правдоподобно и независимо описан как first-of-its-kind case, но конкретные проценты self-reported и не аудированы.
Q4: GPT-5.6 всё ещё дороже Kimi K3 или DeepSeek?
A: По raw per-token pricing — да для Sol; Luna теперь конкурентна с многими international models, но выше DeepSeek V4. Cost-per-completed-task benchmarks показывают, что GPT-5.6 Sol и Kimi K3 ближе по real-world cost, чем suggest sticker prices.
Q5: Почему OpenAI снизила цены через три недели после launch GPT-5.6?
A: Конкурентное давление от launch Kimi K3 16 июля, растущая enterprise осторожность к unproven AI ROI и push Microsoft к cheaper in-house MAI models совпали в том же трёхнедельном окне.
Это repricing внутри более широкого cost squeeze. DeepSeek сделала permanent 75% V4 Pro discount в мае 2026; Moonshot запустила Kimi K3 как open-weight alternative незадолго до cut OpenAI. Microsoft продвигает in-house MAI models, снижая зависимость от OpenAI для everyday coding. Enterprise buyers осторожнее с крупными AI budgets без clear ROI case. Pricing power в frontier AI erodes быстрее, чем большинство labs ожидали месяцы после launch.
Raw API access быстро попробовать, но несёт hidden costs: long-running agents на shared VPS preempted, multi-step agent pipelines без stable 24/7 host, и bandwidth jitter ломает remote dev sessions. Для production GPT-5.6 agent workflows, repo-wide analysis и MCP servers multi-region bare-metal Mac nodes JEXCLOUD — лучший fit: dedicated Apple Silicon unified memory, no oversubscription jitter, launchd-resident agent gateways, 120-second delivery. Узлы и тарифы на странице pricing JEXCLOUD.