DeepSeek V4 GA: полная версия — pricing, архитектура и gap к GPT-5.6
Три месяца ожидания — и DeepSeek V4 GA (полная версия) официально в проде с 20 июля 2026. Относительно апрельского preview GA даёт измеримый прирост в agent capabilities, math reasoning и code generation, плюс впервые вводит peak-off-peak pricing — сигнал перехода от «почти бесплатно» к структурированной коммерческой платформе.
Для AI-разработчиков, indie и enterprise-инженеров разберём три блока: ① полный таймлайн preview → GA и архитектурные фишки (CSA+HCA, mHC, Muon); ② бенчмарки с SWE-bench Verified 80.6% и head-to-head с GPT-5.6 и Claude Fable 5; ③ как считать peak-off-peak и мигрировать API до дедлайна 24 июля для deepseek-chat / deepseek-reasoner.
01 Таймлайн: от preview к полной GA-версии
Текущие pain points у разработчиков:
- Legacy API sunset:
deepseek-chatиdeepseek-reasoner24 июля уходят навсегда — немигрированный прод ломается. - Сложность peak-off-peak: GA вводит time-based pricing; в peak часы тариф ×2, незапланированный batch = скрытый overcharge.
- Closed-source cost pressure: Claude Fable 5 output $50/M, GPT-5.6 Sol ~$15/M — high-frequency agent calls неподъёмны.
- 1M context в проде: многие модели заявляют 1M token, но KV Cache RAM делает deploy дорогим.
| Дата | Событие |
|---|---|
| 2026-04-24 | V4 preview online + open source (MIT): V4-Pro (1.6T) и V4-Flash (284B) |
| 2026-05 | Production-tuned V4-Flash/Pro, API generally available |
| 2026-06 | V4-Pro permanent -75% (output $0.87/M tokens) |
| 2026-06-29 | Email всем API-пользователям: GA mid-July, первое раскрытие peak-off-peak схемы |
| 2026-07-19 | GA gray access для selected devs, пресса: «полная версия завтра» |
| 2026-07-20 | GA officially live (дата публикации) |
| 2026-07-24 | Legacy names deepseek-chat и deepseek-reasoner permanently retired |
Коротко: preview уже был сильным; GA точечно прокачивает agent, math и code и добавляет формальную коммерческую pricing-модель.
02 Архитектура: как 1M context реально работает
| Параметр | V4-Pro | V4-Flash |
|---|---|---|
| Total params | 1.6 трлн (1.6T) | 284 млрд (284B) |
| Active params/token | 49 млрд (49B) | 13 млрд (13B) |
| Transformer layers | 61 | 43 |
| Context window | 1 000 000 tokens | 1 000 000 tokens |
| Max output | 384K tokens | 384K tokens |
| Precision | FP4 (experts) + FP8 (rest) | FP4 + FP8 mixed |
| Pretrain data | 33T+ tokens | 32T+ tokens |
| License | MIT | MIT |
Hybrid attention (CSA + HCA)
DeepSeek V4 сбрасывает MLA из V2/V3 и строит гибрид из двух новых механизмов:
- Compressed Sparse Attention (CSA): KV sequence сжимается 4× через Softmax-gated pooling; FP4 «lightning indexer» для top-k selection (Pro: top-1024, Flash: top-512); sliding window 128 tokens. На 1M context — только 27% FLOPs от V3.2.
- Heavily Compressed Attention (HCA): tokens сжимаются 128×, затем global dense attention для long-range dependencies; Flash: первые 2 слоя HCA, далее CSA/HCA чередуются; Pro — аналогично.
Итог: KV Cache memory на 1M context — 10% от V3.2 (V4-Flash до 7%).
Manifold-Constrained Hyper-Connections (mHC)
Апгрейд классических residual connections: 4-channel residual stream, mixing matrix с doubly-stochastic constraint (Birkhoff polytope) — стабильная signal propagation через 61 layer.
Muon optimizer
Training на Muon вместо AdamW; Newton-Schulz orthogonalization градиентов — faster convergence, стабильнее training curve.
| Mode | Характеристика | Use case |
|---|---|---|
| Non-think | Без chain-of-thought, max speed | Простые Q&A, routing |
| Think High | Explicit reasoning (<redacted_thinking>) | Средняя сложность, code debug |
| Think Max | Max reasoning depth, нужен 384K+ context | Сложная математика, long-chain agents |
Official sampling params: temperature=1.0, top_p=1.0 (все modes). Local deploy: ds4 high-memory Mac inference guide.
03 Бенчмарки: open-source leaderboard
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 96.0% | не опубликован отдельно | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3 206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified — real GitHub bug fixes; 80.6% — текущий open-source record, паритет с Gemini 3.1 Pro. SWE-bench Pro строже; Claude Fable 5 лидирует с 80.3%.
Cost/performance (Artificial Analysis):
- Claude Fable 5: Strategy & Ops Index tasks — $3.48/run, score 50
- DeepSeek V4-Pro: те же tasks — $0.03/run, score 38
- DeepSeek V4-Flash: все шесть index categories — ниже $0.04/run
Fable 5 дороже V4-Pro в 116× при gap ~12 points (31%). Для большинства prod-сценариев V4-Pro — лучший price/performance.
04 V4 vs GPT-5.6: positioning и peak-off-peak pricing
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open source / self-host | MIT, да | closed source | closed source |
| Context window | 1M tokens | не раскрыт | 1M tokens |
| Code capability | очень сильный (близко к Fable 5) | очень сильный | сильнейший |
| API output (off-peak) | $0.87/M | ~$15/M | $50/M |
| API output (peak) | $1.74/M | — | — |
| Data privacy | private deploy возможен | — | — |
Scenario matrix: tight budget / high-frequency / private deploy → V4-Pro или V4-Flash; max code quality → Claude Fable 5; complex algorithms + math → GPT-5.6 Sol/Ultra; massive log processing → V4-Flash (cache-hit input $0.0028/M).
| Model | Line item | Off-peak | Peak |
|---|---|---|---|
| V4-Pro | Input (cache hit) | ¥0.025 / $0.0035 / 1M | ×2 |
| Input (cache miss) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| Output | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | Input (cache hit) | ¥0.02 / $0.0028 / 1M | ×2 |
| Input (cache miss) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| Output | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
Peak hours (Beijing time): будни 09:00–12:00 и 14:00–18:00. Cost optimization: batch jobs в off-peak; Prompt Cache; простые tasks на V4-Flash; DeepSeek обещает email за 24 часа до pricing changes. Даже в peak: V4-Pro output $1.74/M — 8.6× дешевле Claude Opus 4.8 ($15/M).
05 deepseek-chat sunset: 6-step API migration до 24 июля
Critical: legacy names deepseek-chat и deepseek-reasoner permanently stop at 24 июля 2026, 15:59 UTC (23:59 Beijing).
| Old model | New model | Note |
|---|---|---|
deepseek-chat | deepseek-v4-flash (non-think) | Fast, light tasks |
deepseek-reasoner | deepseek-v4-flash (think mode) | или upgrade на deepseek-v4-pro |
6 шагов:
- Repo-wide search: найти все references на
deepseek-chatиdeepseek-reasoner. - Replacement strategy: light dialog →
deepseek-v4-flash; complex reasoning →deepseek-v4-pro+ Think High/Max. - Update OpenAI SDK call: менять только
model,base_urlостаётсяhttps://api.deepseek.com. - Configure think mode: ex-reasoner users через
extra_body; Think Max требует 384K+ context. - Staging validation: до 24 июля прогнать core use cases в pre-prod, проверить latency и cost.
- Peak-off-peak monitoring: schedule batch jobs по Beijing time, включить cache hit для input cost.
client.chat.completions.create(model="deepseek-chat", messages=[...])
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — Anthropic SDK: только update model, base_url="https://api.deepseek.com" без изменений.
Citeable hard data (DeepSeek official, 2026-07-20):
- SWE-bench Verified: 80.6%, open-source record, паритет с Gemini 3.1 Pro
- KV Cache efficiency: 1M context — 10% от V3.2 (Flash 7%)
- Cost/performance: V4-Pro $0.03 vs Fable 5 $3.48 per task, factor 116×
- Peak output: V4-Pro $1.74/M, 8.6× cheaper than Opus 4.8
- Migration deadline: 2026-07-24 23:59 Beijing, legacy API permanently off
- Sources: DeepSeek docs, arXiv:2606.19348, HuggingFace, Artificial Analysis
06 Итог: GA full version и prod hardening
DeepSeek V4 GA — один из ключевых open-source milestones 2026. Ценность не в том, чтобы сразу обогнать Claude Fable 5 или GPT-5.6, а в лучшей open-source performance за 1/10–1/100 стоимости closed-source flagship.
Target audience: компании с data residency requirements, budget-conscious indie devs, agent engineers с 1M context, AI product teams на ROI. Peak-off-peak усложняет cost model, но остаётся highly competitive — переход от «price disruptor» к regulated platform = maturity signal, не regression.
Если вы ещё на deepseek-chat — миграция до 24 июля, иначе hard outage.
Чистый API call даёт быстрый V4 access, но скрывает три hidden costs: 1M context agent на shared VPS упирается в RAM, peak-off-peak batch inference без stable scheduling host, local MIT weights inference требует high-UM Mac hardware. Для 7×24 DeepSeek agent pipelines, ds4 local inference или long-context MCP Server — JEXCLOUD multi-region bare-metal Mac лучший fit: dedicated Apple Silicon unified memory, no overselling, launchd persistent gateway, 120-second provisioning. Nodes и pricing: JEXCLOUD pricing page.