AI Agent Open-source LLM 2026.07.20

DeepSeek V4 GA: полная версия — pricing, архитектура и gap к GPT-5.6

Три месяца ожидания — и DeepSeek V4 GA (полная версия) официально в проде с 20 июля 2026. Относительно апрельского preview GA даёт измеримый прирост в agent capabilities, math reasoning и code generation, плюс впервые вводит peak-off-peak pricing — сигнал перехода от «почти бесплатно» к структурированной коммерческой платформе.

Для AI-разработчиков, indie и enterprise-инженеров разберём три блока: ① полный таймлайн preview → GA и архитектурные фишки (CSA+HCA, mHC, Muon); ② бенчмарки с SWE-bench Verified 80.6% и head-to-head с GPT-5.6 и Claude Fable 5; ③ как считать peak-off-peak и мигрировать API до дедлайна 24 июля для deepseek-chat / deepseek-reasoner.

01 Таймлайн: от preview к полной GA-версии

Текущие pain points у разработчиков:

  • Legacy API sunset: deepseek-chat и deepseek-reasoner 24 июля уходят навсегда — немигрированный прод ломается.
  • Сложность peak-off-peak: GA вводит time-based pricing; в peak часы тариф ×2, незапланированный batch = скрытый overcharge.
  • Closed-source cost pressure: Claude Fable 5 output $50/M, GPT-5.6 Sol ~$15/M — high-frequency agent calls неподъёмны.
  • 1M context в проде: многие модели заявляют 1M token, но KV Cache RAM делает deploy дорогим.
DeepSeek V4: ключевые вехи preview → GA
Дата Событие
2026-04-24V4 preview online + open source (MIT): V4-Pro (1.6T) и V4-Flash (284B)
2026-05Production-tuned V4-Flash/Pro, API generally available
2026-06V4-Pro permanent -75% (output $0.87/M tokens)
2026-06-29Email всем API-пользователям: GA mid-July, первое раскрытие peak-off-peak схемы
2026-07-19GA gray access для selected devs, пресса: «полная версия завтра»
2026-07-20GA officially live (дата публикации)
2026-07-24Legacy names deepseek-chat и deepseek-reasoner permanently retired

Коротко: preview уже был сильным; GA точечно прокачивает agent, math и code и добавляет формальную коммерческую pricing-модель.

02 Архитектура: как 1M context реально работает

Спеки V4-Pro vs V4-Flash
Параметр V4-Pro V4-Flash
Total params1.6 трлн (1.6T)284 млрд (284B)
Active params/token49 млрд (49B)13 млрд (13B)
Transformer layers6143
Context window1 000 000 tokens1 000 000 tokens
Max output384K tokens384K tokens
PrecisionFP4 (experts) + FP8 (rest)FP4 + FP8 mixed
Pretrain data33T+ tokens32T+ tokens
LicenseMITMIT

Hybrid attention (CSA + HCA)

DeepSeek V4 сбрасывает MLA из V2/V3 и строит гибрид из двух новых механизмов:

  • Compressed Sparse Attention (CSA): KV sequence сжимается 4× через Softmax-gated pooling; FP4 «lightning indexer» для top-k selection (Pro: top-1024, Flash: top-512); sliding window 128 tokens. На 1M context — только 27% FLOPs от V3.2.
  • Heavily Compressed Attention (HCA): tokens сжимаются 128×, затем global dense attention для long-range dependencies; Flash: первые 2 слоя HCA, далее CSA/HCA чередуются; Pro — аналогично.

Итог: KV Cache memory на 1M context — 10% от V3.2 (V4-Flash до 7%).

Manifold-Constrained Hyper-Connections (mHC)

Апгрейд классических residual connections: 4-channel residual stream, mixing matrix с doubly-stochastic constraint (Birkhoff polytope) — стабильная signal propagation через 61 layer.

Muon optimizer

Training на Muon вместо AdamW; Newton-Schulz orthogonalization градиентов — faster convergence, стабильнее training curve.

Три inference mode
Mode Характеристика Use case
Non-thinkБез chain-of-thought, max speedПростые Q&A, routing
Think HighExplicit reasoning (<redacted_thinking>)Средняя сложность, code debug
Think MaxMax reasoning depth, нужен 384K+ contextСложная математика, long-chain agents

Official sampling params: temperature=1.0, top_p=1.0 (все modes). Local deploy: ds4 high-memory Mac inference guide.

03 Бенчмарки: open-source leaderboard

Core metrics V4-Pro
Benchmark DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified80.6%96.0%не опубликован отдельно~69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3 206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified — real GitHub bug fixes; 80.6% — текущий open-source record, паритет с Gemini 3.1 Pro. SWE-bench Pro строже; Claude Fable 5 лидирует с 80.3%.

Cost/performance (Artificial Analysis):

  • Claude Fable 5: Strategy & Ops Index tasks — $3.48/run, score 50
  • DeepSeek V4-Pro: те же tasks — $0.03/run, score 38
  • DeepSeek V4-Flash: все шесть index categories — ниже $0.04/run

Fable 5 дороже V4-Pro в 116× при gap ~12 points (31%). Для большинства prod-сценариев V4-Pro — лучший price/performance.

04 V4 vs GPT-5.6: positioning и peak-off-peak pricing

DeepSeek V4-Pro vs GPT-5.6 Sol vs Claude Fable 5
Dimension DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
Open source / self-hostMIT, даclosed sourceclosed source
Context window1M tokensне раскрыт1M tokens
Code capabilityочень сильный (близко к Fable 5)очень сильныйсильнейший
API output (off-peak)$0.87/M~$15/M$50/M
API output (peak)$1.74/M
Data privacyprivate deploy возможен

Scenario matrix: tight budget / high-frequency / private deploy → V4-Pro или V4-Flash; max code quality → Claude Fable 5; complex algorithms + math → GPT-5.6 Sol/Ultra; massive log processing → V4-Flash (cache-hit input $0.0028/M).

Полная peak-off-peak price table (GA new)
Model Line item Off-peak Peak
V4-ProInput (cache hit)¥0.025 / $0.0035 / 1M×2
Input (cache miss)¥3.00 / $0.435 / 1M¥6.00 / $0.87
Output¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-FlashInput (cache hit)¥0.02 / $0.0028 / 1M×2
Input (cache miss)¥1.00 / $0.14 / 1M¥2.00 / $0.28
Output¥2.00 / $0.28 / 1M¥4.00 / $0.56

Peak hours (Beijing time): будни 09:00–12:00 и 14:00–18:00. Cost optimization: batch jobs в off-peak; Prompt Cache; простые tasks на V4-Flash; DeepSeek обещает email за 24 часа до pricing changes. Даже в peak: V4-Pro output $1.74/M — 8.6× дешевле Claude Opus 4.8 ($15/M).

05 deepseek-chat sunset: 6-step API migration до 24 июля

Critical: legacy names deepseek-chat и deepseek-reasoner permanently stop at 24 июля 2026, 15:59 UTC (23:59 Beijing).

Migration mapping
Old model New model Note
deepseek-chatdeepseek-v4-flash (non-think)Fast, light tasks
deepseek-reasonerdeepseek-v4-flash (think mode)или upgrade на deepseek-v4-pro

6 шагов:

  1. Repo-wide search: найти все references на deepseek-chat и deepseek-reasoner.
  2. Replacement strategy: light dialog → deepseek-v4-flash; complex reasoning → deepseek-v4-pro + Think High/Max.
  3. Update OpenAI SDK call: менять только model, base_url остаётся https://api.deepseek.com.
  4. Configure think mode: ex-reasoner users через extra_body; Think Max требует 384K+ context.
  5. Staging validation: до 24 июля прогнать core use cases в pre-prod, проверить latency и cost.
  6. Peak-off-peak monitoring: schedule batch jobs по Beijing time, включить cache hit для input cost.
deepseek_v4_migration.py
client.chat.completions.create(model="deepseek-chat", messages=[...])

client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4 поддерживает OpenAI ChatCompletions и Anthropic Messages — Anthropic SDK: только update model, base_url="https://api.deepseek.com" без изменений.

Citeable hard data (DeepSeek official, 2026-07-20):

  • SWE-bench Verified: 80.6%, open-source record, паритет с Gemini 3.1 Pro
  • KV Cache efficiency: 1M context — 10% от V3.2 (Flash 7%)
  • Cost/performance: V4-Pro $0.03 vs Fable 5 $3.48 per task, factor 116×
  • Peak output: V4-Pro $1.74/M, 8.6× cheaper than Opus 4.8
  • Migration deadline: 2026-07-24 23:59 Beijing, legacy API permanently off
  • Sources: DeepSeek docs, arXiv:2606.19348, HuggingFace, Artificial Analysis

06 Итог: GA full version и prod hardening

DeepSeek V4 GA — один из ключевых open-source milestones 2026. Ценность не в том, чтобы сразу обогнать Claude Fable 5 или GPT-5.6, а в лучшей open-source performance за 1/10–1/100 стоимости closed-source flagship.

Target audience: компании с data residency requirements, budget-conscious indie devs, agent engineers с 1M context, AI product teams на ROI. Peak-off-peak усложняет cost model, но остаётся highly competitive — переход от «price disruptor» к regulated platform = maturity signal, не regression.

Если вы ещё на deepseek-chat — миграция до 24 июля, иначе hard outage.

Чистый API call даёт быстрый V4 access, но скрывает три hidden costs: 1M context agent на shared VPS упирается в RAM, peak-off-peak batch inference без stable scheduling host, local MIT weights inference требует high-UM Mac hardware. Для 7×24 DeepSeek agent pipelines, ds4 local inference или long-context MCP Server — JEXCLOUD multi-region bare-metal Mac лучший fit: dedicated Apple Silicon unified memory, no overselling, launchd persistent gateway, 120-second provisioning. Nodes и pricing: JEXCLOUD pricing page.