DeepSeek V4 Flash официально: бенчи близко к Opus 4.8, цена в десятки раз ниже, Pro ещё ждём
31 июля DeepSeek апгрейднул V4-Flash до официальной DeepSeek-V4-Flash-0731: параметры те же, только re-post-train. Agent-бенчи обошли более жирный V4-Pro preview, а цена — доля от Claude Opus 4.8. Флагман V4-Pro official и свой Agent-фреймворк Harness по-прежнему «coming soon».
Для AI-девов и тех, кто выбирает модель, разбираем три вещи: ① полный таймлайн с апрельского preview до «official» 31 июля; ② цены, архитектура, Harness и сравнение с Kimi K3, Qwen3.8-Max; ③ споры вокруг скоров, price war и чеклист из 6 шагов для безопасного подключения. Данные на 2026-08-05.
01 От апрельского preview к июльскому «official»: таймлайн и боль
Это не новый релиз модели, а re-post-train того же 284B total / 13B active. Настоящий флагман V4-Pro official и первый свой Agent-фреймворк Harness — «скоро», без даты.
- 24 апреля 2026: DeepSeek-V4 preview — open source, V4-Pro (1.6T/49B) + V4-Flash (284B/13B), 1M context, MIT.
- 24 июля 2026: legacy API
deepseek-chatиdeepseek-reasonerотключены, весь трафик на V4 naming. - 27 июля 2026: open weights Kimi K3 (2.8T) на Hugging Face — давление на DeepSeek.
- 31 июля 2026: V4-Flash-0731 official в API beta, weights на HF; changelog впервые называет Harness. Beta только API, app/web не синхронизированы.
- На 5 августа 2026: V4-Pro official — «как можно скорее». Китайские медиа цитируют анонимов про GA 10–20 августа — DeepSeek не подтверждал, только reference.
Боль разработчиков сейчас:
- Флагман не доставлен: V4-Pro official и Harness без release date; prod на Pro — preview дальше.
- Методология скоров: Agent-бенчи на undisclosed Harness «minimal mode»; официально просят не приравнивать к raw capability.
- API vs consumer split: 0731 official только API; app/web на старой версии.
- Конкурентный залп: Qwen3.8-Max (GA 2/8), Kimi K3 (weights 27/7), GPT-5.6 price cut сжимают окно выбора.
Flash на 284B обходит в Agent-бенчах V4-Pro preview в несколько раз толще — во второй половине 2026 post-train quality догоняет и местами обгоняет тупой scale параметров.
02 DeepSeek V4-Flash-0731: хард-данные
| Модель | Статус | Total/active | Context | Input ($/M, miss/hit cache) | Output $/M | Лицензия |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | Official (31/7) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | Preview (official TBD) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | Weights open (27/7) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | Open source (июнь 2026) | ~744B / ~40B | 1M | не верифицировано | не верифицировано | MIT |
| Qwen3.8-Max | API GA (2/8), weights pending | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | open source promised |
Цены — self-reported vendors. DeepSeek анонсировал «2× peak pricing» (Пекин 9–12, 14–18); дата старта на момент публикации не объявлена.
03 Архитектура та же, post-train новый: CSA+HCA и дебют Harness
V4-Flash-0731 — идентичные params и structure апрельскому preview; gain «полностью из re-post-train». По tech report три ключевых изменения V4:
- Hybrid attention: CSA + HCA как DSA sparse attention — меньше compute/VRAM на long context.
- mHC: manifold-constrained hyper-connections, патч residual stack.
- Muon optimizer: быстрее и стабильнее convergence vs legacy optimizers.
Official metrics (1M tokens): V4-Pro vs V3.2 — FLOPs/token 27%, KV Cache 10%. Independent repro пока не видели.
DeepSeek Harness — впервые в changelog 31/7: свой Agent runtime (files, tools, shell, E2E engineering), аналог Claude Code. До этого DeepSeek models жили на Claude Code, OpenCode и прочих third-party agent stacks.
Agent scores (Terminal Bench 2.0: 82.7 vs V4-Pro preview 67.9) — все на Harness «minimal mode» (max, top_p=0.95, temperature=1.0). Changelog: «scores очень harness-sensitive, не равно model capability».
| Benchmark | Flash-0731 | Flash preview | V4-Pro preview | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
04 Open-source melee: главное поле боя — price/perf
| Модель | Lab | Total params | Intelligence Index | Cost/task |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B | 50 | $0.03 |
| Kimi K3 | Moonshot | 2.8T | 57 | $0.86 |
| GLM-5.2 | Z.ai | ~744B | ~+1 vs V4-Flash | не верифицировано |
| GPT-5.6 Sol | OpenAI | undisclosed | +9+ vs V4-Flash | $1.86 |
| Claude Fable 5 | Anthropic | undisclosed | +9+ vs V4-Flash | $3.15 |
Intelligence Index и cost/task — Artificial Analysis (через финмедиа). DeepSeek scores — vendor; разделяем из-за разной методологии.
Контраст: на Artificial Analysis V4-Flash не top intelligence (ниже Kimi K3, GLM-5.2), но cost/task ~1/29 Kimi K3, ~1/62 GPT-5.6 Sol, ~1/105 Claude Fable 5. Стратегия DeepSeek — не «SOTA score», а «достаточный IQ + insane price»; отсюда 7 недель #1 на OpenRouter (preview).
В китайском dev-сообществе «斩杀线» (kill line): DeepSeek ставит price/perf bar — без явного perf win и более низкой цены модель просто выпадает из рынка.
05 Споры вокруг скоров, 6 шагов интеграции, citable data
Label everything, не overfit на vendor table:
- Harness dependency: Agent scores на undisclosed minimal mode — до community repro это «vendor + specific framework».
- Availability issues: медиа цитируют dev feedback — низкий cache hit rate, sporadic safety classifier timeouts.
- V4-Pro timeline unconfirmed: «10–20 августа GA» — anonymous sources; official changelog: «as soon as possible».
- Funding rumors: ~$7.4B raise, ~$48.7B valuation — «по слухам», без official/regulatory confirm.
6 шагов безопасного подключения V4-Flash-0731:
- API naming: model ID
deepseek-v4-flash(alias на 0731). Legacydeepseek-chat/deepseek-reasoner— migrate ASAP. - API key: DeepSeek Open Platform; balance + billing (включая peak 2× heads-up).
- Protocol: OpenAI ChatCompletions или Anthropic — pick
base_url, client code не трогаем. - Sandbox A/B: свои prod prompts vs Kimi K3 / Qwen3.8-Max blind — не мигрируй только по vendor leaderboard.
- Watch Harness drop: после public release repro official benches, cross-check Claude Code / Cursor.
- Local deploy plan: MIT weights на HF (
deepseek-ai/DeepSeek-V4-Flash-0731); 284B MoE = high-memory Apple Silicon или datacenter GPU cluster.
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
temperature=1.0,
top_p=0.95
)
Citable hard data (DeepSeek official, Artificial Analysis, 2026-08-05):
- Params: 284B total / 13B active; architecture = april preview
- Pricing: input $0.14/M (cache miss), $0.0028/M (hit); output $0.28/M
- Terminal Bench 2.1: 82.7 (vendor, Harness minimal mode)
- Artificial Analysis: Terminal-Bench 2.1 ~78.65% — delta 4.05 vs 82.7
- Price/perf: $0.03/task — ~1/29 Kimi K3, ~1/105 Claude Fable 5
- Long context efficiency: 1M tokens — FLOPs 27% vs V3.2, KV Cache 10% (vendor)
- vs Opus 4.8: input ~36× (miss), ~179× (hit), output ~89× cheaper (list prices)
- License: MIT; weights synced to Hugging Face
06 FAQ, контекст индустрии, prod wrap-up
Q: Главный diff V4 vs V3.2?
A: Native 1M context; сильно меньше compute/VRAM (V4-Pro: FLOPs 27%, KV Cache 10% vs V3.2). V4 заточен под Agent workloads.
Q: Flash или Pro на каждый день?
A: Chat, batch, cost-sensitive agent pipelines — V4-Flash-0731 (лучше agent scores чем Pro preview). Deep reasoning, budget не issue — Pro preview до official drop.
Q: V4 Pro official уже можно?
A: Нет на момент публикации. Official только V4-Flash-0731, API-only. Pro + Harness — «as soon as possible»; «10–20 августа» — unconfirmed rumor.
Q: Vendor scores DeepSeek — trust?
A: SWE-bench Verified (third-party) ок. Terminal Bench 2.0 etc. на undisclosed Harness — жди independent repro (Claude Code, Cursor).
Q: Практический impact для dev?
A: OpenAI/Anthropic-compatible API; deepseek-v4-flash auto-routes на новую версию. Legacy names — switch fast.
До V4 GA китайское AI-коммunity trollило Liang Wenfeng как «梁白开» (игра слов: пустое ожидание). После 0731 — «梁圣» вернулся из-за overdelivery. Structurally важнее kill-line effect — отсюда GPT-5.6 Luna −80% и прочие price moves. 31 июля NVIDIA, Broadcom, AMD не дёрнулись — рынок привык к «DeepSeek efficiency breakthrough» narrative.
Чистый API call — low barrier, но long-running agents на shared VPS ловят memory jitter и dropped long connections; 284B local deploy = 96GB+ unified memory; parallel toolchains без stable 7×24 host — боль. Для prod OpenClaw / Claude Code / Cursor Agent remote gateway JEXCLOUD multi-region bare-metal Mac — dedicated Apple Silicon unified memory, no oversell bandwidth jitter, launchd-persistent agents, 120s deploy. Nodes и pricing: JEXCLOUD pricing.