AI Agent Open Source LLM 2026.08.05

DeepSeek V4 Flash официально: бенчи близко к Opus 4.8, цена в десятки раз ниже, Pro ещё ждём

31 июля DeepSeek апгрейднул V4-Flash до официальной DeepSeek-V4-Flash-0731: параметры те же, только re-post-train. Agent-бенчи обошли более жирный V4-Pro preview, а цена — доля от Claude Opus 4.8. Флагман V4-Pro official и свой Agent-фреймворк Harness по-прежнему «coming soon».

Для AI-девов и тех, кто выбирает модель, разбираем три вещи: ① полный таймлайн с апрельского preview до «official» 31 июля; ② цены, архитектура, Harness и сравнение с Kimi K3, Qwen3.8-Max; ③ споры вокруг скоров, price war и чеклист из 6 шагов для безопасного подключения. Данные на 2026-08-05.

01 От апрельского preview к июльскому «official»: таймлайн и боль

Это не новый релиз модели, а re-post-train того же 284B total / 13B active. Настоящий флагман V4-Pro official и первый свой Agent-фреймворк Harness — «скоро», без даты.

  • 24 апреля 2026: DeepSeek-V4 preview — open source, V4-Pro (1.6T/49B) + V4-Flash (284B/13B), 1M context, MIT.
  • 24 июля 2026: legacy API deepseek-chat и deepseek-reasoner отключены, весь трафик на V4 naming.
  • 27 июля 2026: open weights Kimi K3 (2.8T) на Hugging Face — давление на DeepSeek.
  • 31 июля 2026: V4-Flash-0731 official в API beta, weights на HF; changelog впервые называет Harness. Beta только API, app/web не синхронизированы.
  • На 5 августа 2026: V4-Pro official — «как можно скорее». Китайские медиа цитируют анонимов про GA 10–20 августа — DeepSeek не подтверждал, только reference.

Боль разработчиков сейчас:

  • Флагман не доставлен: V4-Pro official и Harness без release date; prod на Pro — preview дальше.
  • Методология скоров: Agent-бенчи на undisclosed Harness «minimal mode»; официально просят не приравнивать к raw capability.
  • API vs consumer split: 0731 official только API; app/web на старой версии.
  • Конкурентный залп: Qwen3.8-Max (GA 2/8), Kimi K3 (weights 27/7), GPT-5.6 price cut сжимают окно выбора.

Flash на 284B обходит в Agent-бенчах V4-Pro preview в несколько раз толще — во второй половине 2026 post-train quality догоняет и местами обгоняет тупой scale параметров.

02 DeepSeek V4-Flash-0731: хард-данные

Цены и параметры топ open-source LLM (2026-08-05)
Модель Статус Total/active Context Input ($/M, miss/hit cache) Output $/M Лицензия
DeepSeek-V4-Flash-0731Official (31/7)284B / 13B1M$0.14 / $0.0028$0.28MIT
DeepSeek-V4-ProPreview (official TBD)1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3Weights open (27/7)2.8T / ~104B~1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2Open source (июнь 2026)~744B / ~40B1Mне верифицированоне верифицированоMIT
Qwen3.8-MaxAPI GA (2/8), weights pending2.4T / 95B1M$2.00 / ~$0.17–0.25$6.00open source promised

Цены — self-reported vendors. DeepSeek анонсировал «2× peak pricing» (Пекин 9–12, 14–18); дата старта на момент публикации не объявлена.

03 Архитектура та же, post-train новый: CSA+HCA и дебют Harness

V4-Flash-0731 — идентичные params и structure апрельскому preview; gain «полностью из re-post-train». По tech report три ключевых изменения V4:

  • Hybrid attention: CSA + HCA как DSA sparse attention — меньше compute/VRAM на long context.
  • mHC: manifold-constrained hyper-connections, патч residual stack.
  • Muon optimizer: быстрее и стабильнее convergence vs legacy optimizers.

Official metrics (1M tokens): V4-Pro vs V3.2 — FLOPs/token 27%, KV Cache 10%. Independent repro пока не видели.

DeepSeek Harness — впервые в changelog 31/7: свой Agent runtime (files, tools, shell, E2E engineering), аналог Claude Code. До этого DeepSeek models жили на Claude Code, OpenCode и прочих third-party agent stacks.

Agent scores (Terminal Bench 2.0: 82.7 vs V4-Pro preview 67.9) — все на Harness «minimal mode» (max, top_p=0.95, temperature=1.0). Changelog: «scores очень harness-sensitive, не равно model capability».

DeepSeek Agent benchmarks (vendor self-report, Harness minimal mode)
Benchmark Flash-0731 Flash preview V4-Pro preview Opus 4.8
Terminal Bench 2.182.761.872.185.0
NL2Repo54.239.438.569.7
DeepSWE54.47.312.858.0
Toolathlon-Verified70.349.755.976.2

04 Open-source melee: главное поле боя — price/perf

Artificial Analysis: Intelligence Index и cost/task (third-party)
Модель Lab Total params Intelligence Index Cost/task
DeepSeek-V4-Flash-0731DeepSeek284B50$0.03
Kimi K3Moonshot2.8T57$0.86
GLM-5.2Z.ai~744B~+1 vs V4-Flashне верифицировано
GPT-5.6 SolOpenAIundisclosed+9+ vs V4-Flash$1.86
Claude Fable 5Anthropicundisclosed+9+ vs V4-Flash$3.15

Intelligence Index и cost/task — Artificial Analysis (через финмедиа). DeepSeek scores — vendor; разделяем из-за разной методологии.

Контраст: на Artificial Analysis V4-Flash не top intelligence (ниже Kimi K3, GLM-5.2), но cost/task ~1/29 Kimi K3, ~1/62 GPT-5.6 Sol, ~1/105 Claude Fable 5. Стратегия DeepSeek — не «SOTA score», а «достаточный IQ + insane price»; отсюда 7 недель #1 на OpenRouter (preview).

В китайском dev-сообществе «斩杀线» (kill line): DeepSeek ставит price/perf bar — без явного perf win и более низкой цены модель просто выпадает из рынка.

05 Споры вокруг скоров, 6 шагов интеграции, citable data

Label everything, не overfit на vendor table:

  • Harness dependency: Agent scores на undisclosed minimal mode — до community repro это «vendor + specific framework».
  • Availability issues: медиа цитируют dev feedback — низкий cache hit rate, sporadic safety classifier timeouts.
  • V4-Pro timeline unconfirmed: «10–20 августа GA» — anonymous sources; official changelog: «as soon as possible».
  • Funding rumors: ~$7.4B raise, ~$48.7B valuation — «по слухам», без official/regulatory confirm.

6 шагов безопасного подключения V4-Flash-0731:

  1. API naming: model ID deepseek-v4-flash (alias на 0731). Legacy deepseek-chat/deepseek-reasoner — migrate ASAP.
  2. API key: DeepSeek Open Platform; balance + billing (включая peak 2× heads-up).
  3. Protocol: OpenAI ChatCompletions или Anthropic — pick base_url, client code не трогаем.
  4. Sandbox A/B: свои prod prompts vs Kimi K3 / Qwen3.8-Max blind — не мигрируй только по vendor leaderboard.
  5. Watch Harness drop: после public release repro official benches, cross-check Claude Code / Cursor.
  6. Local deploy plan: MIT weights на HF (deepseek-ai/DeepSeek-V4-Flash-0731); 284B MoE = high-memory Apple Silicon или datacenter GPU cluster.
deepseek_v4_flash_api.py
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "Review this Agent workflow..."}],
    temperature=1.0,
    top_p=0.95
)

Citable hard data (DeepSeek official, Artificial Analysis, 2026-08-05):

  • Params: 284B total / 13B active; architecture = april preview
  • Pricing: input $0.14/M (cache miss), $0.0028/M (hit); output $0.28/M
  • Terminal Bench 2.1: 82.7 (vendor, Harness minimal mode)
  • Artificial Analysis: Terminal-Bench 2.1 ~78.65% — delta 4.05 vs 82.7
  • Price/perf: $0.03/task — ~1/29 Kimi K3, ~1/105 Claude Fable 5
  • Long context efficiency: 1M tokens — FLOPs 27% vs V3.2, KV Cache 10% (vendor)
  • vs Opus 4.8: input ~36× (miss), ~179× (hit), output ~89× cheaper (list prices)
  • License: MIT; weights synced to Hugging Face

06 FAQ, контекст индустрии, prod wrap-up

Q: Главный diff V4 vs V3.2?
A: Native 1M context; сильно меньше compute/VRAM (V4-Pro: FLOPs 27%, KV Cache 10% vs V3.2). V4 заточен под Agent workloads.

Q: Flash или Pro на каждый день?
A: Chat, batch, cost-sensitive agent pipelines — V4-Flash-0731 (лучше agent scores чем Pro preview). Deep reasoning, budget не issue — Pro preview до official drop.

Q: V4 Pro official уже можно?
A: Нет на момент публикации. Official только V4-Flash-0731, API-only. Pro + Harness — «as soon as possible»; «10–20 августа» — unconfirmed rumor.

Q: Vendor scores DeepSeek — trust?
A: SWE-bench Verified (third-party) ок. Terminal Bench 2.0 etc. на undisclosed Harness — жди independent repro (Claude Code, Cursor).

Q: Практический impact для dev?
A: OpenAI/Anthropic-compatible API; deepseek-v4-flash auto-routes на новую версию. Legacy names — switch fast.

До V4 GA китайское AI-коммunity trollило Liang Wenfeng как «梁白开» (игра слов: пустое ожидание). После 0731 — «梁圣» вернулся из-за overdelivery. Structurally важнее kill-line effect — отсюда GPT-5.6 Luna −80% и прочие price moves. 31 июля NVIDIA, Broadcom, AMD не дёрнулись — рынок привык к «DeepSeek efficiency breakthrough» narrative.

Чистый API call — low barrier, но long-running agents на shared VPS ловят memory jitter и dropped long connections; 284B local deploy = 96GB+ unified memory; parallel toolchains без stable 7×24 host — боль. Для prod OpenClaw / Claude Code / Cursor Agent remote gateway JEXCLOUD multi-region bare-metal Mac — dedicated Apple Silicon unified memory, no oversell bandwidth jitter, launchd-persistent agents, 120s deploy. Nodes и pricing: JEXCLOUD pricing.