DeepSeek V4 Flash 正式版上線:跑分逼近 Opus 4.8, 價格卻只要幾十分之一,Pro 版還要再等等
7 月 31 日,DeepSeek 將 V4-Flash 升級為官方版 DeepSeek-V4-Flash-0731:參數規模不變、僅重新後訓練,Agent 跑分反超更大的 V4-Pro 預覽版,價格僅為 Claude Opus 4.8 的幾十分之一。旗艦 V4-Pro 官方版與自研 Agent 框架 Harness 仍未上線。
面向 AI 開發者與模型選型決策者,本文將回答三件事:① 從 4 月預覽到 7 月 31 日「官方版」的完整時間線;② 定價、架構與 Harness 的核心數據及與 Kimi K3、Qwen3.8-Max 的橫向對比;③ 跑分爭議、「斬殺線」價格戰與六步安全接入清單。數據截止 2026-08-05。
01 從 4 月預覽到 7 月「官方版」:時間線與核心痛點
這不是一次新模型發布,而是同一個 284B 總參數 / 13B 激活 模型重新做了一遍後訓練。真正的旗艦 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍處於「即將發布」狀態,沒有確切日期。
- 2026 年 4 月 24 日:DeepSeek-V4 預覽版首次發布並開源,含 V4-Pro(1.6T/49B)與 V4-Flash(284B/13B),均支援 100 萬 token 上下文,MIT 協議。
- 2026 年 7 月 24 日:舊介面
deepseek-chat與deepseek-reasoner正式停用,全部流量切換到 V4 系列命名。 - 2026 年 7 月 27 日:Kimi K3(2.8T 總參數)開源權重上線 Hugging Face,給 DeepSeek 製造競爭壓力。
- 2026 年 7 月 31 日:V4-Flash-0731 正式版進入 API 公測,開源權重同步上線 Hugging Face;changelog 首次點名自研 Agent 框架 Harness。本次公測僅限 API,App 和網頁端暫未同步。
- 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「盡快發布」。中國大陸媒體援引未署名消息源稱 GA 窗口可能在 8 月 10–20 日——未經 DeepSeek 官方證實,僅供參考。
開發者當前面臨的核心痛點:
- 旗艦仍未兌現:V4-Pro 官方版與 Harness 框架尚無發布日期,生產環境若依賴 Pro 能力需繼續用預覽版。
- 跑分方法敏感:Agent 類基準全部基於未公開的 Harness「極簡模式」測得,官方自己提示勿簡單等同於模型能力。
- API 與消費端割裂:0731 正式版僅 API 可用,App/網頁端仍是舊版本,體驗不一致。
- 競品密集發布:Qwen3.8-Max(8/2 GA)、Kimi K3(7/27 權重)與 GPT-5.6 降價 同期擠壓選型窗口。
284B 參數的 Flash 版本在多項 Agent 基準上超過了參數量是自己好幾倍的 V4-Pro 預覽版——2026 年下半年大模型競爭,後訓練品質的重要性正在逼近甚至超過單純堆參數。
02 DeepSeek V4-Flash-0731 核心數據一覽
| 模型 | 狀態 | 總/激活參數 | 上下文 | 輸入價(未命中/命中 $/M) | 輸出價 $/M | 協議 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(官方版未發布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(7/27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 開源(2026 年 6 月) | ~744B / ~40B | 1M | 未核實 | 未核實 | MIT |
| Qwen3.8-Max | API GA(8/2),權重待釋出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源 |
以上定價均為廠商自報公開數據。DeepSeek 已預告未來將對 API 啟用「高峰時段 2 倍加價」(北京時間 9–12 點、14–18 點),截至發稿未公布具體生效日期。
03 架構沒變,變的是後訓練:CSA+HCA 與 Harness 首次亮相
V4-Flash-0731 在參數規模、模型結構上與 4 月預覽版完全相同,性能提升「完全來自重新進行的後訓練」。根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構三處關鍵改動:
- 混合注意力架構:結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),對外統一稱為 DSA 稀疏注意力,降低長上下文計算與顯存開銷。
- 流形約束超連接(mHC):對傳統殘差連接結構做了改進。
- Muon 優化器:替換傳統優化器,提升訓練收斂速度與穩定性。
官方指標:在 100 萬 token 上下文下,V4-Pro 相比前代 V3.2,單 token 推理所需 FLOPs 僅為 27%,KV Cache 占用僅為 10%。尚未看到獨立第三方復現驗證。
DeepSeek Harness 是 7 月 31 日 changelog 首次正式點名的自研 Agent 執行框架,用於讀寫檔案、呼叫工具、執行命令、完成端到端工程任務,對標 Claude Code。此前 DeepSeek 模型主要依賴 Claude Code、OpenCode 等第三方 Agent 工具。
官方公布的 Agent 跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 預覽版的 67.9 分)全部基於 Harness 的「極簡模式」測得,參數為 max 檔位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 裡主動提示:「跑分對 harness 的選擇非常敏感,不能簡單等同於模型本身能力的提升。」
| 基準 | Flash-0731 | Flash 預覽版 | V4-Pro 預覽版 | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
04 中國開源大模型「六邊形混戰」:性價比才是主戰場
| 模型 | 實驗室 | 總參數 | Intelligence Index | 單任務平均成本 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智譜/Z.ai | ~744B | 比 V4-Flash 高約 1 分 | 未核實 |
| GPT-5.6 Sol | OpenAI | 未公開 | 比 V4-Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 未公開 | 比 V4-Flash 高 9+ 分 | $3.15 |
數據來源:Intelligence Index 與單任務成本引自 Artificial Analysis(第三方獨立評測),經財經媒體轉引;DeepSeek 官方跑分為廠商自報,評測方法和權重不完全一致,本文分開列出。
有趣的反差:在 Artificial Analysis 綜合指數上,V4-Flash 的智能分並非最高,甚至落後於 Kimi K3 和 GLM-5.2;但單任務成本僅為 Kimi K3 的約 1/29、GPT-5.6 Sol 的約 1/62、Claude Fable 5 的約 1/105。DeepSeek 打的不是「跑分第一」,而是「夠用的智能 + 極致的價格」——這也解釋了 V4-Flash 預覽版在 OpenRouter 上連續七週穩坐呼叫量第一。
中文開發者社群流傳「斬殺線」(kill line):DeepSeek 憑藉「夠用的性能 + 極端低價」給同行設下門檻——性能沒有明顯超過、又拿不出更低價格的模型,就會在市場上失去存在感。
05 跑分爭議、六步接入與可引用數據
幾個值得明確標注、避免被過度解讀的地方:
- 跑分依賴 Harness:Agent 類跑分基於未公開發布的 Harness 極簡模式,在獨立社群復現之前應視為「廠商自報 + 特定框架」結果。
- 可用性問題:據 21 世紀經濟報導援引海外開發者回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題。
- V4-Pro 上線時間未證實:「8 月 10–20 日 GA」等窗口為未署名消息源,DeepSeek 官方 changelog 原話只是「將盡快發布」。
- 融資傳聞需謹慎:媒體報導約 74 億美元融資、487 億美元估值等資訊目前主要來自「據報導」「消息人士稱」,尚無官方或監管備案確認。
六步安全接入 V4-Flash-0731:
- 確認 API 命名:使用
deepseek-v4-flash模型 ID,該別名已自動指向 0731 正式版;若仍用已停用的deepseek-chat/deepseek-reasoner須立即切換。 - 開通 API Key:在 DeepSeek 開放平台建立金鑰,確認帳戶餘額與計費方式(含未來高峰 2 倍加價預告)。
- 選擇相容協議:支援 OpenAI ChatCompletions 與 Anthropic 格式,按現有工具鏈選
base_url,無需改客戶端程式碼。 - 沙箱 A/B 對比:用自有業務 prompt 與 Kimi K3 / Qwen3.8-Max 盲測,勿僅憑廠商跑分表遷移生產。
- 關注 Harness 發布:Agent 類任務待 Harness 公開後復現官方基準,再用 Claude Code / Cursor 等第三方框架交叉驗證。
- 規劃本地部署:MIT 權重已上線 Hugging Face(
deepseek-ai/DeepSeek-V4-Flash-0731),284B MoE 需高記憶體 Apple Silicon 或資料中心級 GPU 叢集。
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
temperature=1.0,
top_p=0.95
)
可引用硬核數據(來源:DeepSeek 官方、Artificial Analysis,2026-08-05):
- 參數:284B 總參數 / 13B 激活,架構與 4 月預覽版完全相同
- 定價:輸入 $0.14/M(快取未命中)、$0.0028/M(命中);輸出 $0.28/M
- Terminal Bench 2.1:82.7(廠商自報,Harness minimal mode)
- Artificial Analysis 獨立評測:Terminal-Bench 2.1 約 78.65%,與官方 82.7 差距 4.05 分
- 性價比:單任務成本 $0.03,約為 Kimi K3 的 1/29、Claude Fable 5 的 1/105
- 長上下文效率:百萬 token 下 FLOPs 為 V3.2 的 27%,KV Cache 為 10%(官方數據)
- 價格對比:較 Claude Opus 4.8 快取未命中輸入約便宜 36 倍、快取命中約 179 倍、輸出約 89 倍(廠商標價)
- 開源協議:MIT,權重已同步 Hugging Face
06 常見問題、產業背景與生產環境收束
Q:DeepSeek V4 和 V3.2 相比,最大區別是什麼?
A:原生支援 100 萬 token 上下文,長上下文計算與顯存開銷大幅降低(官方:V4-Pro 百萬 token 下 FLOPs 為 V3.2 的 27%,KV Cache 為 10%)。V4 系列在 Agent 能力上做了專項優化。
Q:日常該選 V4 Flash 還是 V4 Pro?
A:普通對話、批次處理或大規模低成本 Agent 流水線,V4-Flash-0731 性價比更高且 Agent 跑分已反超 V4-Pro 預覽版。更深世界知識或複雜推理且預算不敏感,可暫用 V4-Pro 預覽版,等官方版上線再評估。
Q:現在能用 V4 Pro 官方版嗎?
A:截至發稿還不能。官方版只有 V4-Flash-0731,且僅限 API。V4-Pro 官方版與 Harness 官方口徑是「盡快發布」,網上「8 月 10–20 日」為未經證實的傳言。
Q:DeepSeek 公布的跑分能直接相信嗎?
A:SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 跑分用未公開 Harness 測得,建議等社群用 Claude Code、Cursor 等獨立復現後再下結論。
Q:對普通開發者有什麼實際影響?
A:OpenAI / Anthropic 格式 API 接入無需改程式碼,deepseek-v4-flash 自動指向新版。舊命名須盡快切換。
在 V4 正式版發布前,中文 AI 社群曾把梁文鋒戲稱為「梁白開」(諧音「白等」);V4-Flash-0731 上線後因表現超出預期,「梁聖」稱號又還了回去。更值得關注的是「斬殺線」效應——這也解釋了同期 GPT-5.6 Luna 降價 80% 等密集調價。7 月 31 日當天輝達、博通、AMD 等算力晶片股未出現明顯波動,市場已習慣「DeepSeek 式效率突破」敘事。
純 API 呼叫雖門檻低,但長程 Agent 在共享 VPS 上易遇記憶體抖動與長連線中斷,284B 權重本地部署需 96GB+ 統一記憶體,多工具鏈並行缺乏 7×24 穩定宿主。對於需要持續執行 OpenClaw、Claude Code 或 Cursor Agent 遠端閘道的生產環境,JEXCLOUD 多區域裸機 Mac是更優解:獨占 Apple Silicon 統一記憶體、無超賣頻寬抖動、launchd 常駐 Agent,120 秒交付。節點與價格見 JEXCLOUD 定價頁。