DeepSeek V4 Flash正式版上线:跑分逼近Opus 4.8, 价格却只要几十分之一,Pro版还要再等等
7 月 31 日,DeepSeek 将 V4-Flash 升级为官方版 DeepSeek-V4-Flash-0731:参数规模不变、仅重新后训练,Agent 跑分反超更大的 V4-Pro 预览版,价格仅为 Claude Opus 4.8 的几十分之一。旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍未上线。
面向 AI 开发者与模型选型决策者,本文将回答三件事:① 从 4 月预览到 7 月 31 日「官方版」的完整时间线;② 定价、架构与 Harness 的核心数据及与 Kimi K3、Qwen3.8-Max 的横向对比;③ 跑分争议、「斩杀线」价格战与六步安全接入清单。数据截止 2026-08-05。
01 从 4 月预览到 7 月「官方版」:时间线与核心痛点
这不是一次新模型发布,而是同一个 284B 总参数 / 13B 激活 模型重新做了一遍后训练。真正的旗舰 V4-Pro 官方版,以及 DeepSeek 首次自研的 Agent 框架 Harness,目前仍处于「即将发布」状态,没有确切日期。
- 2026 年 4 月 24 日:DeepSeek-V4 预览版首次发布并开源,含 V4-Pro(1.6T/49B)与 V4-Flash(284B/13B),均支持 100 万 token 上下文,MIT 协议。
- 2026 年 7 月 24 日:旧接口
deepseek-chat与deepseek-reasoner正式停用,全部流量切换到 V4 系列命名。 - 2026 年 7 月 27 日:Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造竞争压力。
- 2026 年 7 月 31 日:V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架 Harness。本次公测仅限 API,App 和网页端暂未同步。
- 截至 2026 年 8 月 5 日:V4-Pro 官方版仍是「尽快发布」。国内有媒体援引未署名消息源称 GA 窗口可能在 8 月 10–20 日——未经 DeepSeek 官方证实,仅供参考。
开发者当前面临的核心痛点:
- 旗舰仍未兑现:V4-Pro 官方版与 Harness 框架尚无发布日期,生产环境若依赖 Pro 能力需继续用预览版。
- 跑分方法敏感:Agent 类基准全部基于未公开的 Harness「极简模式」测得,官方自己提示勿简单等同于模型能力。
- API 与消费端割裂:0731 正式版仅 API 可用,App/网页端仍是旧版本,体验不一致。
- 竞品密集发布:Qwen3.8-Max(8/2 GA)、Kimi K3(7/27 权重)与 GPT-5.6 降价 同期挤压选型窗口。
284B 参数的 Flash 版本在多项 Agent 基准上超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练质量的重要性正在逼近甚至超过单纯堆参数。
02 DeepSeek V4-Flash-0731 核心数据一览
| 模型 | 状态 | 总/激活参数 | 上下文 | 输入价(未命中/命中 $/M) | 输出价 $/M | 协议 |
|---|---|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版(7/31) | 284B / 13B | 1M | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 预览版(官方版未发布) | 1.6T / 49B | 1M | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 权重开源(7/27) | 2.8T / ~104B | ~1.05M | $3.00 / $0.30 | $15.00 | Modified MIT |
| GLM-5.2 | 开源(2026 年 6 月) | ~744B / ~40B | 1M | 未核实 | 未核实 | MIT |
| Qwen3.8-Max | API GA(8/2),权重待放出 | 2.4T / 95B | 1M | $2.00 / ~$0.17–0.25 | $6.00 | 承诺开源 |
以上定价均为厂商自报公开数据。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),截至发稿未公布具体生效日期。
03 架构没变,变的是后训练:CSA+HCA 与 Harness 首次亮相
V4-Flash-0731 在参数规模、模型结构上与 4 月预览版完全相同,性能提升「完全来自重新进行的后训练」。根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架构三处关键改动:
- 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),对外统一称为 DSA 稀疏注意力,降低长上下文计算与显存开销。
- 流形约束超连接(mHC):对传统残差连接结构做了改进。
- Muon 优化器:替换传统优化器,提升训练收敛速度与稳定性。
官方指标:在 100 万 token 上下文下,V4-Pro 相比前代 V3.2,单 token 推理所需 FLOPs 仅为 27%,KV Cache 占用仅为 10%。尚未看到独立第三方复现验证。
DeepSeek Harness 是 7 月 31 日 changelog 首次正式点名的自研 Agent 执行框架,用于读写文件、调用工具、执行命令、完成端到端工程任务,对标 Claude Code。此前 DeepSeek 模型主要依赖 Claude Code、OpenCode 等第三方 Agent 工具。
官方公布的 Agent 跑分(Terminal Bench 2.0 拿到 82.7 分,反超 V4-Pro 预览版的 67.9 分)全部基于 Harness 的「极简模式」测得,参数为 max 档位、top_p=0.95、temperature=1.0。DeepSeek 在 changelog 里主动提示:「跑分对 harness 的选择非常敏感,不能简单等同于模型本身能力的提升。」
| 基准 | Flash-0731 | Flash 预览版 | V4-Pro 预览版 | Opus 4.8 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 69.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 76.2 |
04 中国开源大模型「六边形混战」:性价比才是主战场
| 模型 | 实验室 | 总参数 | Intelligence Index | 单任务平均成本 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 284B | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 2.8T | 57 | $0.86 |
| GLM-5.2 | 智谱/Z.ai | ~744B | 比 V4-Flash 高约 1 分 | 未核实 |
| GPT-5.6 Sol | OpenAI | 未公开 | 比 V4-Flash 高 9+ 分 | $1.86 |
| Claude Fable 5 | Anthropic | 未公开 | 比 V4-Flash 高 9+ 分 | $3.15 |
数据来源:Intelligence Index 与单任务成本引自 Artificial Analysis(第三方独立评测),经财经媒体转引;DeepSeek 官方跑分为厂商自报,评测方法和权重不完全一致,本文分开列出。
有趣的反差:在 Artificial Analysis 综合指数上,V4-Flash 的智能分并非最高,甚至落后于 Kimi K3 和 GLM-5.2;但单任务成本仅为 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——这也解释了 V4-Flash 预览版在 OpenRouter 上连续七周稳坐调用量第一。
中文开发者社区流传「斩杀线」(kill line):DeepSeek 凭借「够用的性能 + 极端低价」给同行设下门槛——性能没有明显超过、又拿不出更低价格的模型,就会在市场上失去存在感。
05 跑分争议、六步接入与可引用数据
几个值得明确标注、避免被过度解读的地方:
- 跑分依赖 Harness:Agent 类跑分基于未公开发布的 Harness 极简模式,在独立社区复现之前应视为「厂商自报 + 特定框架」结果。
- 可用性问题:据 21 世纪经济报道援引海外开发者反馈,正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题。
- V4-Pro 上线时间未证实:「8 月 10–20 日 GA」等窗口为未署名消息源,DeepSeek 官方 changelog 原话只是「将尽快发布」。
- 融资传闻需谨慎:媒体报道约 74 亿美元融资、487 亿美元估值等信息目前主要来自「据报道」「消息人士称」,尚无官方或监管备案确认。
六步安全接入 V4-Flash-0731:
- 确认 API 命名:使用
deepseek-v4-flash模型 ID,该别名已自动指向 0731 正式版;若仍用已停用的deepseek-chat/deepseek-reasoner须立即切换。 - 开通 API Key:在 DeepSeek 开放平台创建密钥,确认账户余额与计费方式(含未来高峰 2 倍加价预告)。
- 选择兼容协议:支持 OpenAI ChatCompletions 与 Anthropic 格式,按现有工具链选
base_url,无需改客户端代码。 - 沙箱 A/B 对比:用自有业务 prompt 与 Kimi K3 / Qwen3.8-Max 盲测,勿仅凭厂商跑分表迁移生产。
- 关注 Harness 发布:Agent 类任务待 Harness 公开后复现官方基准,再用 Claude Code / Cursor 等第三方框架交叉验证。
- 规划本地部署:MIT 权重已上线 Hugging Face(
deepseek-ai/DeepSeek-V4-Flash-0731),284B MoE 需高内存 Apple Silicon 或数据中心级 GPU 集群。
from openai import OpenAI
client = OpenAI(
api_key="your_deepseek_api_key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[{"role": "user", "content": "Review this Agent workflow..."}],
temperature=1.0,
top_p=0.95
)
可引用硬核数据(来源:DeepSeek 官方、Artificial Analysis,2026-08-05):
- 参数:284B 总参数 / 13B 激活,架构与 4 月预览版完全相同
- 定价:输入 $0.14/M(缓存未命中)、$0.0028/M(命中);输出 $0.28/M
- Terminal Bench 2.1:82.7(厂商自报,Harness minimal mode)
- Artificial Analysis 独立评测:Terminal-Bench 2.1 约 78.65%,与官方 82.7 差距 4.05 分
- 性价比:单任务成本 $0.03,约为 Kimi K3 的 1/29、Claude Fable 5 的 1/105
- 长上下文效率:百万 token 下 FLOPs 为 V3.2 的 27%,KV Cache 为 10%(官方数据)
- 价格对比:较 Claude Opus 4.8 缓存未命中输入约便宜 36 倍、缓存命中约 179 倍、输出约 89 倍(厂商标价)
- 开源协议:MIT,权重已同步 Hugging Face
06 常见问题、行业背景与生产环境收束
Q:DeepSeek V4 和 V3.2 相比,最大区别是什么?
A:原生支持 100 万 token 上下文,长上下文计算与显存开销大幅降低(官方:V4-Pro 百万 token 下 FLOPs 为 V3.2 的 27%,KV Cache 为 10%)。V4 系列在 Agent 能力上做了专项优化。
Q:日常该选 V4 Flash 还是 V4 Pro?
A:普通对话、批量处理或大规模低成本 Agent 流水线,V4-Flash-0731 性价比更高且 Agent 跑分已反超 V4-Pro 预览版。更深世界知识或复杂推理且预算不敏感,可暂用 V4-Pro 预览版,等官方版上线再评估。
Q:现在能用 V4 Pro 官方版吗?
A:截至发稿还不能。官方版只有 V4-Flash-0731,且仅限 API。V4-Pro 官方版与 Harness 官方口径是「尽快发布」,网上「8 月 10–20 日」为未经证实的传言。
Q:DeepSeek 公布的跑分能直接相信吗?
A:SWE-bench Verified 等第三方基准可信度较高;Terminal Bench 2.0 等 Agent 跑分用未公开 Harness 测得,建议等社区用 Claude Code、Cursor 等独立复现后再下结论。
Q:对普通开发者有什么实际影响?
A:OpenAI / Anthropic 格式 API 接入无需改代码,deepseek-v4-flash 自动指向新版。旧命名须尽快切换。
在 V4 正式版发布前,中文 AI 社区曾把梁文锋戏称为「梁白开」(谐音「白等」);V4-Flash-0731 上线后因表现超出预期,「梁圣」称号又还了回去。更值得关注的是「斩杀线」效应——这也解释了同期 GPT-5.6 Luna 降价 80% 等密集调价。7 月 31 日当天英伟达、博通、AMD 等算力芯片股未出现明显波动,市场已习惯「DeepSeek 式效率突破」叙事。
纯 API 调用虽门槛低,但长程 Agent 在共享 VPS 上易遇内存抖动与长连接打断,284B 权重本地部署需 96GB+ 统一内存,多工具链并行缺乏 7×24 稳定宿主。对于需要持续运行 OpenClaw、Claude Code 或 Cursor Agent 远端网关的生产环境,JEXCLOUD 多区域裸金属 Mac是更优解:独占 Apple Silicon 统一内存、无超卖宽带抖动、launchd 常驻 Agent,120 秒交付。节点与价格见 JEXCLOUD 定价页。