8月12日,DeepSeek V4-Pro 正式版(0813)悄然 GA,加上7月31日已上线的 V4-Flash 正式版(0731),DeepSeek V4 双版本产品矩阵正式补齐。一个主打"便宜量大跑得快",一个专攻"复杂推理硬骨头"——但具体到你的场景,该选哪个?

这两天很多人问我同一个问题:V4 Flash 和 Pro 都上了,我该用哪个?

这个问题其实不难回答,但网上的信息要么太碎、要么太技术、要么就是纯搬运官方通稿。我花了一个下午把两个版本的数据全部扒了一遍,整理成这篇选型指南。

核心结论先放这儿:90% 的场景用 Flash 就够了,Pro 留给真正硬核的任务。


一、先看全貌:V4 双版本是什么?

DeepSeek V4 是 DeepSeek 的第四代大模型,采用 MoE(混合专家)架构,分两个版本:

维度

V4-Flash(0731)

V4-Pro(0813)

定位

高性价比·高并发·低延迟

旗舰级·复杂推理·Agent

总参数

2840亿

1.6万亿

激活参数

130亿

490亿

上下文窗口

100万 Token

100万 Token

最大输出

384K Token

384K Token

推理延迟

200-300毫秒

800毫秒+

并发上限

2500

500

思考模式

支持(可开关)

支持(可开关)

开源许可

MIT(完全开源)

暂未开源

发布日期

2026.07.31

2026.08.12

一句话区分:Flash 是"又快又便宜的小钢炮",Pro 是"慢工出细活的重炮"。 两者共享百万 Token 上下文和 384K 超长输出,区别在参数规模、并发能力和价格。


二、价格对比:差距到底有多大?

先算钱,再聊性能。

计费项

V4-Flash

V4-Pro

倍数

输入(缓存未命中)

¥1/百万 Token

¥3/百万 Token

3x

输入(缓存命中)

¥0.02/百万 Token

¥0.025/百万 Token

1.25x

输出

¥2/百万 Token

¥6/百万 Token

3x

换算成美元对比海外模型:

模型

输入 $/M

输出 $/M

单任务成本

V4-Flash

$0.14

$0.28

~$0.10

V4-Pro

$0.435

$0.87

~$0.30

Claude Opus 5

$5

$25

~$0.90

Claude Fable 5

$10

$50

~$1.80

GPT-5.6 Sol

$5

$30

~$1.04

V4-Flash 的成本大约是 Claude Fable 5 的 1/18,V4-Pro 大约是 1/6。

而且 DeepSeek 有个"缓存命中"机制——如果你的请求跟之前的有重复部分(比如相同的系统提示词),输入价格直接降到几乎免费。Flash 缓存命中后每百万 Token 只要 0.02 元,Pro 是 0.025 元。

实操建议:固定系统提示词 + 高频调用场景,缓存命中率可以做到 80%+,实际花费远低于标牌价。


三、性能对比:各自强在哪?

Agent 能力(最关键的维度)

Agent 基准

V4-Flash

V4-Pro

备注

DeepSWE

54.4

62.7

Pro 从预览版12.8飙到62.7,暴涨近5倍

Terminal Bench 2.1

82.7

87.9

Pro逼近全球榜首88.0

CyberGym

76.7

83.3

Pro反超Claude Fable 5(83.1)

Agent 终极测试

25.2

Flash已逼近Opus 4.8(25.7)

Toolathlon-Verified

70.3

工具调用能力

关键发现:Pro 在 CyberGym(网络安全任务)上拿了 83.3 分,反超了 Claude Fable 5 的 83.1——这是国产模型第一次在 Agent 安全赛道上超过全球顶级闭源模型。

编程能力

编程基准

V4-Flash

V4-Pro

SWE-bench Verified

80.6%

GPQA Diamond

90.1%

LiveCodeBench

93.5%

Frontend Code Arena

全球第7

Pro 的 SWE-bench Verified 拿了 80.6%,虽然还差 Claude Opus 5 的 96% 一截,但考虑到价格只有 Opus 5 的 1/10 左右,性价比已经拉满。

速度对比

维度

V4-Flash

V4-Pro

推理延迟

200-300ms

800ms+

并发支持

2500

500

首字返回

Flash 的延迟是 Pro 的 1/3,并发是 Pro 的 5 倍。 如果你做的是高频调用、实时对话、批量处理,Flash 的速度优势是碾压级的。


四、场景选型:一张表搞定

我按常见使用场景做了匹配,直接对号入座:

你的场景

选哪个

为什么

日常聊天/问答

Flash

延迟低、便宜、够用

轻量编程辅助

Flash

Frontend Code Arena全球第7,日常编程绰绰有余

高频API调用

Flash

2500并发,缓存后0.02元/百万Token

批量数据处理

Flash

高吞吐+低成本,跑量首选

实时对话/客服

Flash

200ms延迟,用户无感等待

内容生成/文案

Flash

响应快,质量够用

大型代码库重构

Pro

1.6万亿参数+百万上下文,跨文件修改更准

复杂Agent任务

Pro

DeepSWE 62.7,Terminal Bench 87.9

深度推理/分析

Pro

GPQA Diamond 90.1%,科学推理强

网络安全/安全审计

Pro

CyberGym 83.3,反超Fable 5

长链路Coding Agent

Pro

384K输出+百万上下文,长任务不断片

数学/专业推理

Pro

复杂逻辑推演全面领先

一句话记忆法:追求"快和省"选 Flash,追求"准和全"选 Pro。


五、一个被忽视的细节:Flash 的"后训练奇迹"

这个点值得单独说一下。

V4-Flash 最让人震惊的不是价格,而是它的性能提升方式

DeepSeek 官方确认:Flash 正式版(0731)的模型结构、参数规模跟预览版完全一致,只是重新做了后训练。结果呢?

  • DeepSWE:7.3 → 54.4(暴涨6倍+
  • Terminal Bench 2.1:72.1 → 82.7(+10.6分)
  • Agent 终极测试:15.8 → 25.2(+60%)

同一个模型骨架,不加参数、不换架构,只优化后训练策略——Agent 能力暴涨 6 倍。

这意味着什么?意味着过去两年行业疯狂堆参数的路线,可能不是唯一解。后训练阶段的优化空间被严重低估了。不换模型就能产生质的飞跃,这个发现对整个行业的影响可能比 V4 本身更大。

对用户的实际意义:Flash 看着参数小(激活才130亿),但别被参数量骗了。后训练优化后的 Flash,在 Agent 任务上已经超过了 V4-Pro 的预览版。大部分任务用 Flash 就够了,不是因为它"凑合能用",是因为它真的够强。


六、怎么最快体验 V4 全系列?

好了,选型逻辑讲完了,接下来是最实际的问题:怎么用上?

DeepSeek 官方 API 需要注册、实名、充值,而且高峰期偶尔会排队。如果你只想快速体验 Flash 和 Pro 的区别,不想折腾环境配置,可以直接用 星途 AI——V4 全系列都已经接入了。

传送门: https://xingtu.lk888.ai/

星途的好处是一个入口体验 500+ 模型,V4-Flash 和 V4-Pro 都在,不用分别注册一堆账号。最实用的玩法:

1. 同一个 prompt 丢给 Flash 和 Pro 同时跑

比如一段复杂代码重构任务,同时发给两个版本,直接对比输出质量和速度差异。肉眼就能感受到 Pro 推理更深、Flash 响应更快。

2. 按场景动态切换

日常对话用 Flash(便宜快),遇到硬核任务一键切到 Pro(强但贵)。不用维护两套 API key,一个平台搞定。

3. 跟其他模型横向对比

星途上还有 Claude Opus 5、Kimi K3、GPT-5.6 等主流模型。同一个任务丢给 4-5 个模型同时跑,谁好使只有试了才知道——榜单分数是平均值,你的具体场景可能完全不同。

除了文本模型,星途还集成了 Veo 3.1、Sora 2、Midjourney 等视频和图像模型。写完代码想配个封面图、做个 demo 视频,一个平台全搞定。


七、最后说几句

DeepSeek V4 双版本的策略很聪明:Flash 负责"让所有人都用得起 AI",Pro 负责"在硬核赛道上证明实力"。

Flash 用 0.02 元/百万 Token 的缓存价格和 2500 并发,把 AI 调用成本打到了"几乎免费"的水平。Pro 用 1.6 万亿参数和 CyberGym 反超 Fable 5 的成绩,证明了国产模型在复杂 Agent 任务上已经能跟全球顶级闭源模型掰手腕。

对开发者来说,这不是"二选一"的问题,而是"怎么组合使用"的问题。

80% 的日常任务走 Flash 省钱省时,20% 的硬核任务上 Pro 攻坚克难——这才是 V4 双版本的正确打开方式。

想体验 V4 全系列?去 星途 AI 试试,Flash 和 Pro 都已上线,一个入口搞定。


附:V4 全系列速查卡

V4-Flash

V4-Pro

一句话

又快又便宜

又强又全面

参数

2840亿总/130亿激活

1.6万亿总/490亿激活

输入价

¥1/M(缓存¥0.02)

¥3/M(缓存¥0.025)

输出价

¥2/M

¥6/M

延迟

200-300ms

800ms+

并发

2500

500

最强项

Frontend Code Arena全球第7

CyberGym反超Fable 5

开源

MIT完全开源

暂未开源

适合

日常·高频·成本敏感

复杂推理·Agent·大代码库


Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐