DeepSeek V4 全系列正式上线:Flash 和 Pro 到底怎么选?一篇讲透
8月12日,DeepSeek V4-Pro 正式版(0813)悄然 GA,加上7月31日已上线的 V4-Flash 正式版(0731),DeepSeek V4 双版本产品矩阵正式补齐。一个主打"便宜量大跑得快",一个专攻"复杂推理硬骨头"——但具体到你的场景,该选哪个?
这两天很多人问我同一个问题:V4 Flash 和 Pro 都上了,我该用哪个?
这个问题其实不难回答,但网上的信息要么太碎、要么太技术、要么就是纯搬运官方通稿。我花了一个下午把两个版本的数据全部扒了一遍,整理成这篇选型指南。
核心结论先放这儿:90% 的场景用 Flash 就够了,Pro 留给真正硬核的任务。

一、先看全貌:V4 双版本是什么?
DeepSeek V4 是 DeepSeek 的第四代大模型,采用 MoE(混合专家)架构,分两个版本:
|
维度 |
V4-Flash(0731) |
V4-Pro(0813) |
|
定位 |
高性价比·高并发·低延迟 |
旗舰级·复杂推理·Agent |
|
总参数 |
2840亿 |
1.6万亿 |
|
激活参数 |
130亿 |
490亿 |
|
上下文窗口 |
100万 Token |
100万 Token |
|
最大输出 |
384K Token |
384K Token |
|
推理延迟 |
200-300毫秒 |
800毫秒+ |
|
并发上限 |
2500 |
500 |
|
思考模式 |
支持(可开关) |
支持(可开关) |
|
开源许可 |
MIT(完全开源) |
暂未开源 |
|
发布日期 |
2026.07.31 |
2026.08.12 |
一句话区分:Flash 是"又快又便宜的小钢炮",Pro 是"慢工出细活的重炮"。 两者共享百万 Token 上下文和 384K 超长输出,区别在参数规模、并发能力和价格。
二、价格对比:差距到底有多大?
先算钱,再聊性能。
|
计费项 |
V4-Flash |
V4-Pro |
倍数 |
|
输入(缓存未命中) |
¥1/百万 Token |
¥3/百万 Token |
3x |
|
输入(缓存命中) |
¥0.02/百万 Token |
¥0.025/百万 Token |
1.25x |
|
输出 |
¥2/百万 Token |
¥6/百万 Token |
3x |
换算成美元对比海外模型:
|
模型 |
输入 $/M |
输出 $/M |
单任务成本 |
|
V4-Flash |
$0.14 |
$0.28 |
~$0.10 |
|
V4-Pro |
$0.435 |
$0.87 |
~$0.30 |
|
Claude Opus 5 |
$5 |
$25 |
~$0.90 |
|
Claude Fable 5 |
$10 |
$50 |
~$1.80 |
|
GPT-5.6 Sol |
$5 |
$30 |
~$1.04 |
V4-Flash 的成本大约是 Claude Fable 5 的 1/18,V4-Pro 大约是 1/6。
而且 DeepSeek 有个"缓存命中"机制——如果你的请求跟之前的有重复部分(比如相同的系统提示词),输入价格直接降到几乎免费。Flash 缓存命中后每百万 Token 只要 0.02 元,Pro 是 0.025 元。
实操建议:固定系统提示词 + 高频调用场景,缓存命中率可以做到 80%+,实际花费远低于标牌价。
三、性能对比:各自强在哪?
Agent 能力(最关键的维度)
|
Agent 基准 |
V4-Flash |
V4-Pro |
备注 |
|
DeepSWE |
54.4 |
62.7 |
Pro 从预览版12.8飙到62.7,暴涨近5倍 |
|
Terminal Bench 2.1 |
82.7 |
87.9 |
Pro逼近全球榜首88.0 |
|
CyberGym |
76.7 |
83.3 |
Pro反超Claude Fable 5(83.1) |
|
Agent 终极测试 |
25.2 |
— |
Flash已逼近Opus 4.8(25.7) |
|
Toolathlon-Verified |
70.3 |
— |
工具调用能力 |
关键发现:Pro 在 CyberGym(网络安全任务)上拿了 83.3 分,反超了 Claude Fable 5 的 83.1——这是国产模型第一次在 Agent 安全赛道上超过全球顶级闭源模型。
编程能力
|
编程基准 |
V4-Flash |
V4-Pro |
|
SWE-bench Verified |
— |
80.6% |
|
GPQA Diamond |
— |
90.1% |
|
LiveCodeBench |
— |
93.5% |
|
Frontend Code Arena |
全球第7 |
— |
Pro 的 SWE-bench Verified 拿了 80.6%,虽然还差 Claude Opus 5 的 96% 一截,但考虑到价格只有 Opus 5 的 1/10 左右,性价比已经拉满。
速度对比
|
维度 |
V4-Flash |
V4-Pro |
|
推理延迟 |
200-300ms |
800ms+ |
|
并发支持 |
2500 |
500 |
|
首字返回 |
快 |
慢 |
Flash 的延迟是 Pro 的 1/3,并发是 Pro 的 5 倍。 如果你做的是高频调用、实时对话、批量处理,Flash 的速度优势是碾压级的。
四、场景选型:一张表搞定
我按常见使用场景做了匹配,直接对号入座:
|
你的场景 |
选哪个 |
为什么 |
|
日常聊天/问答 |
Flash |
延迟低、便宜、够用 |
|
轻量编程辅助 |
Flash |
Frontend Code Arena全球第7,日常编程绰绰有余 |
|
高频API调用 |
Flash |
2500并发,缓存后0.02元/百万Token |
|
批量数据处理 |
Flash |
高吞吐+低成本,跑量首选 |
|
实时对话/客服 |
Flash |
200ms延迟,用户无感等待 |
|
内容生成/文案 |
Flash |
响应快,质量够用 |
|
大型代码库重构 |
Pro |
1.6万亿参数+百万上下文,跨文件修改更准 |
|
复杂Agent任务 |
Pro |
DeepSWE 62.7,Terminal Bench 87.9 |
|
深度推理/分析 |
Pro |
GPQA Diamond 90.1%,科学推理强 |
|
网络安全/安全审计 |
Pro |
CyberGym 83.3,反超Fable 5 |
|
长链路Coding Agent |
Pro |
384K输出+百万上下文,长任务不断片 |
|
数学/专业推理 |
Pro |
复杂逻辑推演全面领先 |
一句话记忆法:追求"快和省"选 Flash,追求"准和全"选 Pro。
五、一个被忽视的细节:Flash 的"后训练奇迹"
这个点值得单独说一下。
V4-Flash 最让人震惊的不是价格,而是它的性能提升方式。
DeepSeek 官方确认:Flash 正式版(0731)的模型结构、参数规模跟预览版完全一致,只是重新做了后训练。结果呢?
- DeepSWE:7.3 → 54.4(暴涨6倍+)
- Terminal Bench 2.1:72.1 → 82.7(+10.6分)
- Agent 终极测试:15.8 → 25.2(+60%)
同一个模型骨架,不加参数、不换架构,只优化后训练策略——Agent 能力暴涨 6 倍。
这意味着什么?意味着过去两年行业疯狂堆参数的路线,可能不是唯一解。后训练阶段的优化空间被严重低估了。不换模型就能产生质的飞跃,这个发现对整个行业的影响可能比 V4 本身更大。
对用户的实际意义:Flash 看着参数小(激活才130亿),但别被参数量骗了。后训练优化后的 Flash,在 Agent 任务上已经超过了 V4-Pro 的预览版。大部分任务用 Flash 就够了,不是因为它"凑合能用",是因为它真的够强。
六、怎么最快体验 V4 全系列?
好了,选型逻辑讲完了,接下来是最实际的问题:怎么用上?
DeepSeek 官方 API 需要注册、实名、充值,而且高峰期偶尔会排队。如果你只想快速体验 Flash 和 Pro 的区别,不想折腾环境配置,可以直接用 星途 AI——V4 全系列都已经接入了。
传送门: https://xingtu.lk888.ai/

星途的好处是一个入口体验 500+ 模型,V4-Flash 和 V4-Pro 都在,不用分别注册一堆账号。最实用的玩法:
1. 同一个 prompt 丢给 Flash 和 Pro 同时跑
比如一段复杂代码重构任务,同时发给两个版本,直接对比输出质量和速度差异。肉眼就能感受到 Pro 推理更深、Flash 响应更快。
2. 按场景动态切换
日常对话用 Flash(便宜快),遇到硬核任务一键切到 Pro(强但贵)。不用维护两套 API key,一个平台搞定。
3. 跟其他模型横向对比
星途上还有 Claude Opus 5、Kimi K3、GPT-5.6 等主流模型。同一个任务丢给 4-5 个模型同时跑,谁好使只有试了才知道——榜单分数是平均值,你的具体场景可能完全不同。
除了文本模型,星途还集成了 Veo 3.1、Sora 2、Midjourney 等视频和图像模型。写完代码想配个封面图、做个 demo 视频,一个平台全搞定。
七、最后说几句
DeepSeek V4 双版本的策略很聪明:Flash 负责"让所有人都用得起 AI",Pro 负责"在硬核赛道上证明实力"。
Flash 用 0.02 元/百万 Token 的缓存价格和 2500 并发,把 AI 调用成本打到了"几乎免费"的水平。Pro 用 1.6 万亿参数和 CyberGym 反超 Fable 5 的成绩,证明了国产模型在复杂 Agent 任务上已经能跟全球顶级闭源模型掰手腕。
对开发者来说,这不是"二选一"的问题,而是"怎么组合使用"的问题。
80% 的日常任务走 Flash 省钱省时,20% 的硬核任务上 Pro 攻坚克难——这才是 V4 双版本的正确打开方式。
想体验 V4 全系列?去 星途 AI 试试,Flash 和 Pro 都已上线,一个入口搞定。
附:V4 全系列速查卡
|
V4-Flash |
V4-Pro |
|
|
一句话 |
又快又便宜 |
又强又全面 |
|
参数 |
2840亿总/130亿激活 |
1.6万亿总/490亿激活 |
|
输入价 |
¥1/M(缓存¥0.02) |
¥3/M(缓存¥0.025) |
|
输出价 |
¥2/M |
¥6/M |
|
延迟 |
200-300ms |
800ms+ |
|
并发 |
2500 |
500 |
|
最强项 |
Frontend Code Arena全球第7 |
CyberGym反超Fable 5 |
|
开源 |
MIT完全开源 |
暂未开源 |
|
适合 |
日常·高频·成本敏感 |
复杂推理·Agent·大代码库 |
更多推荐


所有评论(0)