大家好,我是晚安code。

8 月 12 日深夜,DeepSeek V4 Pro 悄悄转正了。没有发布会,没有预告,你打开定价页才发现模型版本号已经变成 DeepSeek-V4-Pro-0813。同一晚,马斯克的 Grok 4.6 也在抢头条,两件事撞车,被媒体戏称为「梁文锋对垒马斯克」。

这篇评测我打算从价格、能力、跑分可信度三个角度,把 V4 Pro 正式版拆开讲清楚,最后给你一句实在话:现在到底该不该切。收藏备用,下面开始。

一、官宣得很低调:更新个定价页就算发布了

DeepSeek V4 Pro 这次转正,走的是「静默上线」路线——官方没开发布会,只在 8 月 12 日深夜更新了 API 文档和定价页,调用模型名 deepseek-v4-pro 保持不变。老用户什么都不用改,后端已经悄悄换成了新版。

这也是 V4 系列的最后一块拼图。7 月 31 日 V4 Flash 刚转正,这次轮到 Pro。接口上和 Flash 完全对齐:OpenAI 格式和 Anthropic 格式两套 API 都支持,Responses API、Tool Calls、JSON Output、Codex 接入也都在。(2026 年 8 月 12 日上线,以官方文档为准)

二、先算价格账:输出 6 元,只有 Fable 5 的六十分之一

价格,是这次 V4 Pro 正式版最锋利的武器。官方定价按每百万 token 算:

计费项V4 Pro 正式版V4 Flash 正式版
输入(缓存未命中)3 元1 元
输入(缓存命中)0.025 元0.02 元
输出6 元2 元
并发限制5002500

放海外一比,差距更夸张:Fable 5 输出约 360 元/百万 token,V4 Pro 的 6 元正好是它的六十分之一;对比 Opus 5(约 180 元)是三十分之一。

缓存命中:同一段提示词反复请求时,系统直接复用之前算好的结果,不用重新推理,所以便宜到 0.025 元/百万 token。你可以理解为「熟人生意,打个折」。

我按自己最日常的场景算过一笔账:每天把几百段代码丢给模型做 review,假设一天烧 20 万输出 token,用 Fable 5 要 72 元,换成 V4 Pro 只要 1.2 元——一个月就差两千多块,一年差出一辆二手电驴。

左贵右廉,一只钱袋一只硬币,60 倍的差距一眼可见

官方定价页截图

但这里有个坑要说:官方已经在定价页挂出预告,「计划近期整体上调 API 服务定价,预计涨幅较大」,还预告了峰谷计费,高峰期(9:00-12:00、14:00-18:00)价格直接翻倍,V4 Pro 高峰输出会到 12 元。所以现在的低价,大概率是上线初期的「临时价格战」——像楼下面馆开业首周买一送一,等客流量上来,价格就回去了。

三、能力:1M 上下文 + 384K 输出,Agent 是重头

能力上,1M 上下文和 Agent 增强是这次实打实的两个升级点。

上下文窗口:模型一次能「记住」多少内容,单位是 token。V4 Pro 支持 100 万 token 上下文,最大输出 384K token——相当于一次读完一本近百万字的长篇小说,再让它一口气写满三分之一本。实际价值是:大型代码仓库、整本技术文档可以直接整个塞进去,省掉以前切块、上 RAG 的中间步骤。

另一个重点是 Agent。

Agent(智能体):大模型不只会回答,还能自己规划步骤、调用工具、一步步完成任务。你可以理解为「雇了个能自己动手的小助理,而不是只会动嘴的顾问」。

给任务 → 调工具 → 自动完成,一条链路说清 Agent

这次正式版被媒体点名的核心升级就是 Agent。第三方机构 SemiAnalysis 的测试显示,V4 Pro 和 Flash 在 Agent 相关测试中甩开了参数量更大的英伟达 Nemotron 3 Ultra。而且因为兼容 Anthropic API 格式,Claude Code 这类工具理论上改一行 base_url 就能接上 DeepSeek 后端,社区已经有人在这么干了。

四、跑分:直逼 Fable 5,但三个槽点要看清

跑分数字,一半是真相,一半是营销。官方公布的对比表(注意:全为 DeepSeek 自报,未经第三方验证):

基准测试V4 Pro 0813Fable 5Opus 4.8
Terminal Bench 2.187.988.085.0
CyberGym(AI 安全)83.383.178.3
DeepSWE(软件工程)62.770.058.0

三个亮点:Terminal Bench 2.1 只差 Fable 5 0.1 分;DeepSWE 从预览版的 12.8 一路涨到 62.7,翻了近 5 倍,还反超了 Opus 4.8;CyberGym 直接反超 Fable 5。官方还公布了 AutomationBench、HLE、DSBench 等更多指标,整体趋势接近,个别项反超。

三个槽点我也得说清楚:

  • 跑分全是 DeepSeek 自家 harness 测的,目前没有第三方完整复现;
  • DSBench 系列属于「自家考题」,题目和验证器都没公开,公允性存疑;
  • 社区有反馈:长时间连续执行时,会出现提前停止、反复思考、任务质量不稳定的情况。

所以「逼近 Fable 5」这句话,我建议你打八折听——价格是白纸黑字骗不了人,能力就得自己上手验。

可能有人会问:跑分都是 DeepSeek 自己测的,那到底该不该信?
别全信,也别全不信。价格看定价页就行,能力就用下面的接口自己跑几个真实任务。我的习惯是先拿它跑一周我自己项目的真实任务,再决定要不要上生产。

想自己复现?官方接口就能测(模型名 deepseek-v4-pro):

curl https://api.deepseek.com/v1/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "列出 10 个 TODO 型 API 的错误处理最佳实践"}
    ]
  }'

五、结论:谁该切,谁再等等

我的结论一句话:预算敏感、能接受自测的团队,现在就能切——先把低风险调用切过去,别一天内把全部生产流量压上去。V4 Pro 这次赢在价格和性价比,不是赢在「全面碾压 Fable 5」。


我是晚安code,持续分享编程干货。觉得有用的话记得点赞收藏和关注~也欢迎在评论区聊聊:你打算什么时候把生产流量切到 DeepSeek V4 Pro,还是先观望等第三方跑分?

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐