DeepSeek V4 API 正式调价:峰谷计价落地,开发者该如何重新算账?

一、发生了什么

2026 年 8 月 17 日 0 点(北京时间),DeepSeek-V4 系列 API 的全新定价正式生效。与此同时,V4-Pro 结束测试阶段,全面转为正式版商用服务。
这次调价有两个最值得开发者关注的变化:

  1. 取消统一单价,改为峰谷分级计价。这是主流大模型 API 里很少见的分时定价。
  2. 整体价格大幅上调,涨幅最高达到 1100%。
    下面把官方公布的价格表、涨幅,以及它对实际工程成本的影响拆开讲清楚。

二、峰谷怎么分

DeepSeek 把一天分成两段:
高峰时段:北京时间 9:00–12:00、14:00–18:00
空闲时段:其余时间
空闲时段的定价是高峰时段的一半。计费单位统一为 元 / 百万 tokens。
换句话说,把同样的任务挪到晚上或凌晨跑,账单直接砍半。这是这次调价里最实用的"省钱开关"。

三、官方价格表(2026-08-17 生效)

DeepSeek-V4-Flash(单位:元 / 百万 tokens)

项目 空闲时段 高峰时段
输入(缓存命中) ¥0.05 ¥0.10
输入(缓存未命中) ¥1.50 ¥3.00
输出 ¥4.50 ¥9.00
DeepSeek-V4-Pro(单位:元 / 百万 tokens)
项目 空闲时段 高峰时段
输入(缓存命中) ¥0.15 ¥0.30
输入(缓存未命中) ¥4.50 ¥9.00
输出 ¥13.50 ¥27.00
两款模型同时支持最长 384K 上下文,并原生适配 FIM 代码补全、工具调用、对话续写、Responses API 以及 Anthropic 兼容接口。

四、涨幅有多大

把调整后(高峰时段)和 8 月 12 日 V4-Pro 刚上线测试版时的价格做对比:

模型 项目 调整前 高峰调整后 涨幅
V4-Pro 输出 ¥6.00 ¥27.00 +350%
V4-Pro 输入(缓存未命中) ¥3.00 ¥9.00 +200%
V4-Pro 输入(缓存命中) ¥0.025 ¥0.30 +1100%
V4-Flash 输出 ¥2.00 ¥9.00 +350%
V4-Flash 输入(缓存未命中) ¥1.00 ¥3.00 +200%
V4-Flash 输入(缓存命中) ¥0.02 ¥0.10 +400%
最刺眼的是 V4-Pro 缓存命中输入从 ¥0.025 涨到 ¥0.30,涨幅 1100%。但换个角度看,缓存命中本来就是最便宜的那一档,绝对金额依旧很低——真正拉高成本的是"缓存未命中输入"和"输出"。

五、为什么要这么改

官方给出的说法是:通过市场化价格手段调节算力负载,引导企业和开发者把批量推理、大型任务转移到空闲时段,平抑高峰期的算力拥堵,提升平台整体稳定性。
从技术角度理解,这就是用价格杠杆做算力错峰。大模型推理的算力成本主要集中在 GPU 显存占用和峰值算力上,白天企业用户集中调用时,集群负载高、排队严重。把价格拉开一倍,本质上是在鼓励对时延不敏感的任务(离线批处理、日志分析、文档批量解析、夜间训练数据生成等)主动避开高峰。
这和电网的峰谷电价是同一个思路。

六、对开发者的实际影响

  1. 缓存命中的地位骤然变重
    看 V4-Pro 高峰时段:缓存命中输入 ¥0.30 / 百万 tokens,缓存未命中输入 ¥9.00 / 百万 tokens,两者相差 30 倍。
    这意味着:复用 system prompt、把长上下文前置缓存、给高频请求打上 cache 标记,不再是"优化项",而是"必做项"。同样的业务,做好缓存和没做缓存,输入成本可以差出一个数量级。
  2. 闲时批处理从"可选项"变成"省钱刚需"
    高峰输出 ¥27(Pro)/ ¥9(Flash),空闲直接砍半。如果你的任务允许延迟,把批量调用调度到 18:00 之后或早上 9:00 之前,账单立刻减半。对于每天跑大量离线任务的团队,这部分省下来的钱很可观。
  3. 模型选型要重新算账
    V4-Flash 高峰输出 ¥9,V4-Pro 高峰输出 ¥27,差 3 倍。但 Pro 在 Agent 相关评测(Terminal Bench、Toolathlon、AutomationBench 等)上明显更强。如果你的场景是简单分类、抽取、翻译,Flash 够用就别硬上 Pro;如果是复杂多步 Agent、长上下文推理,Pro 的准确率提升可能比那点差价更值。

七、给 DeepSeek API 使用者的几点建议

  1. 把 system prompt 和通用前缀尽量缓存。这是投入产出比最高的一件事,尤其是 V4-Pro 这种缓存命中/未命中差 30 倍的档位。
  2. 离线任务统一排到空闲时段。用调度器(cron / 队列)把批量推理放到晚上跑,成本直接减半。
  3. 给调用加上成本和预算告警。高峰时段单价翻倍,一次失控的循环调用账单会比以前难看得多。
  4. 重新评估模型组合。简单任务用 Flash,复杂任务才上 Pro,别一刀切。
  5. 关注 V4-Pro 的新能力。384K 上下文 + 原生 Responses API + 工具调用,适合把原来要拆多轮的链路合并,反而可能减少总 token 消耗。

八、小结

DeepSeek 这次调价,短期看是"涨",但峰谷计价本身给了开发者一个明确的优化抓手:你的成本不再只由模型决定,也由"你什么时候调用、有没有缓存"决定。 对重度使用者来说,把工程重心从"选哪个模型"扩展到"怎么调度、怎么缓存",比单纯抱怨涨价更实际。

本文价格数据均来自 DeepSeek 官方公告(2026 年 8 月 17 日 0 时生效),以官方页面为准。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐