DeepSeek flash系列又降价:缓存命中价格最高降60%
9月9日,DeepSeek 开放平台发布公告,宣布从北京时间 9月10日 12:00 起下调 flash 系列模型价格,其中输入缓存命中价格最高降幅达 60%。据报道,这距离上一次涨价还不到一个月——8月中旬 V4 Pro 正式版上线时,DeepSeek 刚同步上调过一批 API 价格,涨幅最高的一档达到 11 倍,当时在开发者圈子里引发了不少讨论。一涨一降之间,值得聊的不只是价格数字本身。
这次降了多少:一张表说清楚
此次调价涉及 flash 系列在售的两款模型(据报道为 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp),执行同一套价格标准,单位都是"每百万 Token":
| 计费项 | 闲时原价 | 闲时新价 | 高峰原价 | 高峰新价 |
|---|---|---|---|---|
| 输入(缓存命中) | 0.05 元 | 0.02 元 | 0.10 元 | 0.04 元 |
| 输入(缓存未命中) | 1.5 元 | 1.0 元 | 3 元 | 2 元 |
| 输出 | 4.5 元 | 4.0 元 | 9 元 | 8 元 |
其中高峰时段仍为空闲时段的 2 倍,规则不变:工作日 9:00–12:00、14:00–18:00 算高峰,其余时间算闲时。
变的是什么,没变的是什么
先说没变的:峰谷分时计价这个框架没有动,DeepSeek 还是想用价格杠杆把负载往闲时引导。变的是价格水平,而且变的方向很有讲究——降幅最大的是缓存命中输入(60%),其次是缓存未命中输入(33.33%),输出只降了 11.11%。
这个梯度不是随便拍的。对厂商来说,命中缓存的请求意味着不用重新算整段上下文,边际成本最低,降价空间最大,也最想鼓励;输出 token 要逐个生成,成本几乎刚性,降不动太多。对开发者来说,这个梯度其实在明说一句话:想要便宜,就把负载做成"缓存友好"的形状。
还有一个值得注意的细节:据观察者网报道,与 8 月涨价前相比,这次调价后闲时的缓存命中价(0.02 元)和未命中价(1 元)已经回到了涨价前的水平,但输出价(4 元)并没有回到此前的 2 元。也就是说,这次是"部分回调"而不是"完全复位",涨价的核心部分——输出——其实被保留了大半。
对普通开发者:怎么把这波降价吃满
我的看法是,别只看"最高降 60%"这个 headline,得看自己的调用结构:
- 多轮对话、Agent、RAG 这类长上下文场景,是缓存命中的主力。这类负载如果能保持稳定的 system prompt 前缀、复用一个会话内的上下文,就能吃到 0.02 元的命中价,成本下降最明显。
-
- 输出占比高的场景(长文生成、代码补全、翻译长文本),这轮收益有限,输出只降了 11%,而且绝对值比涨价前仍高出一倍。这类负载该考虑的是模型档位和推理优化,而不是等降价。
-
- 能错峰的任务(离线批量清洗、报表生成、定时标注、夜间测试),直接挪到闲时跑,同样的量价格直接砍半——这是峰谷定价最直白的使用方式。
一个简单的估算脚本,可以拿自己的 token 统计套一下:
- 能错峰的任务(离线批量清洗、报表生成、定时标注、夜间测试),直接挪到闲时跑,同样的量价格直接砍半——这是峰谷定价最直白的使用方式。
# 单位:元 / 百万 tokens(按闲时新价)
INPUT_MISS, INPUT_HIT, OUTPUT = 1.0, 0.02, 4.0
def est_cost(in_tokens, out_tokens, hit_rate=0.5):
in_price = INPUT_HIT * hit_rate + INPUT_MISS * (1 - hit_rate)
return in_tokens * in_price / 1e6 + out_tokens * OUTPUT / 1e6
print(est_cost(10_000_000, 2_000_000, hit_rate=0.8))
调用侧的写法没变化,DeepSeek 的接口兼容 OpenAI SDK,模型名以官方文档当前列表为准:
from openai import OpenAI
client = OpenAI(api_key="<你的key>", base_url="https://api.deepseek.com")
resp = client.chat.completions.create(
model="deepseek-v4-flash", # 具体模型名以官方文档为准
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
```
另外一点要提醒的是:**降价不改变选型逻辑**。flash 系列从命名到定价都写明了它是"快且便宜"的一档,适合高并发、高调用量、对延迟敏感、任务相对简单的场景;需要复杂推理、长链路规划的任务,该用 Pro 档还是得用,别因为 flash 便宜就把所有流量都迁过去,最后发现质量不达标返工的成本远超省下的 API 费用。
几个实际坑也顺带提一下:缓存命中价低,但前提是真能命中——每次请求都拼新上下文、system prompt 随机变的调用,享受不到这个价;调价只针对 flash 系列,V4 Pro 系列不在这次范围内;另外据报道 DeepSeek 9月8日刚在官方交流群开启了 V4.1 flash 的内测(计费与现款 flash 相同,每账号最多 20 路并发),虽然还没正式公开,但说明这一档模型本身也在换代,做预算时别把现在的价格当成长期价格。经历过 8 月那轮涨价之后,比较稳妥的做法是把 API 单价纳入成本监控,每次调价公告出来后重新测算一遍自己的调用结构,而不是拍脑袋跟着"降价了"的消息走。
## 结尾
一个月内先涨后降、输出价没完全复位、新一代 flash 已经在内测——这套组合拳背后,是"性价比"定位和算力成本之间的反复拉扯。对打工人来说,模型能力差一档可能感知不明显,账单上的数字差一倍可是实实在在的。你现在的调用结构,这波降价能吃满吗?评论区聊聊。
更多推荐



所有评论(0)