DeepSeek API 调价深度解析:缓存机制、峰谷定价与开发者应对指南
从一次真实对话的账单说起,一文读懂大模型API计费的核心逻辑
前言:一次“看似简单”的对话,一张“让人困惑”的账单
最近,我在使用Claude Code + CC Switch + DeepSeek底座完成了一段对话后,看到账单时陷入了沉思:
deepseek-v4-flash: 请求1次,输入428,输出188
deepseek-v4-pro: 请求5次,输入(命中缓存)88320,输入(未命中)34507,输出3216
总费用:0.42元
两轮对话,居然产生了88,320个缓存命中Token和34,507个未命中Token? 明明只说了两句话,为什么Token消耗如此之大?
更巧合的是,就在同一天(2026年8月17日),DeepSeek正式实施峰谷分时定价新规,部分场景的缓存命中价格上涨高达1100%。
要理解账单背后的逻辑,得先看完整的对话内容。
一、真实对话全文:到底说了什么?
以下是我与Claude Code(搭载CC Switch + DeepSeek底座)的完整对话记录:
第一轮对话
用户(2026/8/17 14:42:03):
技嘉4070 RTX 12G
AI(2026/8/17 14:42:11):
你提到的是技嘉(Gigabyte)的 GeForce RTX 4070 12GB 显卡。请问你想了解或处理什么?比如:
- **规格参数**:核心频率、显存、功耗(TGP)、接口等
- **游戏性能**:在 1080p / 1440p / 4K 下的帧率表现
- **价格与性价比**:当前行情、和同价位卡(如 4070 Super、7800 XT)对比
- **装机搭配**:电源功率、CPU 搭配、机箱尺寸是否合适
- **驱动 / 使用问题**:驱动安装、黑屏、温度等故障排查
- **确认具体型号**:技嘉 4070 有多个子型号(如 WindForce、Gaming OC、Eagle、AERO 等)
告诉我你具体想做什么,我来帮你。
第二轮对话
用户(2026/8/17 14:42:16):
这个模型能跑deepseek v4吗?
AI(2026/8/17 14:42:29):
[Tool: WebSearch]
此时模型判断需要联网搜索,调用了WebSearch工具。
工具返回(2026/8/17 14:42:38):
Web search results for query: "DeepSeek V4 model release parameters size"
Links:
- DeepSeek-V4 - 百度百科
- SAIFIINDUSTRIES/deepseek-v4-pro · Hugging Face
- RedHatAI/DeepSeek-V4-Flash · Hugging Face
- Intel/DeepSeek-V4-Flash-W4A16-AutoRound · Hugging Face
- mkreynolds/Deepseek-V4-Flash-oQ3e-mtp · Hugging Face
- What Is DeepSeek V4? - apidog
- DeepSeek-V4-Pro-0813: Agent Leap + Price Hike Coming
- DeepSeek V4来了:在喧哗众声中,按自己的节奏讲开源故事 - 网易
- DeepSeek-V4来了!华为昇腾加持 - 证券时报
- DeepSeek-V4开源:百万上下文,Agent能力比肩顶级闭源模型 - 阿里云开发者
DeepSeek-V4 was released on April 24, 2026 as a preview version, with two Mixture-of-Experts (MoE) models:
- **DeepSeek-V4-Pro**: 1.6T total parameters, 49B activated parameters
- **DeepSeek-V4-Flash**: 284B total parameters, 13B activated parameters
Both versions natively support a **1M token context window** (with up to 384K token output) and use FP4 + FP8 mixed precision for the main releases (base versions use FP8). Training data was reported as roughly 32T tokens for Flash and 33T tokens for Pro.
REMINDER: You MUST include the sources above in your response to the user using markdown hyperlinks.
AI(2026/8/17 14:43:00):
**结论:跑不了完整的 DeepSeek-V4,12GB 显存差了好几个数量级。**
DeepSeek-V4(2026-04-24 发布的预览版)是两个 MoE 模型,关键不是"激活参数"而是**总参数量**——MoE 架构下所有 expert 权重都必须常驻显存,所以得按总量算:
| 模型 | 总参数 | FP8 显存 | FP4 显存 | RTX 4070 (12G) |
|------|--------|----------|----------|----------------|
| V4-Pro | 1.6T(激活 49B) | ~1.6 TB | ~800 GB | ❌ 差 60~130 倍 |
| V4-Flash | 284B(激活 13B) | ~284 GB | ~142 GB | ❌ 差 12~24 倍 |
你的技嘉 4070 只有 **12GB 显存**,别说 V4 了,连完整跑 DeepSeek-V3(671B)也不可能。这类全量 MoE 模型要本地跑,通常需要多张 H100/A100 或大内存 CPU 集群。
**用 CPU + 内存硬跑(GGUF 量化 + offload)也基本不现实**:V4-Flash 即使压到 Q3 也要 100GB+ 内存,速度大概 1~2 token/s,没有实用价值。
---
**那 12GB 到底能本地跑什么 DeepSeek 模型?** 只有**蒸馏小模型**能跑:
| 模型 | 量化 | 显存占用 | 4070 12G |
|------|------|----------|----------|
| DeepSeek-R1-Distill-Qwen-**7B** | Q4_K_M | ~4.5–5 GB | ✅ 流畅 |
| DeepSeek-R1-Distill-Qwen-**14B** | Q4_K_M | ~8–9 GB | ✅ 勉强(上下文长会爆) |
| DeepSeek-R1-Distill-Qwen-**32B** | Q4 | ~20 GB | ❌ 装不下 |
如果你只是**想用 DeepSeek-V4 本身**,最实际的路子是直接调 API(DeepSeek 官方或第三方),而不是本地部署。
---
想让我帮你做下面哪件事?
1. 给你一套在 4070 上本地跑 **7B/14B 蒸馏模型**的具体方案(Ollama / LM Studio / llama.cpp 配置)
2. 讲清楚 **V4-Flash/Pro 在什么硬件、花多少钱**才能本地部署
3. 只是确认下"这卡能不能跑",那答案就是上面——**完整 V4 跑不了,小模型可以**
Sources:
- [DeepSeek-V4 - 百度百科](https://baike.baidu.com/item/DeepSeek-V4/65717031)
- [SAIFIINDUSTRIES/deepseek-v4-pro · Hugging Face](https://huggingface.co/SAIFIINDUSTRIES/deepseek-v4-pro)
- [RedHatAI/DeepSeek-V4-Flash · Hugging Face](https://huggingface.co/RedHatAI/DeepSeek-V4-Flash)
- [What Is DeepSeek V4? - apidog](https://apidog.com/blog/what-is-deepseek-v4/)
- [DeepSeek-V4-Pro-0813: Agent Leap + Price Hike Coming - orcarouter](https://www.orcarouter.ai/blog/deepseek-v4-pro-0813-official-release)
这就是完整的对话记录。 表面上只有“两问两答”,但实际上AI在第二轮中触发了WebSearch工具调用,检索了10个网页来源,生成了一个包含双表格、详细参数、多方案建议的长篇回答。
二、账单解析:Token都消耗在哪里了?
有了完整的对话内容,我们来逐项拆解账单:
2.1 为什么输入Token高达34,507(未命中)+ 88,320(缓存命中)?
关键认知:每次请求,模型都要重新读取整个对话历史。
当我在第二轮提问时,系统实际提交给模型的输入内容包括:
| 组成部分 | 预估Token数 |
|---|---|
| 第一轮用户提问“技嘉4070 RTX 12G” | ~15 |
| 第一轮AI的长篇回复(含6个要点列表) | ~350 |
| 第二轮用户提问“这个模型能跑deepseek v4吗?” | ~20 |
| Claude Code系统提示词(工具定义、规则、格式要求等) | ~15,000-20,000 |
| WebSearch工具调用指令 | ~500 |
| WebSearch返回的10个搜索结果摘要 | ~10,000 |
| 对话元数据(时间戳、会话ID、权限模式等) | ~500 |
| 合计 | ~34,507 |
这其中,第一次的完整对话内容与几分钟前提交的内容完全一致,DeepSeek API检测到后直接返回缓存结果——这就是那88,320个缓存命中Token的由来。
2.2 为什么V4-Pro请求了5次?
Claude Code的工作机制决定了单次用户提问可能触发多次模型调用:
- 第1次:处理第一轮“技嘉4070”的问题(无工具调用,一次完成)
- 第2次:处理第二轮问题,生成WebSearch工具调用
- 第3次:处理WebSearch返回的搜索结果
- 第4次:生成最终回答的主体部分
- 第5次:因回答内容过长(含双表格),触发续写生成
而V4-Flash只请求了1次,因为第一轮回答无需工具调用,内容也较短。
2.3 输出Token为什么有3,216?
| 输出内容 | 预估Token数 |
|---|---|
| 第一轮AI回复(6个要点列表) | ~300 |
| 第二轮AI回复(双表格 + 详细分析 + 3个选项 + 5个来源链接) | ~2,900 |
| 合计 | ~3,216 |
两轮对话的输出加起来超过3200个Token——这已经不是“简单回答”了,而是一篇完整的硬件兼容性分析报告。
三、什么是“缓存命中”?为什么它能省钱?
3.1 缓存机制的核心逻辑
大模型API的上下文缓存(Prompt Caching),本质是一个简单的经济学原理:同样的输入,只算一次钱。
当你向模型提交请求时,系统会将你的输入内容进行哈希计算。如果在设定的时间窗口内(DeepSeek通常为5-10分钟),有人提交了完全相同的内容,API服务器就无需重新计算这些Token的注意力机制,直接返回缓存结果。
3.2 哪些内容容易被缓存?
从我的账单来看,命中缓存的88,320个Token主要包括:
- ✅ 第一轮的完整对话(用户提问 + AI回复)
- ✅ 固定的系统提示词(Claude Code的工具定义)
- ✅ 对话元数据中不变的部分
未命中的34,507个Token包括:
- ❌ 第二轮的新问题
- ❌ WebSearch的查询参数和返回结果
- ❌ 时间戳、会话ID等动态信息
- ❌ 模型生成的工具调用指令
3.3 缓存的价值有多大?
如果没有缓存机制,我的账单将是:
- 输入Token:34,507 + 88,320 = 122,827个
- 按调价前的V4-Pro价格(3元/百万输入)计算:
- 122,827 × 3 / 1,000,000 ≈ 0.37元
加上输出费用(3216 × 6/百万 ≈ 0.02元),总费用约0.39元。
而有了缓存,那88,320个Token的费用被大幅削减(调价前缓存命中仅0.025元/百万),最终账单0.42元——缓存机制将输入成本降低了约90%以上。
四、DeepSeek调价:峰谷定价时代来临
4.1 新价格方案速览
2026年8月17日0时起,DeepSeek正式执行峰谷分时定价:
| 时段 | V4-Pro 缓存命中输入 | V4-Pro 缓存未命中输入 | V4-Pro 输出 |
|---|---|---|---|
| 空闲时段(18:00-次日9:00) | 0.15元/百万 | 4.5元/百万 | 13.5元/百万 |
| 高峰时段(9:00-12:00, 14:00-18:00) | 0.30元/百万 | 9.0元/百万 | 27.0元/百万 |
V4-Flash同步调整:
| 时段 | Flash 缓存命中输入 | Flash 缓存未命中输入 | Flash 输出 |
|---|---|---|---|
| 空闲时段 | 0.05元/百万 | 1.5元/百万 | 4.5元/百万 |
| 高峰时段 | 0.10元/百万 | 3.0元/百万 | 9.0元/百万 |
4.2 涨幅有多猛?
以V4-Pro为例,对比调价前的价格(缓存命中0.025元、缓存未命中3元、输出6元):
| 计费项 | 调价前 | 高峰时段新价 | 涨幅 |
|---|---|---|---|
| 缓存命中输入 | 0.025元/百万 | 0.30元/百万 | ↑ 1100% |
| 缓存未命中输入 | 3元/百万 | 9.0元/百万 | ↑ 200% |
| 输出 | 6元/百万 | 27.0元/百万 | ↑ 350% |
缓存命中从“几乎免费”变成了“仍然便宜但不再免费”——这是此次调价最值得关注的变化。
4.3 用我的账单算一笔账
如果我的这段对话发生在调价后的高峰时段(如工作日下午2-6点):
| 计费项 | Token数 | 新价格(高峰) | 费用 |
|---|---|---|---|
| 缓存命中输入 | 88,320 | 0.30元/百万 | 0.0265元 |
| 缓存未命中输入 | 34,507 | 9.0元/百万 | 0.3106元 |
| 输出 | 3,216 | 27.0元/百万 | 0.0868元 |
| V4-Flash输出 | 188 | 9.0元/百万 | 0.0017元 |
| 合计 | 0.4256元 |
原来0.42元的账单,调价后在高峰时段仍然是0.42元——这恰好说明我的账单已经被新价格覆盖了。
4.4 为什么要涨价?
DeepSeek官方的解释是:通过市场化价格手段调节算力负载,引导企业与开发者错峰调度任务,从而平衡日间算力拥堵,提升平台整体服务稳定性。
高盛在7月研报中指出,DeepSeek实施高峰时段价格调整,不意味着需求走弱,反而反映出国内AI模型需求持续旺盛、算力资源趋紧,行业竞争正在从激进的价格战逐步回归更理性的定价框架。
一个可参考的数据:2026年8月1日,DeepSeek V4-Flash单日处理Token总量达8万亿。如此庞大的算力需求下,通过峰谷定价引导错峰使用,确实是合理之举。
五、对开发者的影响与应对策略
5.1 影响最大的场景
长文本处理、多轮对话、工具调用等高频场景受影响最为明显。
以我的对话为例,如果每天有100次类似的“工具调用 + 长回答”对话:
- 单次对话成本约0.42元
- 每日成本约42元,每月约1260元
这对个人开发者或小团队来说,是一笔不可忽视的开支。
5.2 实际案例:独立开发者的成本困境
据媒体报道,一位独立开发者开发的文档总结工具日均调用量约200万tokens,调价后高峰时段单日成本将从约18元飙升至70元以上。
“要么把服务挪到夜间跑,要么只能涨价或限制免费额度。”——这位开发者的话,道出了许多中小团队的困境。
5.3 省钱策略建议
1. 错峰调用,用好空闲时段
闲时价格为高峰时段的一半。对于非实时性任务(如批量文档处理、数据分析、模型微调数据准备等),尽量安排在夜间或周末运行。
2. 善用缓存机制
- 保持对话上下文的连续性,避免频繁新建会话
- 对固定的系统提示词、工具定义等,利用缓存优势重复使用
- 多个用户使用相同Prompt时,缓存命中率会大幅提升
3. 根据场景选模型
| 场景 | 推荐模型 | 理由 |
|---|---|---|
| 简单问答、代码补全 | V4-Flash | 高峰缓存命中仅0.10元/百万 |
| 复杂推理、长文档、Agent任务 | V4-Pro | 更强的推理能力,按需使用 |
V4-Flash的高峰时段缓存命中价格为0.10元/百万tokens,远低于V4-Pro的0.30元。把非核心任务切到Flash,能显著降低成本。
4. 监控账单,建立成本意识
建议定期检查API调用记录,重点关注:
- 缓存命中率(越高越好)
- 高峰/空闲时段的调用比例
- 单次对话的平均Token消耗
- 异常高消耗的会话
5.4 我的账单告诉我们的道理
回到开头的账单,0.42元得到了什么?
| 产出 | 价值 |
|---|---|
| 硬件兼容性判断 | 确认RTX 4070无法运行DeepSeek-V4 |
| 技术原理分析 | 解释MoE架构的显存需求 |
| 替代方案建议 | 推荐7B/14B蒸馏模型及部署方案 |
| 5个权威来源引用 | 提供可验证的信息出处 |
0.42元买到的是一份完整的硬件选型决策参考——如果自己去查,可能需要花半小时浏览十几个网页。从时间成本角度看,这性价比极高。
六、总结:涨价不一定是坏事
此次DeepSeek API调价,虽然让部分开发者感到压力,但有几点积极信号值得关注:
-
V4-Pro正式版功能升级:同步上线了Agent工作流能力、灵活推理强度设置、原生支持OpenAI Responses API,企业级应用场景得到了更强的性能支撑。
-
普通用户不受影响:网页端和App端的日常使用依然免费,此次调整仅针对API调用。
-
峰谷定价是行业成熟标志:从“价格战”到“峰谷定价”,说明大模型行业正在从野蛮扩张走向精细运营。算力资源的市场化配置,长期看有利于整个生态的健康发展。
-
缓存机制仍然是省钱利器:即使涨价1100%,缓存命中仍然是所有计费项中最便宜的一项(0.30元/百万,对比未命中输入的9元/百万)。合理利用缓存,仍能大幅降低成本。
作为开发者,与其抱怨涨价,不如建立对计费机制的深入理解,学会在“高峰”与“空闲”、“缓存命中”与“缓存未命中”、“Pro”与“Flash”之间做出最优的性价比选择。
附:我的CC Switch配置
sonet: deepseek-v4-pro
opus: deepseek-v4-pro
fable: deepseek-v4-pro
haiku: deepseek-v4-flash
参考资料:
- DeepSeek官方API调价公告(2026年8月13日)
- 高盛《中国AI模型需求与算力价格分析》(2026年7月)
- 各媒体关于DeepSeek峰谷定价的报道
- 作者本人的Claude Code + DeepSeek对话账单记录(2026年8月17日)
更多推荐

所有评论(0)