从一次真实对话的账单说起,一文读懂大模型API计费的核心逻辑


前言:一次“看似简单”的对话,一张“让人困惑”的账单

最近,我在使用Claude Code + CC Switch + DeepSeek底座完成了一段对话后,看到账单时陷入了沉思:

deepseek-v4-flash: 请求1次,输入428,输出188
deepseek-v4-pro: 请求5次,输入(命中缓存)88320,输入(未命中)34507,输出3216
总费用:0.42元

两轮对话,居然产生了88,320个缓存命中Token和34,507个未命中Token? 明明只说了两句话,为什么Token消耗如此之大?

更巧合的是,就在同一天(2026年8月17日),DeepSeek正式实施峰谷分时定价新规,部分场景的缓存命中价格上涨高达1100%

要理解账单背后的逻辑,得先看完整的对话内容。


一、真实对话全文:到底说了什么?

以下是我与Claude Code(搭载CC Switch + DeepSeek底座)的完整对话记录:

第一轮对话

用户(2026/8/17 14:42:03):

技嘉4070 RTX 12G

AI(2026/8/17 14:42:11):

你提到的是技嘉(Gigabyte)的 GeForce RTX 4070 12GB 显卡。请问你想了解或处理什么?比如:

- **规格参数**:核心频率、显存、功耗(TGP)、接口等
- **游戏性能**:在 1080p / 1440p / 4K 下的帧率表现
- **价格与性价比**:当前行情、和同价位卡(如 4070 Super、7800 XT)对比
- **装机搭配**:电源功率、CPU 搭配、机箱尺寸是否合适
- **驱动 / 使用问题**:驱动安装、黑屏、温度等故障排查
- **确认具体型号**:技嘉 4070 有多个子型号(如 WindForce、Gaming OC、Eagle、AERO 等)

告诉我你具体想做什么,我来帮你。

第二轮对话

用户(2026/8/17 14:42:16):

这个模型能跑deepseek v4吗?

AI(2026/8/17 14:42:29):

[Tool: WebSearch]

此时模型判断需要联网搜索,调用了WebSearch工具。


工具返回(2026/8/17 14:42:38):

Web search results for query: "DeepSeek V4 model release parameters size"

Links: 
- DeepSeek-V4 - 百度百科
- SAIFIINDUSTRIES/deepseek-v4-pro · Hugging Face
- RedHatAI/DeepSeek-V4-Flash · Hugging Face
- Intel/DeepSeek-V4-Flash-W4A16-AutoRound · Hugging Face
- mkreynolds/Deepseek-V4-Flash-oQ3e-mtp · Hugging Face
- What Is DeepSeek V4? - apidog
- DeepSeek-V4-Pro-0813: Agent Leap + Price Hike Coming
- DeepSeek V4来了:在喧哗众声中,按自己的节奏讲开源故事 - 网易
- DeepSeek-V4来了!华为昇腾加持 - 证券时报
- DeepSeek-V4开源:百万上下文,Agent能力比肩顶级闭源模型 - 阿里云开发者

DeepSeek-V4 was released on April 24, 2026 as a preview version, with two Mixture-of-Experts (MoE) models:

- **DeepSeek-V4-Pro**: 1.6T total parameters, 49B activated parameters
- **DeepSeek-V4-Flash**: 284B total parameters, 13B activated parameters

Both versions natively support a **1M token context window** (with up to 384K token output) and use FP4 + FP8 mixed precision for the main releases (base versions use FP8). Training data was reported as roughly 32T tokens for Flash and 33T tokens for Pro.

REMINDER: You MUST include the sources above in your response to the user using markdown hyperlinks.

AI(2026/8/17 14:43:00):

**结论:跑不了完整的 DeepSeek-V4,12GB 显存差了好几个数量级。**

DeepSeek-V4(2026-04-24 发布的预览版)是两个 MoE 模型,关键不是"激活参数"而是**总参数量**——MoE 架构下所有 expert 权重都必须常驻显存,所以得按总量算:

| 模型 | 总参数 | FP8 显存 | FP4 显存 | RTX 4070 (12G) |
|------|--------|----------|----------|----------------|
| V4-Pro | 1.6T(激活 49B) | ~1.6 TB | ~800 GB | ❌ 差 60~130 倍 |
| V4-Flash | 284B(激活 13B) | ~284 GB | ~142 GB | ❌ 差 12~24 倍 |

你的技嘉 4070 只有 **12GB 显存**,别说 V4 了,连完整跑 DeepSeek-V3(671B)也不可能。这类全量 MoE 模型要本地跑,通常需要多张 H100/A100 或大内存 CPU 集群。

**用 CPU + 内存硬跑(GGUF 量化 + offload)也基本不现实**:V4-Flash 即使压到 Q3 也要 100GB+ 内存,速度大概 1~2 token/s,没有实用价值。

---

**那 12GB 到底能本地跑什么 DeepSeek 模型?** 只有**蒸馏小模型**能跑:

| 模型 | 量化 | 显存占用 | 4070 12G |
|------|------|----------|----------|
| DeepSeek-R1-Distill-Qwen-**7B** | Q4_K_M | ~4.5–5 GB | ✅ 流畅 |
| DeepSeek-R1-Distill-Qwen-**14B** | Q4_K_M | ~8–9 GB | ✅ 勉强(上下文长会爆) |
| DeepSeek-R1-Distill-Qwen-**32B** | Q4 | ~20 GB | ❌ 装不下 |

如果你只是**想用 DeepSeek-V4 本身**,最实际的路子是直接调 API(DeepSeek 官方或第三方),而不是本地部署。

---

想让我帮你做下面哪件事?
1. 给你一套在 4070 上本地跑 **7B/14B 蒸馏模型**的具体方案(Ollama / LM Studio / llama.cpp 配置)
2. 讲清楚 **V4-Flash/Pro 在什么硬件、花多少钱**才能本地部署
3. 只是确认下"这卡能不能跑",那答案就是上面——**完整 V4 跑不了,小模型可以**

Sources:
- [DeepSeek-V4 - 百度百科](https://baike.baidu.com/item/DeepSeek-V4/65717031)
- [SAIFIINDUSTRIES/deepseek-v4-pro · Hugging Face](https://huggingface.co/SAIFIINDUSTRIES/deepseek-v4-pro)
- [RedHatAI/DeepSeek-V4-Flash · Hugging Face](https://huggingface.co/RedHatAI/DeepSeek-V4-Flash)
- [What Is DeepSeek V4? - apidog](https://apidog.com/blog/what-is-deepseek-v4/)
- [DeepSeek-V4-Pro-0813: Agent Leap + Price Hike Coming - orcarouter](https://www.orcarouter.ai/blog/deepseek-v4-pro-0813-official-release)

这就是完整的对话记录。 表面上只有“两问两答”,但实际上AI在第二轮中触发了WebSearch工具调用,检索了10个网页来源,生成了一个包含双表格、详细参数、多方案建议的长篇回答。


二、账单解析:Token都消耗在哪里了?

有了完整的对话内容,我们来逐项拆解账单:

2.1 为什么输入Token高达34,507(未命中)+ 88,320(缓存命中)?

关键认知:每次请求,模型都要重新读取整个对话历史。

当我在第二轮提问时,系统实际提交给模型的输入内容包括:

组成部分 预估Token数
第一轮用户提问“技嘉4070 RTX 12G” ~15
第一轮AI的长篇回复(含6个要点列表) ~350
第二轮用户提问“这个模型能跑deepseek v4吗?” ~20
Claude Code系统提示词(工具定义、规则、格式要求等) ~15,000-20,000
WebSearch工具调用指令 ~500
WebSearch返回的10个搜索结果摘要 ~10,000
对话元数据(时间戳、会话ID、权限模式等) ~500
合计 ~34,507

这其中,第一次的完整对话内容与几分钟前提交的内容完全一致,DeepSeek API检测到后直接返回缓存结果——这就是那88,320个缓存命中Token的由来。

2.2 为什么V4-Pro请求了5次?

Claude Code的工作机制决定了单次用户提问可能触发多次模型调用:

  1. 第1次:处理第一轮“技嘉4070”的问题(无工具调用,一次完成)
  2. 第2次:处理第二轮问题,生成WebSearch工具调用
  3. 第3次:处理WebSearch返回的搜索结果
  4. 第4次:生成最终回答的主体部分
  5. 第5次:因回答内容过长(含双表格),触发续写生成

而V4-Flash只请求了1次,因为第一轮回答无需工具调用,内容也较短。

2.3 输出Token为什么有3,216?

输出内容 预估Token数
第一轮AI回复(6个要点列表) ~300
第二轮AI回复(双表格 + 详细分析 + 3个选项 + 5个来源链接) ~2,900
合计 ~3,216

两轮对话的输出加起来超过3200个Token——这已经不是“简单回答”了,而是一篇完整的硬件兼容性分析报告。


三、什么是“缓存命中”?为什么它能省钱?

3.1 缓存机制的核心逻辑

大模型API的上下文缓存(Prompt Caching),本质是一个简单的经济学原理:同样的输入,只算一次钱。

当你向模型提交请求时,系统会将你的输入内容进行哈希计算。如果在设定的时间窗口内(DeepSeek通常为5-10分钟),有人提交了完全相同的内容,API服务器就无需重新计算这些Token的注意力机制,直接返回缓存结果。

3.2 哪些内容容易被缓存?

从我的账单来看,命中缓存的88,320个Token主要包括:

  • ✅ 第一轮的完整对话(用户提问 + AI回复)
  • ✅ 固定的系统提示词(Claude Code的工具定义)
  • ✅ 对话元数据中不变的部分

未命中的34,507个Token包括:

  • ❌ 第二轮的新问题
  • ❌ WebSearch的查询参数和返回结果
  • ❌ 时间戳、会话ID等动态信息
  • ❌ 模型生成的工具调用指令

3.3 缓存的价值有多大?

如果没有缓存机制,我的账单将是:

  • 输入Token:34,507 + 88,320 = 122,827个
  • 按调价前的V4-Pro价格(3元/百万输入)计算:
    • 122,827 × 3 / 1,000,000 ≈ 0.37元

加上输出费用(3216 × 6/百万 ≈ 0.02元),总费用约0.39元

而有了缓存,那88,320个Token的费用被大幅削减(调价前缓存命中仅0.025元/百万),最终账单0.42元——缓存机制将输入成本降低了约90%以上


四、DeepSeek调价:峰谷定价时代来临

4.1 新价格方案速览

2026年8月17日0时起,DeepSeek正式执行峰谷分时定价

时段 V4-Pro 缓存命中输入 V4-Pro 缓存未命中输入 V4-Pro 输出
空闲时段(18:00-次日9:00) 0.15元/百万 4.5元/百万 13.5元/百万
高峰时段(9:00-12:00, 14:00-18:00) 0.30元/百万 9.0元/百万 27.0元/百万

V4-Flash同步调整:

时段 Flash 缓存命中输入 Flash 缓存未命中输入 Flash 输出
空闲时段 0.05元/百万 1.5元/百万 4.5元/百万
高峰时段 0.10元/百万 3.0元/百万 9.0元/百万

4.2 涨幅有多猛?

以V4-Pro为例,对比调价前的价格(缓存命中0.025元、缓存未命中3元、输出6元):

计费项 调价前 高峰时段新价 涨幅
缓存命中输入 0.025元/百万 0.30元/百万 ↑ 1100%
缓存未命中输入 3元/百万 9.0元/百万 ↑ 200%
输出 6元/百万 27.0元/百万 ↑ 350%

缓存命中从“几乎免费”变成了“仍然便宜但不再免费”——这是此次调价最值得关注的变化。

4.3 用我的账单算一笔账

如果我的这段对话发生在调价后的高峰时段(如工作日下午2-6点):

计费项 Token数 新价格(高峰) 费用
缓存命中输入 88,320 0.30元/百万 0.0265元
缓存未命中输入 34,507 9.0元/百万 0.3106元
输出 3,216 27.0元/百万 0.0868元
V4-Flash输出 188 9.0元/百万 0.0017元
合计 0.4256元

原来0.42元的账单,调价后在高峰时段仍然是0.42元——这恰好说明我的账单已经被新价格覆盖了。

4.4 为什么要涨价?

DeepSeek官方的解释是:通过市场化价格手段调节算力负载,引导企业与开发者错峰调度任务,从而平衡日间算力拥堵,提升平台整体服务稳定性。

高盛在7月研报中指出,DeepSeek实施高峰时段价格调整,不意味着需求走弱,反而反映出国内AI模型需求持续旺盛、算力资源趋紧,行业竞争正在从激进的价格战逐步回归更理性的定价框架。

一个可参考的数据:2026年8月1日,DeepSeek V4-Flash单日处理Token总量达8万亿。如此庞大的算力需求下,通过峰谷定价引导错峰使用,确实是合理之举。


五、对开发者的影响与应对策略

5.1 影响最大的场景

长文本处理、多轮对话、工具调用等高频场景受影响最为明显。

以我的对话为例,如果每天有100次类似的“工具调用 + 长回答”对话:

  • 单次对话成本约0.42元
  • 每日成本约42元,每月约1260元

这对个人开发者或小团队来说,是一笔不可忽视的开支。

5.2 实际案例:独立开发者的成本困境

据媒体报道,一位独立开发者开发的文档总结工具日均调用量约200万tokens,调价后高峰时段单日成本将从约18元飙升至70元以上

“要么把服务挪到夜间跑,要么只能涨价或限制免费额度。”——这位开发者的话,道出了许多中小团队的困境。

5.3 省钱策略建议

1. 错峰调用,用好空闲时段

闲时价格为高峰时段的一半。对于非实时性任务(如批量文档处理、数据分析、模型微调数据准备等),尽量安排在夜间或周末运行。

2. 善用缓存机制

  • 保持对话上下文的连续性,避免频繁新建会话
  • 对固定的系统提示词、工具定义等,利用缓存优势重复使用
  • 多个用户使用相同Prompt时,缓存命中率会大幅提升

3. 根据场景选模型

场景 推荐模型 理由
简单问答、代码补全 V4-Flash 高峰缓存命中仅0.10元/百万
复杂推理、长文档、Agent任务 V4-Pro 更强的推理能力,按需使用

V4-Flash的高峰时段缓存命中价格为0.10元/百万tokens,远低于V4-Pro的0.30元。把非核心任务切到Flash,能显著降低成本。

4. 监控账单,建立成本意识

建议定期检查API调用记录,重点关注:

  • 缓存命中率(越高越好)
  • 高峰/空闲时段的调用比例
  • 单次对话的平均Token消耗
  • 异常高消耗的会话

5.4 我的账单告诉我们的道理

回到开头的账单,0.42元得到了什么?

产出 价值
硬件兼容性判断 确认RTX 4070无法运行DeepSeek-V4
技术原理分析 解释MoE架构的显存需求
替代方案建议 推荐7B/14B蒸馏模型及部署方案
5个权威来源引用 提供可验证的信息出处

0.42元买到的是一份完整的硬件选型决策参考——如果自己去查,可能需要花半小时浏览十几个网页。从时间成本角度看,这性价比极高。


六、总结:涨价不一定是坏事

此次DeepSeek API调价,虽然让部分开发者感到压力,但有几点积极信号值得关注:

  1. V4-Pro正式版功能升级:同步上线了Agent工作流能力、灵活推理强度设置、原生支持OpenAI Responses API,企业级应用场景得到了更强的性能支撑。

  2. 普通用户不受影响:网页端和App端的日常使用依然免费,此次调整仅针对API调用。

  3. 峰谷定价是行业成熟标志:从“价格战”到“峰谷定价”,说明大模型行业正在从野蛮扩张走向精细运营。算力资源的市场化配置,长期看有利于整个生态的健康发展。

  4. 缓存机制仍然是省钱利器:即使涨价1100%,缓存命中仍然是所有计费项中最便宜的一项(0.30元/百万,对比未命中输入的9元/百万)。合理利用缓存,仍能大幅降低成本。

作为开发者,与其抱怨涨价,不如建立对计费机制的深入理解,学会在“高峰”与“空闲”、“缓存命中”与“缓存未命中”、“Pro”与“Flash”之间做出最优的性价比选择。


附:我的CC Switch配置

sonet: deepseek-v4-pro
opus: deepseek-v4-pro
fable: deepseek-v4-pro
haiku: deepseek-v4-flash

参考资料:

  • DeepSeek官方API调价公告(2026年8月13日)
  • 高盛《中国AI模型需求与算力价格分析》(2026年7月)
  • 各媒体关于DeepSeek峰谷定价的报道
  • 作者本人的Claude Code + DeepSeek对话账单记录(2026年8月17日)
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐