适用范围

本文分析 2026 年 8 月 17 日 deepseek-v4-pro 的两段实际 API 账单:

  • 08:00–09:00:空闲时段;
  • 09:00–10:00:高峰时段。

目标是验证新峰谷价格是否进入实际计费,并说明为什么“高峰单价翻倍”不等于“任意两小时账单总额翻倍”。本文只分析计费,不比较模型能力、响应质量或延迟。

在这里插入图片描述

1. 账单字段与价格

原始 amount 账单按小时、模型和计费类型拆分,包含:

  • input_cache_hit_tokens
  • input_cache_miss_tokens
  • output_tokens
  • request_count

价格字段单位为人民币/Token,换算为人民币/百万 Token 后如下:

类型 空闲单价 高峰单价 倍率
input_cache_hit_tokens 0.15 0.30
input_cache_miss_tokens 4.5 9
output_tokens 13.5 27

高峰时段为每天 9:00–12:00、14:00–18:00,其余为空闲时段。账单在 09:00 边界后准确切换到高峰单价。

2. 08:00–09:00空闲账单

类型 Token 数 单价(元/Token) 费用
缓存命中输入 9,509,120 0.00000015 1.426368 元
未缓存输入 15,196 0.0000045 0.068382 元
输出 22,764 0.0000135 0.307314 元
合计 9,547,080 1.802064 元

请求数为 47。费用复算:

9,509,120 × 0.00000015 = 1.426368
   15,196 × 0.0000045  = 0.068382
   22,764 × 0.0000135  = 0.307314
                              ────────
                              1.802064 元

复算结果与 cost 账单一致。

3. 09:00–10:00高峰账单

类型 Token 数 单价(元/Token) 费用
缓存命中输入 2,487,296 0.0000003 0.7461888 元
未缓存输入 54,913 0.000009 0.494217 元
输出 27,740 0.000027 0.74898 元
合计 2,569,949 1.9893858 元

请求数为 16。费用复算:

2,487,296 × 0.0000003 = 0.7461888
   54,913 × 0.000009  = 0.494217
   27,740 × 0.000027  = 0.74898
                             ─────────
                             1.9893858 元

复算结果同样与 cost 账单一致。

4. 为什么不能直接比较两小时总额

空闲时段费用为 1.802064 元,高峰时段为 1.9893858 元,后者只高 10.39%。这不代表峰谷价差是 10.39%,因为两个时段的请求量和 Token 构成不同:

  • 请求数从 47 降至 16;
  • 缓存命中 Token 从 9,509,120 降至 2,487,296;
  • 未缓存输入从 15,196 增至 54,913;
  • 输出从 22,764 增至 27,740。

总账单是“Token 数 × 对应单价”的加总。只有保持 Token 数与类型不变,才能比较峰谷价格带来的纯计费差异。

5. 对高峰工作量做反事实计算

保持 09:00–10:00 的 Token 数不变,改用空闲单价:

cache_hit  = 2,487,296 × 0.00000015 = 0.3730944
cache_miss =    54,913 × 0.0000045  = 0.2471085
output     =    27,740 × 0.0000135  = 0.37449
                                          ─────────
                                          0.9946929 元
计费方式 费用
高峰实际费用 1.9893858 元
相同 Token 按空闲价 0.9946929 元
高峰额外费用 0.9946929 元

由于三类价格均翻倍,相同 Token 构成在空闲时段可节省 50%。这是基于实际 Token 数的反事实费用,不是另一次同任务 A/B 测试。

6. Cache Hit、Miss与Output的成本关系

新价格保持了三类 Token 之间的固定倍率:

cache_miss / cache_hit = 30
output / cache_hit     = 90
output / cache_miss    = 3

高峰时段中:

  • 2,487,296 个缓存命中 Token 费用为 0.7461888 元;
  • 27,740 个输出 Token 费用为 0.74898 元。

输出 Token 数只有缓存命中的约 1.12%,费用却略高。这说明长程 Agent 的成本优化不能只关注输入总长度,还应控制输出冗余,并尽量保持可复用前缀稳定以提高缓存命中。

7. 调度建议与边界

适合错峰的任务:仓库索引、批量测试生成、文档生成、静态审查、多 Agent 探索、可排队的重构与迁移。

不适合强制错峰的任务:线上故障、交互式调试、需要人工连续反馈的任务,以及有明确完成时限的发布操作。

本文没有进行相同提示词、相同项目快照的峰谷性能测试,因此不讨论响应速度和模型输出是否一致。账单只证明价格切换和实际成本,不证明模型能力变化。

官方来源:

#DeepSeek #API计费 #Token成本 #Agent #AI编程

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐