调用 GPT、Claude、DeepSeek API 时,一个很常见的问题就是:

100万 Token 到底多少钱?

这个问题不能只看一个数字,因为大模型 API 通常会分别计算输入 Token、输出 Token 和缓存 Token,同一个模型的输入和输出价格可能相差几倍,不同模型之间的价格差距更大。

本文根据 2026 年 8 月 17 日 OpenAI、Anthropic、DeepSeek 官方 API 定价,整理目前主要模型的 Token 价格,并用一个实际场景算一下调用成本。

本文只比较标准文本 API 的 Token 费用,不包含 Web Search、图像、语音、区域处理等额外费用。


一、GPT API价格:100万Token多少钱?

OpenAI 当前 GPT-5.6 系列主要包括 GPT-5.6 Sol、Terra 和 Luna。

在 Standard 模式、短上下文情况下,官方价格如下:

模型100万输入Token100万缓存输入Token100万输出Token
GPT-5.6 Sol$5.00$0.50$30.00
GPT-5.6 Terra$2.00$0.20$12.00
GPT-5.6 Luna$0.20$0.02$1.20

以上价格均以每百万 Token 计费。OpenAI 当前将 Sol 定位于复杂专业任务,Terra 强调能力和成本之间的平衡,Luna 则面向成本敏感和高调用量场景。

如果只看普通输入:

模型100万输入Token
GPT-5.6 Sol$5.00
GPT-5.6 Terra$2.00
GPT-5.6 Luna$0.20

如果看输出:

模型100万输出Token
GPT-5.6 Sol$30.00
GPT-5.6 Terra$12.00
GPT-5.6 Luna$1.20

可以看到,GPT-5.6 系列当前的输出价格都是普通输入价格的 6 倍。

所以实际计算 API 成本时,输出长度往往比很多人想象中更重要。


二、Claude API价格:100万Token多少钱?

Anthropic 当前主要 Claude 模型包括 Fable 5、Opus 5、Sonnet 5 和 Haiku 4.5。

标准 API 价格如下:

模型100万输入Token100万缓存命中Token100万输出Token
Claude Fable 5$10.00$1.00$50.00
Claude Opus 5$5.00$0.50$25.00
Claude Sonnet 5$2.00$0.20$10.00
Claude Haiku 4.5$1.00$0.10$5.00

以上均为 Claude 官方第一方 API 标准价格。

如果只看100万普通输入 Token:

模型费用
Claude Fable 5$10.00
Claude Opus 5$5.00
Claude Sonnet 5$2.00
Claude Haiku 4.5$1.00

100万输出 Token则分别为:

模型费用
Claude Fable 5$50.00
Claude Opus 5$25.00
Claude Sonnet 5$10.00
Claude Haiku 4.5$5.00

其中 Claude Sonnet 5 的 $2 / $10 原本属于阶段性价格,但 Anthropic 已在 2026 年 8 月确认将其改为标准价格,此前计划于 9 月上涨到 $3 / $15 的方案已经取消。


三、DeepSeek API价格:100万Token多少钱?

DeepSeek 当前主要 API 模型为:

deepseek-v4-flash
deepseek-v4-pro

截至 2026 年 8 月 17 日,DeepSeek 官方已经采用峰谷定价。

当前价格如下:

模型时段100万缓存命中输入100万缓存未命中输入100万输出
DeepSeek V4 Flash空闲$0.007$0.22$0.66
DeepSeek V4 Flash高峰$0.014$0.44$1.32
DeepSeek V4 Pro空闲$0.022$0.66$1.98
DeepSeek V4 Pro高峰$0.044$1.32$3.96

DeepSeek 官方规定的高峰时间是 UTC 01:00-04:0006:00-10:00,换算成北京时间就是 9:00-12:00 和 14:00-18:00,其他时间使用空闲价格。空闲价格为高峰价格的一半。

因此只计算100万普通、未命中缓存的输入 Token:

模型空闲时段高峰时段
DeepSeek V4 Flash$0.22$0.44
DeepSeek V4 Pro$0.66$1.32

100万输出 Token:

模型空闲时段高峰时段
DeepSeek V4 Flash$0.66$1.32
DeepSeek V4 Pro$1.98$3.96

DeepSeek 官方当前还显示,V4 Flash 和 V4 Pro 都支持 1M 上下文,并支持 Responses API、Anthropic API 等接口。


四、GPT、Claude、DeepSeek API价格放一起对比

为了方便直接比较,下面先不考虑缓存,只看普通输入和输出 Token

模型100万输入Token100万输出Token
GPT-5.6 Sol$5.00$30.00
GPT-5.6 Terra$2.00$12.00
GPT-5.6 Luna$0.20$1.20
Claude Fable 5$10.00$50.00
Claude Opus 5$5.00$25.00
Claude Sonnet 5$2.00$10.00
Claude Haiku 4.5$1.00$5.00
DeepSeek V4 Flash 空闲$0.22$0.66
DeepSeek V4 Flash 高峰$0.44$1.32
DeepSeek V4 Pro 空闲$0.66$1.98
DeepSeek V4 Pro 高峰$1.32$3.96

GPT 价格来自 OpenAI 官方价格页,Claude 来自 Anthropic 官方价格页,DeepSeek 则按照当前峰谷价格计算。

如果只比较每百万 Token 的标价,GPT-5.6 Luna 和 DeepSeek V4 Flash 都处于当前较低的价格区间。

但这里需要注意:

价格表只能说明相同数量的计费Token分别多少钱,不能直接说明完成同一个任务谁一定更便宜。


五、100万输入 + 20万输出,实际多少钱?

单纯比较100万输入或者100万输出并不是特别符合实际使用。

假设某个业务累计产生:

Token类型数量
输入Token100万
输出Token20万

暂时不考虑缓存、工具调用等额外费用。

按照当前标准价格计算:

模型100万输入20万输出合计
GPT-5.6 Sol$5.00$6.00$11.00
GPT-5.6 Terra$2.00$2.40$4.40
GPT-5.6 Luna$0.20$0.24$0.44
Claude Fable 5$10.00$10.00$20.00
Claude Opus 5$5.00$5.00$10.00
Claude Sonnet 5$2.00$2.00$4.00
Claude Haiku 4.5$1.00$1.00$2.00
DeepSeek V4 Flash 空闲$0.22$0.132$0.352
DeepSeek V4 Flash 高峰$0.44$0.264$0.704
DeepSeek V4 Pro 空闲$0.66$0.396$1.056
DeepSeek V4 Pro 高峰$1.32$0.792$2.112

计算方式就是:

总费用
=
输入Token数量 × 输入单价
+
输出Token数量 × 输出单价

这张表更适合回答:

如果我的业务已经知道输入、输出Token规模,大概需要准备多少API预算?

但它仍然只是理论成本。


六、同样一段文本,不一定产生同样数量的Token

这一点在跨模型比价时很容易忽略。

“100万 Token”是统一的计费数量单位,但并不意味着把完全相同的一批文本分别提交给不同模型,最后一定都会得到完全相同的 Token 数。

Anthropic 例如明确说明,Claude 4.7 及之后的模型采用了新的 Tokenizer,同样文本大约会产生更多 Token,具体差距根据内容和任务而变化。

因此:

GPT:$2 / 百万输入Token
Claude:$2 / 百万输入Token

只能说明两者的每百万Token标价相同

不能直接推导成:

同一份文档调用一次一定花一样多的钱

真实业务最好直接读取不同模型 API 返回的实际 Token Usage,再计算成本。


七、缓存价格也不能只看“Cache Hit”

长对话、RAG、代码仓库分析和 Agent 场景中,很多请求会重复发送 System Prompt、工具定义或者大段上下文。

这时候缓存可能明显降低成本。

例如:

模型普通输入缓存命中输入
GPT-5.6 Sol$5.00$0.50
GPT-5.6 Terra$2.00$0.20
GPT-5.6 Luna$0.20$0.02
Claude Sonnet 5$2.00$0.20
Claude Haiku 4.5$1.00$0.10
DeepSeek V4 Flash 空闲$0.22$0.007
DeepSeek V4 Pro 空闲$0.66$0.022

不过这里不能简单理解成:

打开缓存以后所有输入都会自动按照缓存命中价收费。

OpenAI GPT-5.6 当前缓存写入按照普通输入价格的 1.25 倍收费,例如 Terra 短上下文普通输入为 $2 / MTok,Cache Write 为 $2.50 / MTok

Claude 同样区分缓存写入和缓存命中。

以 Claude Sonnet 5 为例:

类型100万Token价格
普通输入$2.00
5分钟缓存写入$2.50
1小时缓存写入$4.00
缓存命中$0.20

所以判断缓存到底能不能省钱,需要看:

缓存写入成本
+
后续命中次数
+
每次命中的Token数量

同一段长上下文复用次数越多,缓存的价值通常越明显。


八、长上下文也可能改变API价格

GPT-5.6 还有一项容易漏掉的价格规则。

当单次请求的输入超过 272K Token 时,GPT-5.6 Sol、Terra、Luna 会对整个请求按照长上下文价格收费:输入价格变为普通价格的2倍,输出价格变为1.5倍。

对应价格如下:

模型短上下文输入长上下文输入短上下文输出长上下文输出
GPT-5.6 Sol$5$10$30$45
GPT-5.6 Terra$2$4$12$18
GPT-5.6 Luna$0.20$0.40$1.20$1.80

Claude 当前的规则不同。

Anthropic 官方说明,Claude 4.6 及之后的模型在完整 1M 上下文范围内仍然使用标准 Token 单价,不额外收取长上下文溢价。

所以如果业务涉及几十万 Token 的长文档、代码仓库或者大型 RAG 上下文,不能只看首页展示的普通 Token 单价。


九、为什么最便宜的模型不一定让业务成本最低?

假设模型 A:

单次调用成本:$0.01
平均完成任务需要:5次

那么完成一次任务需要:

$0.05

模型 B:

单次调用成本:$0.03
平均完成任务需要:1次

最终只需要:

$0.03

模型 A 每次调用明明更便宜,实际完成任务却更贵。

因此在生产环境里,最终应该比较的不是:

每调用一次多少钱

而是:

成功完成一次业务任务多少钱

这也是为什么不能只根据价格表判断一个模型是不是“更省钱”。


十、实际做API成本测试,建议记录哪些数据?

如果只是刚开始调用 API,看官方价格表基本够用。

当调用规模增加以后,建议至少记录:

指标主要用途
平均输入Token判断Prompt和上下文成本
平均输出Token判断生成成本
缓存命中Token判断缓存收益
平均调用次数判断一个任务需要请求多少次
重试率判断失败请求浪费多少成本
任务成功率判断模型输出是否真正可用
单任务成本判断最终业务成本

其中最值得关注的是:

单任务成本
=
这一类任务产生的全部API费用
÷
成功完成的任务数量

例如客服业务可以看“成功解决一次用户问题花多少钱”,代码 Agent 可以看“成功完成一次开发任务花多少钱”。

这通常比“100万 Token 单价”更接近真实业务价值。


十一、GPT、Claude、DeepSeek怎么比较更合理?

如果只是做第一轮模型筛选,可以先通过官方 Token 价格确定一个自己能够接受的成本范围。

但真正上线之前,不建议直接根据“最便宜”或者“最贵”决定模型。

更合理的方法是准备同一批真实业务样本,让几个候选模型完成相同任务,然后统一比较:

维度需要观察什么
任务质量结果能不能直接使用
成功率一次完成任务的比例
Token消耗实际输入和输出多少
响应速度是否满足线上需求
重试次数是否频繁需要重新调用
单任务成本最终完成一次任务多少钱

这样得到的结果才是真正属于自己业务的 API 成本对比。


总结

截至 2026 年 8 月 17 日,GPT、Claude、DeepSeek 的官方 API Token 价格差异比较明显。

如果只想知道:

100万 Token 多少钱?

首先至少需要区分:

类型为什么要区分
输入Token每个模型基础输入价格不同
输出Token通常明显贵于输入
缓存Token命中后价格可能明显下降
Cache Write部分服务写入缓存也会收费
长上下文部分模型会使用更高单价

所以“100万 Token”本身并不是一个完整的 API 成本答案。

价格表能告诉我们:

100万计费Token理论上需要多少钱。

真正决定生产环境账单的,则是:

一个真实任务到底消耗多少Token、需要调用几次,以及最终能不能成功完成。

如果调用量已经比较大,比单纯追求“每百万 Token 最低价”更值得做的是:记录实际 Token Usage、缓存命中率、失败重试率和单任务成本,再根据自己的业务数据决定最终使用哪个模型。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐