2026年8月13日,DeepSeek宣布取消统一API单价,上线峰谷分时计费机制,新规将于8月17日正式生效。其中,V4-Pro缓存命中输入在高峰时段价格从0.025元/百万Token涨至0.30元/百万Token,涨幅达1100%,成为本轮调价中幅度最大的单项。

本文梳理DeepSeek V4系列全部价格变动明细,对比Kimi K3、GLM-5.2、GPT-4o等主流模型的当前定价,复盘近两年行业价格走势的三阶段演变,并结合典型业务场景给出可直接落地的成本优化方案。

前言

2026年上半年的国产大模型市场呈现明显分化。5-6月,DeepSeek、小米等通用模型完成多轮调价,常规场景价格下探,有效降低了开发者的日常调用成本。但高端商用模型赛道状态不同,智谱等头部模型长期存在算力供给紧张的情况,接口配额有限、价格整体稳定,并没有出现同步降价。

进入8月,大模型API定价出现较为明显的调整趋势。8月13日,DeepSeek公布全新计费规则,取消统一单价,上线峰谷分时定价机制。其中,V4-Pro缓存命中输入在高峰时段价格从0.025元涨至0.30元——11倍的差距并非整体涨价幅度,而是单一细分场景从促销期推广价到峰谷计费高峰价的极端变化。这个数字引起了开发者社区的最大关注,但真实的成本影响取决于调用时段和场景选择。

在此之前,Kimi、智谱、阿里云、腾讯云等厂商均已完成不同程度的价格调整。行业整体不再依赖低价策略,开始转向更精细化的分层计费模式。

一、本次调价核心:取消统一单价,采用峰谷分时计费

新定价规则将于8月17日正式生效,最主要的变化是告别固定单价,根据日间算力负载区分高峰、空闲两个计费时段:

高峰时段:09:00-12:00、14:00-18:00,业务调用集中、算力负载高,单价更高

空闲时段:其余时间段,单价为高峰时段的50%

分时计费的核心逻辑是通过价格差异引导流量错峰,缓解日间算力压力,同时匹配不同时段的算力成本。

二、详细涨幅数据:各场景价格变动一览

1、DeepSeek-V4-Flash 价格变动(单位:元/百万Token)
输入(缓存命中):旧价 0.02 → 空闲 0.05(↑150%)→ 高峰 0.10(↑400%)

输入(缓存未命中):旧价 1.00 → 空闲 1.50(↑50%)→ 高峰 3.00(↑200%)

输出:旧价 2.00 → 空闲 4.50(↑125%)→ 高峰 9.00(↑350%)

2、DeepSeek-V4-Pro 价格变动(单位:元/百万Token)
输入(缓存命中):旧价 0.025 → 空闲 0.15(↑500%)→ 高峰 0.30(↑1100%)

输入(缓存未命中):旧价 3.00 → 空闲 4.50(↑50%)→ 高峰 9.00(↑200%)

输出:旧价 6.00 → 空闲 13.50(↑125%)→ 高峰 27.00(↑350%)

几点观察:

涨幅最高的缓存命中场景,恰恰是5月那轮降价中力度最大的——从0.025到0.30,本质上是促销期价格向正常商业价格的回归

非缓存输入和输出场景的涨幅相对温和(50%-350%),且空闲时段价格仅为高峰时段的50%,给了开发者明确的成本优化空间

V4-Pro输出在高峰时段单价为27元/百万Token,约为旧价(6元)的4.5倍,对重输出场景影响较大

三、近两年大模型价格走势复盘

回看近两年行业价格变化,不同阶段的调价逻辑并不一致,可以简单分为三个阶段。

阶段一:早期低价竞争(2024年-2025年)

国产大模型同质化较高,技术差异不明显,厂商主要通过低价、免费额度、补贴吸引开发者。这类降价更多是运营策略,缺少真实成本支撑。

阶段二:技术驱动降价(2026年5-6月)

今年5-6月的价格下调,核心驱动是架构层面的技术优化。通过多级缓存、稀疏算力、国产算力适配等方案,推理的显存占用和并发开销得到有效控制,厂商实现了真实的推理成本下降。

这也是为什么在HBM硬件半年涨幅超500%、海外模型涨价的背景下,国产通用模型依然能做到降价——属于技术红利释放。

阶段三:分层定价启动(2026年8月至今)

技术优化的降本空间有上限,而算力、机房、运维等刚性成本持续上行。多家主流厂商今年均有不同程度的价格调整,行业从“单一低价竞争”进入“分层定价”阶段:

通用基础场景:价格趋于平稳,竞争依然激烈

高端复杂场景:具备Agent、长文本、复杂推理能力的模型,定价逐步脱离低价区间

四、主流大模型 API 价格横向对比(2026.8)

统一换算标准:1美元≈7.2元,单位为「元/百万Token」,均为官方标准按量定价,不含大客户折扣。

4.1 输入/输出价格对比

DeepSeek-V4-Flash(空闲):输入 1.50 / 输出 4.50(128K,性价比突出)

DeepSeek-V4-Flash(高峰):输入 3.00 / 输出 9.00(128K,常规时段)

DeepSeek-V4-Pro(空闲):输入 4.50 / 输出 13.50(128K,高端场景首选)

DeepSeek-V4-Pro(高峰):输入 9.00 / 输出 27.00(128K,接近国产高端价位)

GLM-5.2:输入 ≈8.00 / 输出 ≈28.00(1M,行业参考均价)

Qwen3-Max:输入 ≈8.64 / 输出 ≈43.20(262K,汇率折算)

GPT-4o:输入 ≈18.00 / 输出 ≈72.00(128K,汇率折算)

Kimi K3:输入 20.00 / 输出 100.00(1M,缓存输入优惠显著)

DeepSeek在空闲时段性价比依然突出;V4-Pro高峰时段虽已接近GLM-5.2价位,但输出价格仍不到Kimi K3和GPT-4o的一半。

4.2 缓存价格对比(RAG/客服场景重点参考)

DeepSeek-V4-Pro(空闲):缓存输入 0.15(降幅 96.7%)

Qwen3-Max:缓存输入 ≈1.73(降幅 80%)

GLM-5.2:缓存输入 ≈2.00(降幅 75%)

Kimi K3:缓存输入 2.00(降幅 90%)

GPT-4o:缓存输入 ≈9.00(降幅 50%)

缓存场景下,DeepSeek空闲时段的价格优势极为明显,特别适合高频重复查询类业务。

五、怎么理解这次调价?

1、阶段性低价推广结束,价格回归常态

2026年年中的低价,属于V4系列正式上线前的短期推广让利。随着版本稳定、用户体量增长,阶段性优惠结束,定价回归正常商业区间。

2、分时定价本质是资源配置工具

通过峰谷价差引导非紧急任务错峰执行,既缓解了日间算力拥堵,又降低了空闲时段资源闲置——这对厂商和开发者其实是双赢设计。

3、高端模型能力在增值

V4-Pro在推理精度、工具调用、长文本稳定性、Agent执行上持续迭代,对应的定价也更贴合企业级场景的服务价值。

4、行业成本结构在变化

算力、显存、集群运维等基础成本长期上行,厂商难以长期维持超低价,行业整体进入价格修复阶段。

六、开发者成本测算与控本方案

1、典型场景:中型AI客服

业务参数:日均3万次对话,月输入Token 7.2亿、月输出Token 3.6亿

DeepSeek-V4-Pro 旧价:≈3,240 元/月(基准)

DeepSeek-V4-Pro 空闲时段:≈7,020 元/月(↑117%)

DeepSeek-V4-Pro 高峰时段:≈13,680 元/月(↑322%)

GLM-5.2:≈15,350 元/月

GPT-4o:≈38,880 元/月

Kimi K3:≈43,200 元/月

同样业务量下,V4-Pro从旧价切换到高峰时段调用,每月多支出约1万元;选择空闲时段调用,则多支出约3,780元/月,成本增幅可控。

2、四条可落地的控本策略

策略一:非实时任务错峰调度

文档解析、批量知识库导入、离线问答生成等对延时不敏感的任务,统一调度到空闲时段执行,直接降低近一半成本,同时避开高峰拥堵。

策略二:充分利用缓存能力

固定Prompt、高频FAQ、知识库问答场景,接入模型缓存或自研语义缓存。缓存输入成本远低于普通输入,是目前性价比最高的控本手段。

策略三:按场景分层选型

简单文本处理、短句问答、摘要 → V4-Flash

复杂推理、工具调用、高精度业务 → V4-Pro

压缩高峰时段的高端模型调用占比

策略四:多模型动态兜底

配置多模型降级策略,避免单一模型涨价带来的成本激增。国内外模型价差持续变化,可灵活选型。

七、总结
本次DeepSeek调价,是行业定价回归理性的正常表现。前期技术优化让开发者获得了一轮低成本红利;现阶段受算力成本、服务稳定性、模型能力迭代影响,分层计费成为主流。

对开发者而言,完全依赖低价模型粗放调用的阶段已经过去。通过错峰调度、缓存复用、分层路由、多模型混合部署等工程化手段,依然可以有效控制API成本。

声明:本文数据来源于DeepSeek、Kimi、智谱官方公告及公开报道,仅供参考,具体价格以各平台官方文档为准。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐