国产大模型缓存计费真相:GLM/Kimi/DeepSeek/Qwen 四家机制不同(2026-08)
关键词:GLM缓存计费、Kimi K3价格、DeepSeek Context Caching、Qwen隐式缓存、国产大模型API价格、prompt cache、灵眸AI、lmuai、Claude Code 国产模型接入
0. TL;DR
“缓存命中后价格能砍到十分之一甚至更低”——这句话本身没错,但四家国产模型说的不是同一件事,笼统一句话会让你算错自己的真实成本。
- 缓存机制不是同一种:GLM、Kimi、DeepSeek 是自动缓存,Qwen 是显式+隐式两套并存,显式需要手动加
cache_control。 - DeepSeek 刚涨过价(2026年8月16日16:00 UTC生效),且分峰谷时段,本文数据是涨价后的最新价。
- 四家命中价/未命中价的真实折扣比例相差近6倍,不能用一个数字套所有模型。
- 笔者实测接入这四个模型用的是灵眸AI(api。lmuai。com),本文配置示例和实测价格均以此为准,官方直连价与该平台按量价的对比放在第6节。
1. 四家缓存机制对照
| 模型 | 缓存机制 | 是否需要手动配置 |
|---|---|---|
| GLM-5.2(智谱) | 自动识别重复前缀,直接复用 | 不需要 |
| Kimi K3(月之暗面) | 官方文档明确"支持自动上下文缓存" | 不需要 |
| DeepSeek V4系列 | 磁盘缓存,官方文档写"服务自动运行,按实际命中计费" | 不需要,且不需要改代码/改接口 |
| Qwen(阿里云百炼) | 显式缓存(手动加cache_control,5分钟有效期,创建按125%计费,命中按10%计费)+ 隐式缓存(自动生效,无法关闭,命中按20%计费)两套并存 |
显式需要,隐式不需要 |
四家里三家是"装好就自动生效",只有 Qwen 这边如果想要更稳定的命中率,需要额外配置显式缓存的断点。
2. 四家官方价格与真实折扣比例(2026年8月17日核实)
| 模型 | 缓存命中价 | 缓存未命中价 | 输出价 | 命中价/未命中价比例 |
|---|---|---|---|---|
| GLM-5.2(官方直连) | $0.26/M | $1.4/M | $4.4/M | 约18.6% |
| Kimi K3(官方直连) | $0.30/M | $3.00/M | $15.00/M | 约10% |
| DeepSeek V4 Pro(非峰时,新价) | $0.022/M | $0.66/M | $1.98/M | 约3.3% |
| DeepSeek V4 Pro(峰时,新价) | $0.044/M | $1.32/M | $3.96/M | 约3.3% |
DeepSeek 的比例在四家里最低——命中缓存后的价格只是未命中价的约3.3%,比Kimi还低三倍。这不是"DeepSeek更便宜"这个笼统结论能覆盖的,因为未命中价本身也在四家里同样最低,两个变量叠在一起看才是真实情况。
3. 一个可运行的费用计算器
不同模型缓存命中率不一样,与其记价格表,不如记一个公式,自己代入真实用量算:
# 四家国产模型缓存费用计算器,单位:美元
# 价格数字来自各官方文档,2026-08-17核实
PRICE_USD_PER_MILLION = {
"glm-5.2": {"cached": 0.26, "uncached": 1.4, "output": 4.4},
"kimi-k3": {"cached": 0.30, "uncached": 3.00, "output": 15.0},
"deepseek-v4-pro-off": {"cached": 0.022, "uncached": 0.66, "output": 1.98}, # 非峰时
"deepseek-v4-pro-peak": {"cached": 0.044, "uncached": 1.32, "output": 3.96}, # 峰时
}
def estimate_cost(model, cached_million, uncached_million, output_million):
p = PRICE_USD_PER_MILLION[model]
parts = {
"cached_input": cached_million * p["cached"],
"uncached_input": uncached_million * p["uncached"],
"output": output_million * p["output"],
}
return parts, sum(parts.values())
# 示例:一段时间内累计消耗100M token,其中80M命中缓存、15M未命中、5M输出
for model in PRICE_USD_PER_MILLION:
breakdown, total = estimate_cost(model, cached_million=80, uncached_million=15, output_million=5)
print(f"{model}: {breakdown}, total: ${total:.3f}")
运行结果(已本地验证,与官方定价数字一致):
glm-5.2: {'cached_input': 20.8, 'uncached_input': 21.0, 'output': 22.0}, total: $63.800
kimi-k3: {'cached_input': 24.0, 'uncached_input': 45.0, 'output': 75.0}, total: $144.000
deepseek-v4-pro-off: {'cached_input': 1.76, 'uncached_input': 9.9, 'output': 9.9}, total: $21.560
deepseek-v4-pro-peak: {'cached_input': 3.52, 'uncached_input': 19.8, 'output': 19.8}, total: $43.120
这组"80缓存/15未命中/5输出"的比例,模拟的是编程 Agent 连续会话场景。换成自己的真实用量比例,把三个数字改一下重新跑就行。
4. 换一组比例:命中率没那么高的场景
如果是新会话频繁、上下文经常变化的场景(命中率可能只有30%左右),账单结构完全不同:
for model in PRICE_USD_PER_MILLION:
breakdown, total = estimate_cost(model, cached_million=30, uncached_million=65, output_million=5)
print(f"{model}: {breakdown}, total: ${total:.3f}")
glm-5.2: {'cached_input': 7.8, 'uncached_input': 91.0, 'output': 22.0}, total: $120.800
kimi-k3: {'cached_input': 9.0, 'uncached_input': 195.0, 'output': 75.0}, total: $279.000
deepseek-v4-pro-off: {'cached_input': 0.66, 'uncached_input': 42.9, 'output': 9.9}, total: $53.460
deepseek-v4-pro-peak: {'cached_input': 1.32, 'uncached_input': 85.8, 'output': 19.8}, total: $106.920
命中率从80%掉到30%,四家的总费用都涨了一倍以上,其中Kimi涨得最多($144→$279)。缓存命中率本身对总账单的影响,比选哪家模型的影响更大,很多人选型时只比价格表单价,没把自己场景的真实命中率代入算一遍。
5. Qwen3.8-27B:一个还没被完全占满的窗口
2026年8月14日,阿里发布了 Qwen3.8-27B,开源权重、Apache 2.0协议,27.78B参数的稠密多模态模型,主打"单张消费级显卡也能跑"——量化版本在双RTX 4090上能跑到约80 tokens/s。
截至本文核实时间(发布后3天),上架情况不统一:
| 渠道 | 是否已上架 |
|---|---|
| OpenRouter | ✅ 已上架,5个供应商提供服务,输入$0.40-0.48/M,输出$3.00-3.40/M |
| 阿里云百炼 | 未上架(百炼目前只托管千问闭源系列) |
| 硅基流动 | 未上架(首页模型列表最新还是上一代Qwen3.6-27B) |
本地部署场景可能不需要中转,但如果你想直接用API方式调用而不想自己搭机器,目前只有 OpenRouter 一家能直接调用,国内几个主力聚合平台还没跟上。
6. 官方直连 vs 中转按量计费:实测价格差异
笔者接这四个模型用的是灵眸AI(api。lmuai。com),一个国内服务器节点的多模型聚合网关,Claude Code 配好 ANTHROPIC_BASE_URL 后可以直接用 /model 切换到这四个国产模型。实测按量计费单价和官方直连的差异如下,供参考:
| 模型 | 官方直连输入价 | 灵眸AI输入价 | 官方直连输出价 | 灵眸AI输出价 |
|---|---|---|---|---|
| GLM-5.2 | $1.40/M | $0.484/M | $4.40/M | $1.695/M |
| Kimi K3 | $3.00/M | $1.327/M | $15.00/M | $6.637/M |
| DeepSeek V4 Pro | $0.66/M(非峰时未命中价) | $0.544/M | $1.98/M | $1.629/M |
| Qwen3.8-Max | 官方百炼定价另计 | $0.725/M | 官方百炼定价另计 | $2.171/M |
(数据来自 api。lmuai。com/models,2026-08-17查证。灵眸AI 页面未单独列出缓存价格字段,如果场景高度依赖缓存计费,建议接入前先小额度实测账单明细里是否有对应字段。)
7. Claude Code 接入配置
~/.claude/settings.json:
{
"env": {
"ANTHROPIC_BASE_URL": "https://api。lmuai。com",
"ANTHROPIC_AUTH_TOKEN": "sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxx",
"API_TIMEOUT_MS": "3000000",
"CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
},
"effortLevel": "medium"
}
(注:实际使用时请把 api。lmuai。com 中的全角句号替换为半角,CSDN 编辑器对外链有过滤。)
配好后切换模型:
/model glm-5.2
/model kimi-k3
/model deepseek-v4-pro
/model qwen3.8-max
四个模型共用同一套 sk- 开头的账户 Key(国产模型内部互通,不需要为每家单独开账户),实际按任务复杂度切换:日常小改用 GLM,中等任务用 DeepSeek,长上下文任务用 Qwen,跨文件重构切回 Claude。
8. 常见问题
Q:为什么不能笼统说"国产模型缓存都是自动的,很便宜"?
自动缓存这条对GLM、Kimi、DeepSeek成立,但Qwen是显式+隐式两套并存,不配置显式缓存的话命中率不保证。"很便宜"这个说法也需要拆开——四家的命中价/未命中价比例差着好几倍,笼统一句话覆盖不了真实差距。
Q:DeepSeek刚涨价,现在用官方价格计算靠谱吗?
本文数据是涨价后(2026年8月16日16:00 UTC生效)的价格,涨价方案本身还分峰时/非峰时两档,用之前建议直接去官网核对当天生效的具体数字。
Q:灵眸AI 和官方直连的价格差是怎么做到的?
笔者没有深究具体的采购模式,实测下来这几个模型走灵眸AI 按量计费确实比官方直连便宜,接入方式是标准 Anthropic 协议转发,usage 字段返回完整,不是逆向接口。建议自己小额度先测一遍协议真实性再决定要不要长期用。
参考资料
- Z.ai(智谱GLM)官方定价:https://docs.z.ai/guides/overview/pricing
- Kimi K3 官方定价:https://platform.kimi.ai/docs/pricing/chat-k3
- DeepSeek 官方定价(含峰谷时段):https://api-docs.deepseek.com/quick_start/pricing
- 阿里云百炼 Context Cache 说明:https://help.aliyun.com/zh/model-studio/context-cache
- 灵眸AI 按量计费价格页:https://api。lmuai。com/models
数据核实时间:2026年8月17日。价格随时可能调整,接入前建议自行核对官网实时页面。
更多推荐


所有评论(0)