关键词:GLM缓存计费、Kimi K3价格、DeepSeek Context Caching、Qwen隐式缓存、国产大模型API价格、prompt cache、灵眸AI、lmuai、Claude Code 国产模型接入

0. TL;DR

“缓存命中后价格能砍到十分之一甚至更低”——这句话本身没错,但四家国产模型说的不是同一件事,笼统一句话会让你算错自己的真实成本。

  • 缓存机制不是同一种:GLM、Kimi、DeepSeek 是自动缓存,Qwen 是显式+隐式两套并存,显式需要手动加 cache_control
  • DeepSeek 刚涨过价(2026年8月16日16:00 UTC生效),且分峰谷时段,本文数据是涨价后的最新价。
  • 四家命中价/未命中价的真实折扣比例相差近6倍,不能用一个数字套所有模型。
  • 笔者实测接入这四个模型用的是灵眸AI(api。lmuai。com),本文配置示例和实测价格均以此为准,官方直连价与该平台按量价的对比放在第6节。

1. 四家缓存机制对照

模型 缓存机制 是否需要手动配置
GLM-5.2(智谱) 自动识别重复前缀,直接复用 不需要
Kimi K3(月之暗面) 官方文档明确"支持自动上下文缓存" 不需要
DeepSeek V4系列 磁盘缓存,官方文档写"服务自动运行,按实际命中计费" 不需要,且不需要改代码/改接口
Qwen(阿里云百炼) 显式缓存(手动加cache_control,5分钟有效期,创建按125%计费,命中按10%计费)+ 隐式缓存(自动生效,无法关闭,命中按20%计费)两套并存 显式需要,隐式不需要

四家里三家是"装好就自动生效",只有 Qwen 这边如果想要更稳定的命中率,需要额外配置显式缓存的断点。

2. 四家官方价格与真实折扣比例(2026年8月17日核实)

模型 缓存命中价 缓存未命中价 输出价 命中价/未命中价比例
GLM-5.2(官方直连) $0.26/M $1.4/M $4.4/M 约18.6%
Kimi K3(官方直连) $0.30/M $3.00/M $15.00/M 约10%
DeepSeek V4 Pro(非峰时,新价) $0.022/M $0.66/M $1.98/M 约3.3%
DeepSeek V4 Pro(峰时,新价) $0.044/M $1.32/M $3.96/M 约3.3%

DeepSeek 的比例在四家里最低——命中缓存后的价格只是未命中价的约3.3%,比Kimi还低三倍。这不是"DeepSeek更便宜"这个笼统结论能覆盖的,因为未命中价本身也在四家里同样最低,两个变量叠在一起看才是真实情况。

3. 一个可运行的费用计算器

不同模型缓存命中率不一样,与其记价格表,不如记一个公式,自己代入真实用量算:

# 四家国产模型缓存费用计算器,单位:美元
# 价格数字来自各官方文档,2026-08-17核实

PRICE_USD_PER_MILLION = {
    "glm-5.2":              {"cached": 0.26,  "uncached": 1.4,   "output": 4.4},
    "kimi-k3":              {"cached": 0.30,  "uncached": 3.00,  "output": 15.0},
    "deepseek-v4-pro-off":  {"cached": 0.022, "uncached": 0.66,  "output": 1.98},   # 非峰时
    "deepseek-v4-pro-peak": {"cached": 0.044, "uncached": 1.32,  "output": 3.96},   # 峰时
}

def estimate_cost(model, cached_million, uncached_million, output_million):
    p = PRICE_USD_PER_MILLION[model]
    parts = {
        "cached_input": cached_million * p["cached"],
        "uncached_input": uncached_million * p["uncached"],
        "output": output_million * p["output"],
    }
    return parts, sum(parts.values())


# 示例:一段时间内累计消耗100M token,其中80M命中缓存、15M未命中、5M输出
for model in PRICE_USD_PER_MILLION:
    breakdown, total = estimate_cost(model, cached_million=80, uncached_million=15, output_million=5)
    print(f"{model}: {breakdown}, total: ${total:.3f}")

运行结果(已本地验证,与官方定价数字一致):

glm-5.2: {'cached_input': 20.8, 'uncached_input': 21.0, 'output': 22.0}, total: $63.800
kimi-k3: {'cached_input': 24.0, 'uncached_input': 45.0, 'output': 75.0}, total: $144.000
deepseek-v4-pro-off: {'cached_input': 1.76, 'uncached_input': 9.9, 'output': 9.9}, total: $21.560
deepseek-v4-pro-peak: {'cached_input': 3.52, 'uncached_input': 19.8, 'output': 19.8}, total: $43.120

这组"80缓存/15未命中/5输出"的比例,模拟的是编程 Agent 连续会话场景。换成自己的真实用量比例,把三个数字改一下重新跑就行。

4. 换一组比例:命中率没那么高的场景

如果是新会话频繁、上下文经常变化的场景(命中率可能只有30%左右),账单结构完全不同:

for model in PRICE_USD_PER_MILLION:
    breakdown, total = estimate_cost(model, cached_million=30, uncached_million=65, output_million=5)
    print(f"{model}: {breakdown}, total: ${total:.3f}")
glm-5.2: {'cached_input': 7.8, 'uncached_input': 91.0, 'output': 22.0}, total: $120.800
kimi-k3: {'cached_input': 9.0, 'uncached_input': 195.0, 'output': 75.0}, total: $279.000
deepseek-v4-pro-off: {'cached_input': 0.66, 'uncached_input': 42.9, 'output': 9.9}, total: $53.460
deepseek-v4-pro-peak: {'cached_input': 1.32, 'uncached_input': 85.8, 'output': 19.8}, total: $106.920

命中率从80%掉到30%,四家的总费用都涨了一倍以上,其中Kimi涨得最多($144→$279)。缓存命中率本身对总账单的影响,比选哪家模型的影响更大,很多人选型时只比价格表单价,没把自己场景的真实命中率代入算一遍。

5. Qwen3.8-27B:一个还没被完全占满的窗口

2026年8月14日,阿里发布了 Qwen3.8-27B,开源权重、Apache 2.0协议,27.78B参数的稠密多模态模型,主打"单张消费级显卡也能跑"——量化版本在双RTX 4090上能跑到约80 tokens/s。

截至本文核实时间(发布后3天),上架情况不统一:

渠道 是否已上架
OpenRouter ✅ 已上架,5个供应商提供服务,输入$0.40-0.48/M,输出$3.00-3.40/M
阿里云百炼 未上架(百炼目前只托管千问闭源系列)
硅基流动 未上架(首页模型列表最新还是上一代Qwen3.6-27B)

本地部署场景可能不需要中转,但如果你想直接用API方式调用而不想自己搭机器,目前只有 OpenRouter 一家能直接调用,国内几个主力聚合平台还没跟上。

6. 官方直连 vs 中转按量计费:实测价格差异

笔者接这四个模型用的是灵眸AI(api。lmuai。com),一个国内服务器节点的多模型聚合网关,Claude Code 配好 ANTHROPIC_BASE_URL 后可以直接用 /model 切换到这四个国产模型。实测按量计费单价和官方直连的差异如下,供参考:

模型 官方直连输入价 灵眸AI输入价 官方直连输出价 灵眸AI输出价
GLM-5.2 $1.40/M $0.484/M $4.40/M $1.695/M
Kimi K3 $3.00/M $1.327/M $15.00/M $6.637/M
DeepSeek V4 Pro $0.66/M(非峰时未命中价) $0.544/M $1.98/M $1.629/M
Qwen3.8-Max 官方百炼定价另计 $0.725/M 官方百炼定价另计 $2.171/M

(数据来自 api。lmuai。com/models,2026-08-17查证。灵眸AI 页面未单独列出缓存价格字段,如果场景高度依赖缓存计费,建议接入前先小额度实测账单明细里是否有对应字段。)

7. Claude Code 接入配置

~/.claude/settings.json

{
  "env": {
    "ANTHROPIC_BASE_URL": "https://api。lmuai。com",
    "ANTHROPIC_AUTH_TOKEN": "sk-xxxxxxxxxxxxxxxxxxxxxxxxxxxx",
    "API_TIMEOUT_MS": "3000000",
    "CLAUDE_CODE_ATTRIBUTION_HEADER": "0"
  },
  "effortLevel": "medium"
}

(注:实际使用时请把 api。lmuai。com 中的全角句号替换为半角,CSDN 编辑器对外链有过滤。)

配好后切换模型:

/model glm-5.2
/model kimi-k3
/model deepseek-v4-pro
/model qwen3.8-max

四个模型共用同一套 sk- 开头的账户 Key(国产模型内部互通,不需要为每家单独开账户),实际按任务复杂度切换:日常小改用 GLM,中等任务用 DeepSeek,长上下文任务用 Qwen,跨文件重构切回 Claude。

8. 常见问题

Q:为什么不能笼统说"国产模型缓存都是自动的,很便宜"?

自动缓存这条对GLM、Kimi、DeepSeek成立,但Qwen是显式+隐式两套并存,不配置显式缓存的话命中率不保证。"很便宜"这个说法也需要拆开——四家的命中价/未命中价比例差着好几倍,笼统一句话覆盖不了真实差距。

Q:DeepSeek刚涨价,现在用官方价格计算靠谱吗?

本文数据是涨价后(2026年8月16日16:00 UTC生效)的价格,涨价方案本身还分峰时/非峰时两档,用之前建议直接去官网核对当天生效的具体数字。

Q:灵眸AI 和官方直连的价格差是怎么做到的?

笔者没有深究具体的采购模式,实测下来这几个模型走灵眸AI 按量计费确实比官方直连便宜,接入方式是标准 Anthropic 协议转发,usage 字段返回完整,不是逆向接口。建议自己小额度先测一遍协议真实性再决定要不要长期用。

参考资料

  • Z.ai(智谱GLM)官方定价:https://docs.z.ai/guides/overview/pricing
  • Kimi K3 官方定价:https://platform.kimi.ai/docs/pricing/chat-k3
  • DeepSeek 官方定价(含峰谷时段):https://api-docs.deepseek.com/quick_start/pricing
  • 阿里云百炼 Context Cache 说明:https://help.aliyun.com/zh/model-studio/context-cache
  • 灵眸AI 按量计费价格页:https://api。lmuai。com/models

数据核实时间:2026年8月17日。价格随时可能调整,接入前建议自行核对官网实时页面。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐