说句"你好",7300 Token 没了。 我发现我订阅的 腾讯云 coding plan,被替换成了 token plan,然后提示我余额不足!揪心,再这样我要养不起小龙虾了。

有人算过账:一个月 4000 万 Token,账单 ¥1200。拆开一看,72% 花在心跳上。你在睡觉,它在花钱。

龙虾贵在哪?有没有更省的方案?

无限自助餐没了

Coding Plan 集体退场。阿里百炼 Lite 上线 23 天停售,腾讯云 Coding Plan 直接转 Token Plan,智谱两个月内涨价 30% + 砍额度 + 停老套餐。国外也一样——GitHub 暂停 Copilot 新注册,Cursor 上线 $200 Ultra 档,GitHub 官宣 6 月起全面转 Token 计费。

Token 变成硬通货了。 谁能省 Token 谁就有优势。

全场涨价的时候,DeepSeek 反向降价。V4 系列定价:

模型

缓存命中输入

缓存未命中输入

输出

上下文

V4 Flash¥0.02/M

¥1/M

¥2/M

100 万

V4 Pro

(2.5 折)

¥0.025/M

¥3/M

¥6/M

100 万

对比 GPT-5.5 Pro 输出 0.28/M——千分之一点五。发布 48 小时内又连砍两刀,2.5 折优惠延长到 5 月底。

这个价格差是后面所有省钱方案的基础。

四个吞金黑洞

Token四大吞金黑洞

入场费:系统提示词的固定开销

每次调用 OpenClaw,不管你问什么,AGENTS.md、SOUL.md、各种规则和工具描述先塞一遍。合计 7300 Token。

你问它"今天天气怎么样",它也得先把这堆东西读完再回你。一天调 60 次,光入场费 43.8 万 Token。一个月仅这一项 ¥140。

心跳:最大元凶,占 72%

OpenClaw 有个心跳机制——你没在用,它每 15 分钟自己跑一次。

每天 96 次 × 约 10,000 Token/次 = 96 万 Token/天

一个月:2880 万 Token,占总消耗 72%。

你上班 8 小时用它干活,另外 16 小时它自己空转烧钱。什么都不干,一天 ¥145 没了。

36 氪那篇文章标题写得直白:月薪两万都养不起龙虾。我反正养不起。

上下文膨胀:滚雪球

OpenClaw 的记忆机制是把对话历史往上下文里塞。用得越久,上下文越长,每次调用越贵。

第 1 天,一个问题消耗约 2000 Token。第 30 天,同样的问题,45,000 Token

22 倍。干的活一模一样,花的钱天差地别。

大炮打蚊子:模型不分级

心跳检查、简单状态查询、格式化输出——这些"跑腿活"也拉顶配模型来干。

用 Claude Opus 跑心跳 vs 用 DeepSeek V4 Flash 跑心跳,成本差 15 倍

但龙虾默认不区分。所有任务一个模型一个价,心跳也用 Opus。这钱花得属实冤枉。

Harness 的思路

有个公式:Agent = Model + Harness

Model 是大模型。Harness 是模型之外的所有东西——提示词怎么组织、记忆怎么管、技能怎么加载、上下文怎么控制。

Vivek Trivedy 说过:大多数人盯着 Model 省钱(换便宜模型、砍推理次数),但真正该动刀的是 Harness 那一层。

Token 爆炸的三类根因:

类型

表现

龙虾的做法

注入型

先把所有东西塞进去再说

系统提示词 7300 Token 固定开销

重复型

该记住的没记住,反复搜

上下文越用越长,同样问题 22 倍膨胀

黑盒型

不知道钱花在哪

心跳占 72% 但用户感知不到

水龙头没关严,一天漏一滴,觉得没什么。月底看水费账单——地板泡了一个月了。

分层记忆:记住该记的,扔掉该扔的

龙虾:每次对话把所有历史塞进上下文。越用越长,越长越贵。

Hermes Agent:三层记忆分离,按需加载。

记忆层

存什么

怎么用

举个例子

情景记忆

发生过什么

FTS5 全文索引,按关键词召回

"上次部署遇到端口冲突"

语义记忆

你是谁、偏好是什么

持久化状态,每次自动注入

"用阿里云 ECS + Nginx 反代"

程序性记忆

怎么做某件事

Skill 文件,按需加载

deployment-checklist.md

新对话开始,Hermes 不把过去所有历史塞进去。它根据你当前说的话,去 SQLite 里做全文检索,只拉相关的几条。

积累几个月对话,也不会变慢或变贵。

数据:分层记忆 + 动态加载,Token 消耗降低 40-60%。道理也简单——你不会每天出门把全部家当背上吧,带今天用得到的就够了。

Skill 文件 = 压缩后的经验

你跟 Agent 聊了十次怎么部署项目,踩了各种坑。龙虾每次把这十次对话全塞进上下文。

Hermes 不一样:十次对话的教训压缩成一个几十行的 markdown 文件(Skill),下次遇到类似问题只加载这个文件。

十次对话 5 万 Token。一个 Skill 文件?几百 Token。

龙虾是每次把整本笔记本翻一遍,Hermes 是翻目录找那一页。

渐进披露:技能别一股脑全塞

记忆之外,技能加载也是个大头。

很多 Agent 框架启动时把所有工具的完整描述全塞进系统提示词。工具越多,提示词越长,每次调用固定开销越大。

Hermes 用了一个叫"渐进披露"的机制,分三层加载:

层级

加载内容

Token 开销

Level 1

工具名 + 一句话描述

~100 Token / 个

Level 2

完整参数说明和使用指令

< 5,000 Token

Level 3

资源文件、示例代码

按需加载

启动时只加载 Level 1。模型判断需要哪个工具,再展开那个的 Level 2。真正执行了才加载 Level 3。

从平均 15,000 Token/次 降到 3,000-5,000 Token/次,省了 66-80%。

怎么写技能描述才省 Token?两条:

  1. 名字要自解释deploy-to-ecs 比 server-tool-1 好。模型看名字就能判断要不要用

  2. 一句话说明写清边界:不是"部署工具",是"将 Docker 容器部署到阿里云 ECS,支持端口映射和 Nginx 反代"

名字 + 一句话,100 Token。模型 90% 的场景看这些就够了。

省钱两条路:调参数 vs 换平台

到这里,省钱的思路其实就两条:

第一条:留在 OpenClaw,能调的就两样——

① 关心跳或拉长间隔

龙虾默认每 15 分钟跑一次心跳,一天 96 次,光这一项占掉 72% 账单

在 OpenClaw 配置里把心跳间隔从 15 分钟改成 2 小时:

heartbeat:
  interval: 7200   # 单位秒,默认 900(15分钟)

更狠的做法:不需要 24/7 监控的直接关掉。一个改动,月账单从 ¥1200 直接降到 ¥336。

② 换便宜模型

OpenClaw 默认用 Opus 跑所有任务,包括心跳。手动切成 DeepSeek V4 Flash,同样的活,成本差 250 倍:

模型

跑 1000 万 Token 的费用

DeepSeek V4 Flash

¥3.45

DeepSeek V4 Pro(2.5 折)

¥18.5

Claude Opus

¥100+

GPT-5.5 Pro

¥200+

但这两项只是止血。上下文膨胀、全量注入、技能全塞——这些 OpenClaw 的架构决定了,调参数改不了


第二条:换 Hermes,架构层面直接省。

调参数 vs 换平台对比

OpenClaw 调不了的那些问题,Hermes 从设计上就解决了:

省钱能力

OpenClaw 能做吗

Hermes

关心跳

✅ 能调间隔

✅ 压根没心跳,空跑 = 0

换模型

✅ 能手动切

✅ 支持主模型 + 辅助模型分级

上下文压缩

❌ 不支持

✅ 自动压缩,长对话不滚雪球

记忆分层

❌ 全量注入

✅ 三层记忆 + FTS5 按需检索

技能渐进披露

❌ 启动全塞

✅ 三层加载,按需展开

语义去重

❌ 手动清理

✅ 内置 hermes memory dedupe

长期不膨胀

❌ 越用越贵

✅ SQLite 索引,数据库再大也只检索相关片段

换了 Hermes 之后,模型分级、压缩、分层记忆、渐进披露、去重——全是默认自带的,不用一项项调。配置文件长这样:

# ~/.hermes/config.yaml — 一次配好,省钱机制全开
model:
provider:deepseek
model:deepseek-v4-pro         # 复杂推理用 Pro,输出 ¥6/M
base_url:https://api.deepseek.com/v1
api_key:${DEEPSEEK_API_KEY}

auxiliary:
default:
    provider:deepseek
    model:deepseek-v4-flash     # 跑腿活用 Flash,输出 ¥2/M

compression:
enabled:true
threshold:0.50
target_ratio:0.20
summary_model:deepseek-v4-flash

算一笔总账

月费用三档对比

方案

Token 消耗/月

用 V4 Flash 的费用

用 Opus 的费用

OpenClaw 默认(啥都不改)

4000 万

¥80-120

¥1200

OpenClaw 调参(关心跳 + 换模型)

1100 万

¥25-40

¥336

Hermes(默认配置)800-1200 万¥15-25

留在 OpenClaw 调两项,能从 ¥1200 砍到 ¥336。但换 Hermes 一步到位 ¥15-25——架构自带的省钱机制比手动调参狠得多。


写在最后

Token 涨价是趋势,自助餐时代结束了。 如何让你的 agent 节省 token 

你现在每个月 Token 花多少?有没有被涨价劝退过?评论区聊聊。


📌 关注公众号,不错过下一篇拆解。

觉得有收获?点赞 + 在看 + 转发,是对我最大的支持 🙏

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐