Token 全面涨价,我养不起小龙虾了,让我来让 Token 账单砍 72%
说句"你好",7300 Token 没了。 我发现我订阅的 腾讯云 coding plan,被替换成了 token plan,然后提示我余额不足!揪心,再这样我要养不起小龙虾了。
有人算过账:一个月 4000 万 Token,账单 ¥1200。拆开一看,72% 花在心跳上。你在睡觉,它在花钱。
龙虾贵在哪?有没有更省的方案?
无限自助餐没了
Coding Plan 集体退场。阿里百炼 Lite 上线 23 天停售,腾讯云 Coding Plan 直接转 Token Plan,智谱两个月内涨价 30% + 砍额度 + 停老套餐。国外也一样——GitHub 暂停 Copilot 新注册,Cursor 上线 $200 Ultra 档,GitHub 官宣 6 月起全面转 Token 计费。
Token 变成硬通货了。 谁能省 Token 谁就有优势。
全场涨价的时候,DeepSeek 反向降价。V4 系列定价:
模型 | 缓存命中输入 | 缓存未命中输入 | 输出 | 上下文 |
|---|---|---|---|---|
| V4 Flash | ¥0.02/M | ¥1/M | ¥2/M | 100 万 |
| V4 Pro (2.5 折) | ¥0.025/M | ¥3/M | ¥6/M | 100 万 |
对比 GPT-5.5 Pro 输出 0.28/M——千分之一点五。发布 48 小时内又连砍两刀,2.5 折优惠延长到 5 月底。
这个价格差是后面所有省钱方案的基础。
四个吞金黑洞

入场费:系统提示词的固定开销
每次调用 OpenClaw,不管你问什么,AGENTS.md、SOUL.md、各种规则和工具描述先塞一遍。合计 7300 Token。
你问它"今天天气怎么样",它也得先把这堆东西读完再回你。一天调 60 次,光入场费 43.8 万 Token。一个月仅这一项 ¥140。
心跳:最大元凶,占 72%
OpenClaw 有个心跳机制——你没在用,它每 15 分钟自己跑一次。
每天 96 次 × 约 10,000 Token/次 = 96 万 Token/天。
一个月:2880 万 Token,占总消耗 72%。
你上班 8 小时用它干活,另外 16 小时它自己空转烧钱。什么都不干,一天 ¥145 没了。
36 氪那篇文章标题写得直白:月薪两万都养不起龙虾。我反正养不起。
上下文膨胀:滚雪球
OpenClaw 的记忆机制是把对话历史往上下文里塞。用得越久,上下文越长,每次调用越贵。
第 1 天,一个问题消耗约 2000 Token。第 30 天,同样的问题,45,000 Token。
22 倍。干的活一模一样,花的钱天差地别。
大炮打蚊子:模型不分级
心跳检查、简单状态查询、格式化输出——这些"跑腿活"也拉顶配模型来干。
用 Claude Opus 跑心跳 vs 用 DeepSeek V4 Flash 跑心跳,成本差 15 倍。
但龙虾默认不区分。所有任务一个模型一个价,心跳也用 Opus。这钱花得属实冤枉。
Harness 的思路
有个公式:Agent = Model + Harness。
Model 是大模型。Harness 是模型之外的所有东西——提示词怎么组织、记忆怎么管、技能怎么加载、上下文怎么控制。
Vivek Trivedy 说过:大多数人盯着 Model 省钱(换便宜模型、砍推理次数),但真正该动刀的是 Harness 那一层。
Token 爆炸的三类根因:
类型 | 表现 | 龙虾的做法 |
|---|---|---|
注入型 | 先把所有东西塞进去再说 | 系统提示词 7300 Token 固定开销 |
重复型 | 该记住的没记住,反复搜 | 上下文越用越长,同样问题 22 倍膨胀 |
黑盒型 | 不知道钱花在哪 | 心跳占 72% 但用户感知不到 |
水龙头没关严,一天漏一滴,觉得没什么。月底看水费账单——地板泡了一个月了。
分层记忆:记住该记的,扔掉该扔的
龙虾:每次对话把所有历史塞进上下文。越用越长,越长越贵。
Hermes Agent:三层记忆分离,按需加载。
记忆层 | 存什么 | 怎么用 | 举个例子 |
|---|---|---|---|
情景记忆 | 发生过什么 | FTS5 全文索引,按关键词召回 | "上次部署遇到端口冲突" |
语义记忆 | 你是谁、偏好是什么 | 持久化状态,每次自动注入 | "用阿里云 ECS + Nginx 反代" |
程序性记忆 | 怎么做某件事 | Skill 文件,按需加载 | deployment-checklist.md |
新对话开始,Hermes 不把过去所有历史塞进去。它根据你当前说的话,去 SQLite 里做全文检索,只拉相关的几条。
积累几个月对话,也不会变慢或变贵。
数据:分层记忆 + 动态加载,Token 消耗降低 40-60%。道理也简单——你不会每天出门把全部家当背上吧,带今天用得到的就够了。
Skill 文件 = 压缩后的经验
你跟 Agent 聊了十次怎么部署项目,踩了各种坑。龙虾每次把这十次对话全塞进上下文。
Hermes 不一样:十次对话的教训压缩成一个几十行的 markdown 文件(Skill),下次遇到类似问题只加载这个文件。
十次对话 5 万 Token。一个 Skill 文件?几百 Token。
龙虾是每次把整本笔记本翻一遍,Hermes 是翻目录找那一页。
渐进披露:技能别一股脑全塞
记忆之外,技能加载也是个大头。
很多 Agent 框架启动时把所有工具的完整描述全塞进系统提示词。工具越多,提示词越长,每次调用固定开销越大。
Hermes 用了一个叫"渐进披露"的机制,分三层加载:
层级 | 加载内容 | Token 开销 |
|---|---|---|
Level 1 | 工具名 + 一句话描述 | ~100 Token / 个 |
Level 2 | 完整参数说明和使用指令 | < 5,000 Token |
Level 3 | 资源文件、示例代码 | 按需加载 |
启动时只加载 Level 1。模型判断需要哪个工具,再展开那个的 Level 2。真正执行了才加载 Level 3。
从平均 15,000 Token/次 降到 3,000-5,000 Token/次,省了 66-80%。
怎么写技能描述才省 Token?两条:
名字要自解释:
deploy-to-ecs比server-tool-1好。模型看名字就能判断要不要用一句话说明写清边界:不是"部署工具",是"将 Docker 容器部署到阿里云 ECS,支持端口映射和 Nginx 反代"
名字 + 一句话,100 Token。模型 90% 的场景看这些就够了。
省钱两条路:调参数 vs 换平台
到这里,省钱的思路其实就两条:
第一条:留在 OpenClaw,能调的就两样——
① 关心跳或拉长间隔
龙虾默认每 15 分钟跑一次心跳,一天 96 次,光这一项占掉 72% 账单。
在 OpenClaw 配置里把心跳间隔从 15 分钟改成 2 小时:
heartbeat:
interval: 7200 # 单位秒,默认 900(15分钟)更狠的做法:不需要 24/7 监控的直接关掉。一个改动,月账单从 ¥1200 直接降到 ¥336。
② 换便宜模型
OpenClaw 默认用 Opus 跑所有任务,包括心跳。手动切成 DeepSeek V4 Flash,同样的活,成本差 250 倍:
模型 | 跑 1000 万 Token 的费用 |
|---|---|
DeepSeek V4 Flash | ¥3.45 |
DeepSeek V4 Pro(2.5 折) | ¥18.5 |
Claude Opus | ¥100+ |
GPT-5.5 Pro | ¥200+ |
但这两项只是止血。上下文膨胀、全量注入、技能全塞——这些 OpenClaw 的架构决定了,调参数改不了。
第二条:换 Hermes,架构层面直接省。

OpenClaw 调不了的那些问题,Hermes 从设计上就解决了:
省钱能力 | OpenClaw 能做吗 | Hermes |
|---|---|---|
关心跳 | ✅ 能调间隔 | ✅ 压根没心跳,空跑 = 0 |
换模型 | ✅ 能手动切 | ✅ 支持主模型 + 辅助模型分级 |
上下文压缩 | ❌ 不支持 | ✅ 自动压缩,长对话不滚雪球 |
记忆分层 | ❌ 全量注入 | ✅ 三层记忆 + FTS5 按需检索 |
技能渐进披露 | ❌ 启动全塞 | ✅ 三层加载,按需展开 |
语义去重 | ❌ 手动清理 | ✅ 内置 |
长期不膨胀 | ❌ 越用越贵 | ✅ SQLite 索引,数据库再大也只检索相关片段 |
换了 Hermes 之后,模型分级、压缩、分层记忆、渐进披露、去重——全是默认自带的,不用一项项调。配置文件长这样:
# ~/.hermes/config.yaml — 一次配好,省钱机制全开
model:
provider:deepseek
model:deepseek-v4-pro # 复杂推理用 Pro,输出 ¥6/M
base_url:https://api.deepseek.com/v1
api_key:${DEEPSEEK_API_KEY}
auxiliary:
default:
provider:deepseek
model:deepseek-v4-flash # 跑腿活用 Flash,输出 ¥2/M
compression:
enabled:true
threshold:0.50
target_ratio:0.20
summary_model:deepseek-v4-flash算一笔总账

方案 | Token 消耗/月 | 用 V4 Flash 的费用 | 用 Opus 的费用 |
|---|---|---|---|
OpenClaw 默认(啥都不改) | 4000 万 | ¥80-120 | ¥1200 |
OpenClaw 调参(关心跳 + 换模型) | 1100 万 | ¥25-40 | ¥336 |
| Hermes(默认配置) | 800-1200 万 | ¥15-25 | — |
留在 OpenClaw 调两项,能从 ¥1200 砍到 ¥336。但换 Hermes 一步到位 ¥15-25——架构自带的省钱机制比手动调参狠得多。
写在最后
Token 涨价是趋势,自助餐时代结束了。 如何让你的 agent 节省 token
你现在每个月 Token 花多少?有没有被涨价劝退过?评论区聊聊。
📌 关注公众号,不错过下一篇拆解。
觉得有收获?点赞 + 在看 + 转发,是对我最大的支持 🙏
更多推荐



所有评论(0)