直接结论:真正烧额度的不只是你当前这句 Prompt,而是每次请求都要重新注入的整包 Context。省 Token 的正确思路是“丢掉用不到的、缩小留下的、让缓存打折”,而不是把 Prompt 写短或换一个便宜的小模型。

本文面向使用 Claude Code、Codex、Cursor 或类似 Agent 工具的开发者。内容覆盖 Context 构成、常见误区、三条可执行方法、FAQ 和检查清单。涉及价格、缓存时长和产品功能的部分,以官方当前文档和定价页为准。在这里插入图片描述

为什么额度总是不够用

很多人在对话框里只看到自己输入的一行字,但请求真正发送时,系统会把以下内容一起打包注入模型:

Context 层级包含内容典型来源
系统与项目规则系统提示词、CLAUDE.md / AGENTS.md、Git 状态、系统信息项目目录和运行环境
工具使用说明内置终端、文件读写、搜索,以及外部 MCP Server 的名称和参数描述挂载的工具与插件
对话历史之前每一轮对话、AI 的长篇分析、写过的代码当前会话
外部文件与执行日志读过的源码、PDF、终端命令输出文件读取和命令执行

底层 API 本身没有跨请求记忆,因此每次按 Enter,这四层内容都会完整重新注入。对话越长,历史记录越大,下一次请求就越贵。到第十轮、第二十轮时,你发的那句“帮我改第二行”可能只占整包输入的 1%,其余都是旧 Context。在这里插入图片描述

两个看似合理但效果有限的误区

误区一:只要把 Prompt 写短

当对话已经累积几万 Token 时,把 50 个字的 Prompt 缩成 5 个字,省下的比例微乎其微。问题不在当前输入,而在整包历史。

误区二:换成更便宜的小模型

小模型理解力不足时,代码写错、答非所问会带来更多来回重试,整趟任务累积下来反而更费额度。先控制 Context,再谈模型选择。在这里插入图片描述

三招控制 Context

第一招:丢掉用不到的

  1. 换任务就开新对话。任务告一段落就新建会话,不要让上一个项目的代码、报错和工具输出继续背到下一次请求里。
  2. 打错指令或结果不如意时,优先编辑原消息,或使用工具的 rewind / 分支回溯功能回到出错前,避免把整段失败输出留在历史里。以你当前使用的产品为准,Claude Code 中可参考 Esc + Esc/rewind
  3. 精简 MCP Server 和插件。每个 MCP 工具的说明与参数定义都会进入 Context;只写文章或改小功能时,关掉暂时用不到的网页搜索、数据库等服务。

第二招:缩小留下的

  1. 先搜索,再喂给模型。问题有明确函数名、错误码或关键字时,先用搜索工具定位最相关的几行,再让模型处理。这一步可以把单次请求从几万 Token 降到几百。
  2. 给结论,清掉讨论过程。多轮讨论后的最终规格、限制和决策,整理成一份干净的 Markdown,再开新会话喂给模型。自动压缩、摘要功能有帮助,但摘要是有损压缩,重要细节最好由你自己保留。
  3. 缩小输入格式与输出范围。能用纯文本或代码传递的信息,不要丢几 MB 的截图;只改某个函数时,明确要求只输出修改后的段落。输出 Token 通常比输入更贵,避免模型把整篇内容重写一遍。在这里插入图片描述

第三招:让缓存打折

Claude 和 OpenAI 等主流模型都提供 Prompt Caching(提示词缓存),把重复使用的前缀暂存在服务端,后续请求更快也更便宜。以下是官方文档中的核心规则,具体数字以当前定价页为准:

项目说明
默认缓存时长Anthropic 自动缓存默认 5 分钟,使用时会免费刷新;也提供 1 小时 TTL 选项,写入价更高
缓存读取价Anthropic 按基本输入价的 0.1 倍计费;OpenAI 官方文档同样按 0.1 倍计费
缓存写入价Anthropic 5 分钟 TTL 为基本输入价 1.25 倍,1 小时 TTL 为 2 倍;OpenAI 新版模型按 1.25 倍计费
示例Claude Opus 5 基本输入 $5/百万 Token,缓存读取 $0.50/百万 Token,输出 $25/百万 Token

要让缓存更容易命中,注意两点:

  • 同一任务里避免中途换模型、调思考强度或开启加速模式;前缀变化可能让之前写入的缓存失效。
  • 长时间不对话会超过缓存 TTL。如果任务是跨 session 复用同一段稳定上下文,主动整理成固定 Markdown 前缀,并参考官方 1 小时 TTL 或手动预热说明。

发送前的两个检查问题

  1. 回答我当前这句指令,真的需要前面的上下文和旧资料吗?如果不需要,开新对话。
  2. 如果确实需要背景,中间的讨论过程需要“全部知道”吗?如果不需要,把结论整理成 Markdown,开新会话继续。

FAQ

省 Token 是不是就是少用 AI?

不是。省的是无用 Context,不是省深度思考。把噪音清掉后,额度可以留给真正需要复杂推理的地方。

换任务一定只能开新对话吗?

开新对话是最直接的方法;如果你的工具提供 /clear、/rename 后重新 resume 等会话管理能力,也可以按需组合使用,以当前版本说明为准。

Prompt Caching 能保证省钱吗?

需要满足稳定前缀、缓存 TTL、写入断点等条件。缓存写入本身有成本,未命中的重复写入反而可能更贵;不要把它当成无脑省钱的开关。

检查清单

  • 换任务后,旧会话是否已关闭或清理?
  • 错误输出是否用编辑、回溯或分支删掉,而不是继续追加“重新来”?
  • 挂载的 MCP / 插件是否只保留当前任务需要的?
  • 大文件是否先搜索定位,而不是整包丢进对话?
  • 结论是否整理成 Markdown,并开新会话继续?
  • 输出范围是否明确,避免模型整篇重写?
  • 同一任务是否避免了中途换模型或改思考强度?

资源补充

如果你需要,也可以把 llapi.org 作为一个中转入口参考

希望这套方法能帮你在同样额度下做更多事。如果你有自己验证过的省 Token 习惯,欢迎在评论区补充。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐