你以为 AI 编程贵,是因为模型价格高?真正烧钱的地方,可能是 Agent 每走一步,都把整个项目重新读了一遍。

假设你把一个登录 Bug 交给 AI:

“用户刷新页面后会莫名退出,请找到原因并修复。”

第一轮,它读取登录逻辑;第二轮,它查看 Cookie 配置;第三轮,它运行测试;第四轮,它根据报错继续修改。

看起来很合理。但在背后,每次请求可能都会重新携带系统指令、工具说明、已读代码、历史对话和测试输出。任务越长,重复发送的内容越多,就像程序员每开一次会,都抱着整个项目资料库重新进场。

这正是 Reasonix 想解决的问题。

它不是一个新模型,也不是 DeepSeek 的“换皮聊天框”。它是一套围绕 DeepSeek 设计的开源编程 Agent:让模型能搜索代码、修改文件、执行命令、运行测试,同时尽量让那些反复出现的上下文命中低价缓存。

说得再直白一点:

DeepSeek 负责动脑,Reasonix 负责给它装上手脚,并管好差旅费。


模型很聪明,为什么还需要 Reasonix?

把一个顶级模型直接放进聊天框,就像请来一位很聪明的程序员,却不给他电脑、终端和代码仓库。

你问:“这个 Bug 怎么修?”

他只能隔着门告诉你:“建议检查登录状态和 Cookie 过期时间。”

而真正的 Coding Agent 必须能亲自完成下面这些动作:

理解任务
  ↓
搜索相关代码
  ↓
读取文件和报错
  ↓
修改代码
  ↓
运行测试
  ↓
失败后继续排查
  ↓
交付可验证的结果

控制这套循环的系统,通常叫作 harness

所以,AI 编程工具的实际表现并不只由模型决定,而更像一道乘法题:

最终效果 = 模型能力 × harness 执行能力

Reasonix 本身就是 harness。它的核心 Agent 引擎由项目自己实现,并不是给 Claude Code、OpenCode 或 Codex 换了一个界面。

需要说明的是:**Reasonix 不是 DeepSeek 官方研发的产品。**它是社区维护的 MIT 开源项目,DeepSeek 官方文档将它收录为一种 Agent Integration。


Reasonix 真正特别的地方:它先考虑“别浪费钱”

普通用户看到的是 AI 在写代码,账单看到的却是一轮又一轮的 Token。

一段持续 20 轮的开发会话,大致会这样增长:

第 1 轮:任务
第 2 轮:任务 + 已读文件
第 3 轮:前两轮 + 测试结果
第 4 轮:前面所有内容 + 新报错
……
第 20 轮:几乎整段工作历史

这里有一个关键机制:前缀缓存

如果下一次请求的开头与上一次一致,DeepSeek 可以识别出重复内容,让这部分输入走更便宜的缓存价格。

但前提是:这个“开头”必须足够稳定。

系统提示词改了一个字、工具顺序发生变化、历史消息被重新整理,都可能让缓存失效。于是 Reasonix 把很多设计都围绕一个目标展开:

已经发过的内容,能不动就别动。

它主要用了三招。

第一招:像记流水账,只追加,不乱改

Reasonix 尽量把新内容追加到会话末尾,而不是每一轮都重写前面的对话。

可以把它想象成一本账本:每天在最后增加一页,而不是每记录一笔消费,就把整本账重新排版。

这样一来,系统指令、项目规则、工具定义和旧消息能保持稳定,下一轮更容易命中缓存。

第二招:工具箱固定摆放

模型每轮都需要知道自己有哪些工具,例如读取文件、编辑代码、执行命令和查看测试结果。工具的名称、顺序和参数说明,同样会占据上下文。

Reasonix 尽量保持核心工具接口稳定。即使接入 MCP、技能或其他扩展能力,也不会轻易把整个工具箱重新翻一遍。

这就像维修工总把扳手放在左边、螺丝刀放在右边。位置固定,拿工具更快,也不必每次重新熟悉工作台。

第三招:规划和干活分两个房间

复杂任务可以让 Planner 负责调查和制定方案,让 Executor 负责修改代码与运行测试。

Reasonix 给它们维护独立会话。规划模型不会不断污染执行模型的上下文,两个模型也能各自保持稳定缓存。

简单任务则直接执行,不额外请一个模型开“规划会”。毕竟为了改一个拼写错误,先写三页项目计划,本身就是浪费。


一个 Bug,在 Reasonix 里会经历什么?

还是回到开头的登录问题。

你输入:

“用户刷新页面后会退出,请找到原因并修复,完成后运行测试。”

Reasonix 大致会这样工作:

  1. 搜索登录状态、Token 和 Cookie 相关代码;
  2. 读取最可能有关的文件,而不是把整个仓库塞给模型;
  3. 将代码和任务交给 DeepSeek 分析;
  4. 根据模型返回的工具调用修改文件;
  5. 执行测试,把真实报错继续反馈给模型;
  6. 如果测试失败,继续定位,而不是把第一版答案当成最终结果;
  7. 测试通过后,汇总修改与验证结果。

在这段过程中,前面已经发送过的系统指令和历史内容尽量保持原样。模型仍然看得到工作经过,但重复部分有机会走缓存。

这才是 Reasonix 的卖点:它没有发明“让模型写代码”这件事,而是在努力让模型 长时间、低成本、可恢复地写代码


网上说便宜 5 到 15 倍,是真的吗?

这是最吸引人的数字,也是最需要冷静看的数字。

网上常见的比较是:

Reasonix + DeepSeek
        VS
Claude Code + Claude

这个比较同时换了两样东西:模型和 harness。

价差可能来自:

  • DeepSeek API 本身更便宜;
  • Reasonix 更容易让重复输入命中缓存;
  • 两个模型完成任务所需的轮数不同;
  • Claude 或 DeepSeek 在困难任务上的重试次数不同。

所以,“便宜 10 倍”不能全部算成 Reasonix 的功劳。

目前 Reasonix 仓库公开了一组比较扎实的自身测试数据:

  • 49 次边界计量运行;
  • 累计约 1290 万 Token;
  • 缓存命中率约 71%;
  • harness 自报与代理层计量仅相差约 0.2%。

按照 DeepSeek 官方价格简单估算,在这组 71% 缓存命中率下,输入费用相对完全不命中缓存可降低约 70%

但请注意,这仍然不是 Reasonix 对 Claude Code 的正面对照。Claude 同样支持 Prompt Caching,目前也没有看到双方使用相同模型、相同任务、相同计量方式完成的公开完整 A/B 测试。

因此,更负责任的说法是:

Reasonix + DeepSeek 在长任务中很可能比 Claude Code + Claude 便宜很多;“5 到 15 倍”可以作为场景估算,不能当作固定承诺。

而且,真正应该比较的不是每百万 Token 单价,而是:

成功修好一个 Bug,最终花了多少钱?

便宜的模型如果试错十次,也可能比一次成功的贵模型更贵。


它不是只能聊天,而是一整套本地工作台

Reasonix 当前主线使用 Go 从头重写。它已经不只是一个终端输入框,而是一套完整的本地 Agent 引擎。

你可以把它用在终端、桌面端、浏览器或支持 ACP 的编辑器里。底层仍是同一套执行系统,可以:

  • 搜索、读取和精确修改文件;
  • 执行 Shell 命令与后台任务;
  • 使用 LSP 理解代码符号;
  • 接入 MCP 工具和资源;
  • 使用 Plan Mode 和权限审批;
  • 创建 Checkpoint,并在出错后回退;
  • 调用子 Agent 或双模型协作;
  • 在长会话中管理记忆和上下文。

这意味着你可以把一个任务交给它持续执行,同时仍然保留检查、阻止和撤销的能力。

当然,“能修改你的项目”也意味着它具有真实风险。第一次使用时,最好在独立 Git 分支或干净工作区运行,保留命令审批,并在提交前人工检查 diff。


哪些人值得试?哪些人先别急?

值得尝试

  • 已经认可 DeepSeek 的编程能力,希望进一步控制 API 成本;
  • 经常处理持续几十轮的大仓库任务;
  • 喜欢终端工作流,希望 Agent 本地运行;
  • 需要开源、可配置、能接 MCP 的执行系统;
  • 愿意检查代码和测试,而不是盲信 AI 的完成声明。

不一定适合

  • 更看重开箱即用和成熟产品体验;
  • 团队已经深度依赖 Claude Code 的生态;
  • 任务容错率极低,不愿承担新工具快速迭代的风险;
  • 以为换了 Agent 就能完全代替代码审查和测试。

Claude Code 的优势仍然很明确:产品成熟、生态完整、模型能力强。Reasonix 的吸引力则是开放、可改、针对 DeepSeek 优化,并且可能显著降低长任务成本。

它们不是简单的“谁消灭谁”,而是两条不同路线。


两分钟上手

安装好 Node.js 后,进入你的项目目录:

cd /path/to/your-project
npx reasonix code

首次运行会引导你配置 DeepSeek API Key。根据 DeepSeek 官方集成文档,Reasonix 默认使用适合低成本迭代的 DeepSeek-V4-Flash

遇到复杂任务时,可以在 TUI 中输入:

/pro

让下一轮使用 DeepSeek-V4-Pro

也可以选择全局安装:

npm install -g reasonix
reasonix setup
reasonix

第一次不要直接拿公司的核心仓库做实验。找一个有测试的小项目,让它修一个真实 Bug,然后重点观察三件事:

  1. 最终测试是否通过;
  2. 它用了多少轮才完成;
  3. 缓存命中率和实际费用是多少。

这比看任何“吊打”“碾压”标题都更有价值。


最后:下一场 AI 编程大战,主角可能不是模型

过去我们习惯问:

Claude 和 DeepSeek,谁更会写代码?

但 Reasonix 提醒我们,问题还缺了另一半:

谁能让模型少走弯路、少花钱,并真正把任务做完?

模型决定一个 Agent 能有多聪明;harness 决定它能不能稳定工作。

Reasonix 的意义不只是给 DeepSeek 做了一个终端工具,而是展示了一种新的竞争方式:不盲目堆上下文,不频繁破坏缓存,不让昂贵模型参加每一次小决策,把省下来的钱变成长时间工作的能力。

当一个足够强、价格足够低的模型,遇上一套真正理解其计费方式的执行系统,AI 编程或许才开始从“偶尔用一下的高级玩具”,变成可以全天运行的生产工具。

这才是 Reasonix + DeepSeek 最值得关注的地方。


参考资料

  • Reasonix GitHub:https://github.com/esengine/DeepSeek-Reasonix
  • Reasonix Benchmark:https://github.com/esengine/DeepSeek-Reasonix/blob/main-v2/benchmarks/README.md
  • DeepSeek 官方 Reasonix 集成文档:https://api-docs.deepseek.com/quick_start/agent_integrations/reasonix/
  • DeepSeek 模型与价格:https://api-docs.deepseek.com/quick_start/pricing

注:模型版本、默认配置与 API 价格变化很快,请以官方页面为准。文中的成本比例属于基于公开数据的场景分析,并非固定收益承诺。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐