写在前面

8 月 13 日凌晨,DeepSeek 把 V4 Pro 更新到了正式版。没有发布会,没有官方博客,API 文档里悄悄改了一行版本号。大部分人的注意力被跑分吸走了,DeepSWE 从 12.8 涨到 62.7,Terminal Bench 拿到官方口径的 87.9。

但同一时间还有一个东西值得工程师多看两眼,DeepSeek Harness,圈内简称 DSH。这是 DeepSeek 自研的 Agent 运行框架,管的是模型之外的所有工程化事情。

为什么写这篇。目前市面上关于 DSH 的信息基本都是资讯快报,从工程视角拆解它怎么搭起来的内容几乎看不到。如果你也在做 Agent 运行时、做 Coding Agent,或者在给自己团队搭工具链,这篇想给你三样能直接带回去的东西,三个可借鉴的设计,一张遥测指标清单,以及两个要留心的坑。

读之前先抛四个问题,也是全文骨架。

  • 模型厂商自己做 Agent 框架,和普通框架有什么不一样
  • 为什么要把前端界面和后端运行时物理拆开
  • 为什么把遥测指标做成一等公民
  • 官方跑分,是不是完全可信

一、先搞清楚 DSH 是什么

DSH 是 DeepSeek 自研的 Agent 插件运行、调度与托管框架,负责读文件、调工具、管上下文、失败重试、长时间执行这一整套事情。DeepSeek 官方招聘材料里给的公式很直白,Model + Harness = Agent,模型之外的工作全归 Harness。

进展时间线拉出来看。最后一行的公测时间点来自一张据称是 DSH 官方内测群的截图,经多家媒体转述,DeepSeek 官方截至发稿没发正式公告,可信度中高,但严格讲还没实锤。

时间

节点

2026-05-26

官方 GitHub 组织创建

2026-08-01

启动定向内测招募,964 人报名

2026-08-11

推送最终内测版,插件兼容适配

2026-08-13

计划与 V4 Pro 正式版同步全量公测(内测群消息,待官方确认)

一个可以当实锤看的佐证,V4 Flash 的 API 文档里明确写了,公开基准测试中的 Code Agent 任务,正式版使用 DeepSeek Harness 极简模式作为测试框架。官方评测自己就在用这套框架跑分。

二、架构选择一,微内核加依赖注入

DSH 的官方包命名空间是 @deepseek-ai/dsh,Node.js Monorepo 组织代码,底座是深度定制过的 Cordis 4.0。

插一句 Cordis 的来历。它出自 Koishi 团队,一套以依赖注入和可逆副作用为核心的 IoC 微内核框架。插件注册的所有副作用都能被追踪和回收,卸载时自动清理,天然支持热重载,还不会漏内存。DSH 拿它当底座,看中的就是这点。

整体分四层。

  1. 宿主内核层,依赖注入容器、工具注册中心、系统提示词管理,参数校验用自研的 schemastery,没用社区更流行的 zod,为的是跟 Cordis 技术栈统一
  2. LLM 适配层,原生适配 DeepSeek 全系模型,内置抽象引擎做多模型接入和协议翻译,两套主流 API 格式可以互转
  3. 网络能力层,网页抓取、DeepSeek 专属联网搜索、MCP 桥接扩展
  4. 统一契约层,全模块标配 invariant 断言守护,推行 Fail-Fast,长链路执行中出错即时截断

第四层值得单独说。Agent 连续跑几十轮工具调用,中间任何一步状态脏了,后面全是错的。与其带病跑完,不如当场停下。做过长链路编排的人应该都踩过这类坑,错误在链路里传播得越远,排查成本越高。

三、架构选择二,双 Surface 物理隔离

DSH 把宿主运行时和前端界面拆成了两套独立的插件体系,各管各的生命周期,各用各的 API。

Host 侧跑在 Node.js 运行时里,插件通过 defineTool 注册工具能力,通过 systemPrompt.section 按权重分段注入系统提示词,支持 Bash、MCP、视觉工具多种执行器,生命周期跟 Agent Loop 深度绑定,支持热重载。

Client 侧是 Web GUI,插件向预定义插槽注入 UI 组件,靠一组语义化 CSS 变量实现零侵入换肤,不改核心代码就能加功能面板。

为什么要拆这么干净。Agent 框架的 UI 注定会被反复改,有人要暗色主题,有人要监控面板,有人要把界面嵌进自家产品。如果 UI 和运行时绞在一起,每次改界面都是在动核心。拆开之后,界面怎么折腾都不影响执行链路。

四、架构选择三,遥测做成一等公民

这是我觉得最值得抄的一个设计。

DSH 的执行闭环遵循经典 Agent Loop。

关键在于,整个执行过程的运行指标被直接展示在 GUI 底部,实时可查。

指标类别

具体内容

执行粒度

用户交互轮次 turns 与 Agent 内部迭代步数 steps 分开统计

性能指标

单次工具调用耗时、上下文窗口占用率

成本指标

KV 缓存命中率、输入输出 Token 精确计量

内测开发者的实测数据里,系统提示词的缓存命中率能到 66%。这个数字直接对应省下来的钱和首字延迟。

我自己做企业 AI 网关相关的东西,看到这一段愣了一下。用量可视化是治理的前提,不是装饰,这是我们内部的共识,现在模型厂商在自己的框架里把 Token 计量和缓存命中率做成一等公民,说明成本可观测已经不是企业侧的单方面诉求,它正在变成整个行业的默认配置。

五、DSH 真正要干的活,模型路由

DeepSeek 手里现在有 Flash 和 Pro 两档模型,价格差三倍。截至 8 月 13 日的 API 文档,以每百万 Token 计。

模型

缓存命中输入

缓存未命中输入

输出

V4 Flash

0.02 元

1 元

2 元

V4 Pro

0.025 元

3 元

6 元

从两档模型的定价差和框架的多协议设计看,Harness 要干的核心工作之一,大概就是决定什么任务上 Pro,什么任务 Flash 就够。这是我综合几家实测媒体的推断,官方还没把话说明白,但方向很难是别的。

模型之间的能力梯度,本身就是成本优化的空间。以前大家比的是单模型强不强,现在比的是整套系统把每一分钱花在刀刃上的能力。DeepSeek 在自家生态里做这件事,靠的是两档模型加一个框架。对企业来说问题变成,你手里的模型不止一家的两档,路由放在哪一层做。

六、两个要留心的坑

热点内容写缺点的不多,但这两个不写,文章立不住。

坑一,长循环早停

有开发者用自研工具程序做了个实验,注意,用的是自己的工具,不是 DSH 框架,让 V4 Pro 跑 50 轮代码迭代优化。三次测试里有两次在第 42 到 43 轮主动调了 finish,剩下七八轮窗口闲置。

问题只出现在高思考强度加 40 轮以上超长循环的极端场景,官方基准多为短轮次任务,所以没被照出来。样本只有一个,根因也没锁定,开发者的两个猜想是强化学习奖励机制偏向早完成,或者长上下文注意力衰减。但如果你的业务里有长循环迭代任务,上线前建议自己压测一遍。

坑二,跑分口径

Terminal Bench 2.0 是斯坦福和 Laude Institute 联合做的基准,89 个人工校验任务,社区公开榜单目前最高分是 84.7%。DeepSeek 官方口径下 V4 Pro 拿到 87.9。

两边数字对不上不奇怪。这个基准的得分本来就强依赖所用的执行框架,同一个模型换个壳子,分数能差出一截,公开评测数据里甚至出现过同一模型换 harness 提升十几个点的情况。

有意思的是,这两个坑泼完,反而把主题锤得更实了。跑分依赖框架,能力上限由运行时决定,所以模型厂商才会亲自下场做框架。

七、可以带走的三件事

#

设计

抄什么

1

遥测一等公民

turns 和 steps 分开统计,Token 和缓存命中率实时可见,成本账从第一天算起

2

运行时与 UI 物理隔离

界面怎么改都不碰执行链路,两套插件体系独立生命周期

3

契约式 Fail-Fast

长链路出错即时截断,不带病前进

写在最后

回到开头第一个问题,模型厂商做框架有什么不一样。答案大概是,模型厂商手里的框架,天然要回答一个别人回答不了的问题,怎么让自家模型的能力梯度变成整个系统的成本优势。

模型管怎么想,框架管怎么干,治理管怎么管得住。三层都有人认真在做了。

你的 Agent 跑在哪一层,你自己的框架里有没有把遥测做成一等公民,评论区聊聊。

参考资料

  • DeepSeek 官方 API 文档(模型与价格页)
  • Terminal-Bench 2.0 公开榜单(Snorkel AI 维护)
  • AGI知路,DeepSeek 两大重磅,Harness 产品和 V4 Pro 正式版都来了(DSH 架构细节来源)
  • Koishi 官方文档,Cordis 与 schemastery 说明
  • Anthropic,Introducing the Model Context Protocol(MCP 协议背景)
  • 21 世纪经济报道、每日经济新闻,DeepSeek Harness 团队公众号注册相关报道
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐