DeepSeek Harness 深度解析
目录
2.1 Cordis 内核:从 QQ 机器人到 Agent 框架最新
DeepSeek 官方开源的 AI Agent 运行框架——让 AI 从"只会聊天"变成"会干活"的工程基础设施。基于 Cordis 插件内核,一切皆插件,三天 GitHub Star 突破 10 万,社区插件仓库超 1000 个。

发布时间线最新
三天内连续发生的事件,本身就构成了一个完整的故事:

1、什么是 DeepSeek Harness
2026 年 8 月 13 日晚,DeepSeek 在发布 V4 Pro 正式版模型的同时,开源了一套完整的 Agent 运行基础设施——DeepSeek Harness(简称 DSH,命令行名 dsh)。与以往开放模型权重不同,这次开源的是模型"外面"的那套工程系统[1]。

模型是大脑,负责思考与生成;Harness 是手脚和工具,负责让 AI 真正去操作文件、执行命令、调用服务
你平时用的 AI 能聊天、能写诗、能答问题,但它碰不到你电脑里的文件,替不了你干活。DSH 解决的正是这个问题:装上它之后,AI 能打开你电脑里的文件、帮你改内容、替你敲命令,把一件任务从头做到尾[2]。
从产品定位看,DSH 类似于 Codex、Claude Code 等编码 Agent 工具,但有两个本质区别:MIT 协议完全开源,以及不绑定任何单一模型。它基于 Cordis 插件内核构建,支持 DeepSeek V4 系列以及 OpenAI、Anthropic、Bedrock、Vertex、Azure 等 40 多家模型提供商[2][3]。
为什么叫 "Harness"?
Harness 英文原意为"驾驭"——如果把 AI 模型比作一匹马,那 Harness 就是你驾驭这匹马所需要的一切工程装备。研究怎么让模型跑得更快、更稳、更可控,就是 Harness 工程的核心命题[4]。
2、核心设计理念:一切皆插件
DSH 最出圈的理念是 "Everything is a Plugin"(一切皆插件)。这不是营销话术,而是字面意思:
2.1 Cordis 内核:从 QQ 机器人到 Agent 框架最新
这套架构跑在 Cordis 插件内核之上。Cordis 是从 Koishi(国内老牌 QQ 机器人框架)中抽出来的微内核,作者是 GitHub 上的 Shigma。它只管三件事——加载插件、卸载插件、管理插件之间的依赖,本身不提供任何 Agent 能力[2]。
Cordis 的核心技术叫"可逆副作用":每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔——装插件、卸插件、换整套 UI,都不用重启,系统跑着跑着就把自己的一部分换掉了[2]。
Cordis 配套论文《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式),由 DeepSeek 联合北京大学研发[1][3]。
与同类产品的本质区别
Claude Code 和 Codex 更像一台装好的 Mac——你可以装各种软件,但核心系统是定死的;DSH 更像一台能自己换主板、换显卡、换操作系统的 DIY PC,哪儿不满意就换哪儿。
3、插件生态爆发最新
社区反应速度令人惊叹。8月13日当晚,36氪实测时一个目录收录了 288 个插件仓库;到8月14日,GitHub 上打 dsh-plugin 标签的仓库已经超过 1000 个,还在持续增长[2]。
两个主要的插件目录:
- awesome-deepseek-harness(0xsline 维护,带安装命令)
- Awesome DSH Plugin(中英双语,分类更细)
3.1 必装插件 Top 10
以下插件均已超过 100 GitHub Star,按 Star 数排名(截至 2026-08-16)[6]:
| # | 插件名 | 功能 | 安装命令 |
|---|---|---|---|
| 1 | iPolloWork Design Studio | 画布式可视化文档编辑器,原生集成在 DSH 对话中 | dsh plugin --profile web add deepseek-idesign |
| 2 | Mirage DSH | 统一挂载本地目录、内存存储和远程资源到一棵路径树 | dsh plugin --profile web add @struktoai/mirage-dsh |
| 3 | DSH Web UI | Web UI 增强全家桶:任务看板、Git 图谱、手机远程、Token 统计 | dsh plugin --profile web add @linxin666/dsh-web-ui-all |
| 4 | Modlens | 截图/图表/UI 图片转为 OCR 文本+布局信息,给纯文本模型加"眼睛" | dsh plugin --profile web add @liustack/modlens |
| 5 | DSH TUI | Claude Code 风格的全屏终端界面,流式输出+上下文进度条+TPS 表 | dsh plugin --profile dsh-tui add @deepseek-harness-tui/dsh-tui |
| 6 | DSH Better Sidebar | 侧边栏改造成完整工作台:文件编辑器+终端+Git 面板+子代理管理 | dsh plugin --profile web add dsh-better-sidebar |
| 7 | DSH Vision Toolkit | 图片问答、长截图 OCR、UI 还原、像素对比——不是简单桥接视觉 API | dsh plugin --profile web add @anionex/dsh-vision-toolkit |
| 8 | DSH Agent Teams | 创建 Agent 团队、分配任务、共享状态——多 Agent 协作 | dsh plugin --profile web add @nanmicoder/dsh-agent-teams |
| 9 | Graph Memory | 跨会话的图结构记忆,支持关系召回、PageRank、社区检测、向量搜索 | dsh plugin --profile web add graph-memory |
| 10 | DSH Ads | 抽象艺术:给 Web 界面加上 2005 年中文网站风格的侧栏广告和弹窗(已有人做了屏蔽插件) | dsh plugin --profile web add github:Nagi-ovo/dsh-ads |
插件生态的"攻防战"
最绝的是
dsh-ads这个插件,给 Web 界面加上复古中文网站风格的广告。按 36氪 当晚的实测报道,目录里还紧挨着一个专门屏蔽它的插件——广告是插件,去广告也是插件,生态自己先完成了一轮攻防[2]。
3.2 远程渠道与安全插件
除了工具类插件,社区还涌现了一批远程渠道插件(qqbot、dsh-weixin-bot、dsh-feishu-bot、dsh-wecom-bot、telegram),装上后 DSH 就能变成在 QQ 群、飞书里被 @ 的机器人。沙箱也有多种社区隔离方案可选,从轻量容器到内核级强制访问控制都有人在做[2]。
4、四种工作模式
| 模式 | 核心特点 | 开箱工具 | 适合谁 |
|---|---|---|---|
| 标准模式 | 工具最全,开箱即用 | 文件编辑、Shell、联网搜索、Skills、规划、子 Agent、工作流 | 绝大多数人,默认推荐 |
| PTC 模式 | 程序化工具调用,模型写一段代码编排多次工具调用 | Code Mode SDK,把十次来回合并成一次执行 | 批量自动化、在意 Token 成本的重度用户 |
| 极简模式 | 最小工具集,减少干扰 | 仅保留一个持久 bash + 一个文件编辑器 | 官方跑模型基准测试用 |
| 创造模式 | AI 可检查和改装自身运行时 | 允许 Agent 检查当前插件环境,现场生成新工具 | 想开发自定义插件和 Agent 的进阶玩家 |
使用建议:第一次用先开极简模式,让它在一个小目录里干一件简单的活,感受一下它的节奏;熟悉了再切标准模式。PTC 和创造模式等你想折腾插件的时候再碰[2]。
4.1 创造模式实测最新
实测中,AI 在"创造模式"下生成了一个"统计汉字个数"的工具,耗时约 3 分钟,当场可用[3]。另有媒体测试让 DSH 创建一个名为"事实核查员"的 Agent,专门负责检查文章里的事实错误,约 11 分钟完成创建,新会话中可直接调用[7]。
5、关键特性详解
5.1 全程轨迹审计(Trace)
DSH 内置轨迹视图,类似 IDE 的 Debug 面板。每一轮对话、每次工具调用、输入输出 Token 全部可展开查看。这是通过仅追加的会话日志实现的——模型看到的系统提示、推理过程、工具调用和结果、子 Agent 调度,全部按顺序记成一份只增不改的日志[1]。
当 Agent 在第几十步做错决定时,开发者可以回到当时模型真正看到的上下文,确认问题来自模型判断、工具返回、提示词变化还是错误的上下文注入。这种透明度是 Claude Code 等闭源工具无法提供的。
5.2 缓存经济学最新
AI 按 Token 计费,DSH 通过上下文缓存显著降低成本。实测数据非常惊人:
- 有开发者跑了一个插件开发任务:6 轮、115 步、LLM 累计思考 16 分 20 秒,输入 15.4M Token,缓存命中 99%——1540 万输入 token 里只有不到 1% 是真正新发给模型的[2]
- 有网友用它生成小程序,14.5M Token,缓存命中率高达 99.9%,最后只花了 5 毛钱[2]
- 同一任务对比:Codex 花了 7 块多,DSH 只要 2 块左右[2]
99% 的命中率不是手动调出来的,是 DSH 的架构天然喂出来的:系统提示词、工具定义、已注入的 Skill、会话历史全部排在消息序列最前面,且只要不在中途切模型/切模式,它们字节级不变——这就是前缀缓存最理想的命中对象[2]。
5.3 峰谷定价(8月16日生效)最新
从 2026 年 8 月 16 日 16:00 UTC 起,V4 Pro 正式实行峰谷定价[5]:
| 计费项 | 低谷价格 | 高峰价格 | 单位 |
|---|---|---|---|
| 缓存命中输入 | 0.3 元 | 0.3 元 | /百万 token |
| 缓存未命中输入 | 3 元 | 9 元 | /百万 token |
| 输出 | 8 元 | 27 元 | /百万 token |
来源:阿里云开发者社区 2026-08-14 报道。高峰时段为北京时间工作日白天。
对比涨价前(缓存命中 0.025 元、未命中 3 元、输出 6 元),高峰时段涨幅明显。但 99% 的缓存命中率意味着实际成本只有全 miss 的零头——缓存就是省钱的命根子[2]。
5.4 模型自由切换
DSH 支持 40+ 家模型提供商。想省钱用便宜的、想要更强的用贵的,在设置里直接切换即可。这意味着:
- 可以保留同一套会话、工具和权限体系,只替换模型适配器
- 可以固定模型,比较不同上下文管理或 Agent 循环的效果
- 对于模型评测,有助于分辨能力提升究竟来自模型还是外部工程优化[1]
6、实测报告:能干活,但得盯着最新
"人人都是产品经理"团队对 DSH 进行了多维度实测,结论是:简单任务能正常完成,复杂任务纠错后完成度不错,但长任务和并行执行仍存在问题[7]。
6.1 简单任务:几乎无差距
让标准模式和极简模式分别制作一个咖啡馆网页,结果几乎没拉开差距。标准模式选了棕色主视觉,极简模式用了墨绿色,但页面结构、功能模块和交互都比较接近。至少在简单任务里,工具更多并不等于结果一定更好[7]。
6.2 复杂任务:上限不低,但需人工验收
让 DSH 用 Three.js 制作鲁布·戈德堡机关(金属球滚下斜坡→撞倒多米诺骨牌→触发摆锤→弹起小方块)。第一版因果链就断了——小球没滚下来,骨牌却自己倒了。指出问题后,第二版修正了物理效果[7]。
更复杂的 3D 机械陀飞轮测试中,DSH 跑了 40 多分钟,最终交付了打不开的成品——因为两个任务在同一文件夹运行,另一个任务覆盖了陀飞轮的首页文件。排除问题后,成品完成度较高,爆炸视图和速度调节功能正常[7]。
6.3 横向对比:同一模型,三种工具
在 DSH、Codex、WorkBuddy 中接入同一个 API,使用相同提示词完成两个任务[7]:
| 任务 | DSH | Codex | WorkBuddy |
|---|---|---|---|
| 数据看板 | 首次 2.5h 未完成;加视觉插件后 3 分钟完成,37 款模型数据最全 | 约 8 分钟完成,部分数字重叠,数据覆盖不稳定 | 约 30 分钟,部分图表渲染错误,柱状图方向反了 |
| 3D 滑索游戏 | 约 13 分钟交付最快,但角色没挂在绳索上,纠正后修复 | 未测试 | 约 23 分钟,首次交付空白页面,重新修改后可用 |
来源:人人都是产品经理 2026-08-14 实测报道。
关键发现:自己的模型配自己的 Harness,确实比硬套别人家的壳顺手。V4 Pro 虽然也提供了 Codex、Claude Code 的接入文档,但那是适配别人的协议和交互;在 DSH 里,模型、工具、缓存、Trajectory 日志是一套一起设计的[2]。
7、竞品横向对比
| 维度 | DeepSeek Harness | Claude Code | Codex |
|---|---|---|---|
| 模型绑定 | V4 系列,支持 40+ 家 | 绑定 Claude | 绑定 GPT |
| 开源程度 | MIT 全开源 + 论文 | 闭源 CLI | Apache 2.0(云端 API) |
| 运行环境 | 本地 / 自托管 | 本地终端 | 云端沙箱 |
| 扩展方式 | 一切皆插件(含主循环) | hooks + MCP | 有限扩展 |
| 会话审计 | 轨迹视图,可逐字节重建 | 消息树,不可还原 | 云端 |
| 数据隐私 | 数据全部在本地 | 本地(需上传模型 API) | 云端处理 |
| 插件生态 | 1000+ 社区仓库(3天) | 有限 | 有限 |
| 缓存优化 | 99% 命中率(架构天然) | 未公开 | 未公开 |
整理自:GitHub 仓库、极客公园实测报道 2026-08-14、阿里云开发者社区 2026-08-14。
6.4 Composio 8 框架横评数据
第三方 AI 基础设施公司 Composio 于 2026 年 8 月做了一组对照测试,把同一个 DeepSeek V4-Flash 模型分别接入 8 套不同 Agent 框架,跑同一批 30 个真实多步任务[3]:
| 指标 | 最佳 | 最差 | 差距 |
|---|---|---|---|
| 任务通过率 | Pi Agent 67% | OpenCode 47% | 20 个百分点 |
| 每成功任务成本 | Pi Agent ~$0.028 | Claude Code ~$0.195 | 近 7 倍 |
| 中位完成时间 | Claude Code 122.7s | Oh My Pi 272.4s | 2.2 倍 |
这组数据直接证明:Harness 本身已经成为评测变量。同一个模型在不同框架下的成功率可以从 47% 到 67%——差距比换一个模型还大[1]。
8、安装与快速上手
环境要求
- Node.js 22.19+(22.x 系列)或 24+ 版本——低版本会报一堆看不懂的错,先
node --version确认[2] - 任意主流模型的 API Key(默认使用 DeepSeek)
- 支持 Windows、macOS、Linux 全平台(Windows 用户优先用 Web UI)
一键启动
# 一行命令启动 DSH Web 界面
npx @deepseek-ai/dsh web
# 浏览器打开 http://127.0.0.1:3080
# 填入 API Key,选择工作区,即可开始使用
从源码构建
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
首次使用三步走
- 配 API Key:进 Settings → Models,找到 DeepSeek 卡片填入
sk-...,Key 存在本地,界面只显示脱敏后的描述符[2] - 选工作区:点"选择工作区",添加你想让 Agent 操作的项目目录,必须手动选中才解锁输入框[2]
- 派活:比如丢一句"总结这个仓库,告诉我主要的包结构",它就开始读文件、跑命令、维护执行计划[2]
安装插件
不用自己翻文档拼命令——把仓库地址丢给对话框里的 Agent,用大白话说"帮我装这个",它自己读完 README 就把活干了。遇到要改配置或重启会停下来等你批权限[2]。
9、已知问题与安全提醒(最新)

10、行业意义与战略分析最新
DeepSeek 选在 API 调价的同一个晚上开源 Harness,不是巧合。这里有一层精妙的战略逻辑:
Anthropic 需要 harness 这层值钱,因为它卖的是模型加外壳的整体;DeepSeek 需要 harness 不值钱,因为这层一旦被拉平成公共品,竞争就被压回模型本身的能力和价格上——而那已经是 DeepSeek 的主场了。R1 当年把闭源模型的溢价打下来,这一次 DSH 想把闭源外壳的溢价也打下来[2]。
对开发者
DSH 是目前研究 Agent 内部机制的最佳开源样本。从模型适配、工具组织、会话审计到插件生态,整套方案免费公开。开发者可以像搭积木一样重新组合 Agent,也可以深入源码理解每一个设计决策[1]。
对企业
沙箱、存储、审批、凭证和遥测都能作为插件存在,理论上可以接入内部权限系统与审计要求。企业可以保留自己的基础设施,只替换需要优化的部分[1]。
对行业
模型公司集体下场做 Agent 框架,意味着 AI 竞争的主战场正从"会思考的模型"转向"会干活的系统"。当 Agent 开始执行持续数小时甚至数天的任务,模型只是系统中的一个组件,运行层会越来越多地决定能力上限[1]。
长期展望
短期来看,DSH 是研究 Agent 内部机制的最佳开源样本;长期来看,如果插件生态成形,它可能成为 Agent 世界的"标准底座"。MIT 许可证降低了采用门槛,但能否形成生态——开发者是否愿意持续维护插件、企业是否敢把生产权限交给第三方组件、插件能否跨版本稳定运行——才会决定这套架构能走多远[1]。
更多推荐



所有评论(0)