目录

 发布时间线最新

1、什么是 DeepSeek Harness

2、核心设计理念:一切皆插件

2.1 Cordis 内核:从 QQ 机器人到 Agent 框架最新

3、插件生态爆发最新

3.1 必装插件 Top 10

3.2 远程渠道与安全插件

4、四种工作模式

4.1 创造模式实测最新

5、关键特性详解

5.1 全程轨迹审计(Trace)

5.2 缓存经济学最新

5.3 峰谷定价(8月16日生效)最新

5.4 模型自由切换

6、实测报告:能干活,但得盯着最新

6.1 简单任务:几乎无差距

6.2 复杂任务:上限不低,但需人工验收

6.3 横向对比:同一模型,三种工具

7、竞品横向对比

6.4 Composio 8 框架横评数据

8、安装与快速上手

环境要求

一键启动

从源码构建

首次使用三步走

安装插件

9、已知问题与安全提醒(最新)

10、行业意义与战略分析最新

对开发者

对企业

对行业


DeepSeek 官方开源的 AI Agent 运行框架——让 AI 从"只会聊天"变成"会干活"的工程基础设施。基于 Cordis 插件内核,一切皆插件,三天 GitHub Star 突破 10 万,社区插件仓库超 1000 个。

 发布时间线最新

三天内连续发生的事件,本身就构成了一个完整的故事:

1、什么是 DeepSeek Harness

2026 年 8 月 13 日晚,DeepSeek 在发布 V4 Pro 正式版模型的同时,开源了一套完整的 Agent 运行基础设施——DeepSeek Harness(简称 DSH,命令行名 dsh。与以往开放模型权重不同,这次开源的是模型"外面"的那套工程系统[1]

模型是大脑,负责思考与生成;Harness 是手脚和工具,负责让 AI 真正去操作文件、执行命令、调用服务

你平时用的 AI 能聊天、能写诗、能答问题,但它碰不到你电脑里的文件,替不了你干活。DSH 解决的正是这个问题:装上它之后,AI 能打开你电脑里的文件、帮你改内容、替你敲命令,把一件任务从头做到尾[2]

从产品定位看,DSH 类似于 Codex、Claude Code 等编码 Agent 工具,但有两个本质区别:MIT 协议完全开源,以及不绑定任何单一模型。它基于 Cordis 插件内核构建,支持 DeepSeek V4 系列以及 OpenAI、Anthropic、Bedrock、Vertex、Azure 等 40 多家模型提供商[2][3]

为什么叫 "Harness"?

Harness 英文原意为"驾驭"——如果把 AI 模型比作一匹马,那 Harness 就是你驾驭这匹马所需要的一切工程装备。研究怎么让模型跑得更快、更稳、更可控,就是 Harness 工程的核心命题[4]

2、核心设计理念:一切皆插件

DSH 最出圈的理念是 "Everything is a Plugin"(一切皆插件)。这不是营销话术,而是字面意思:

2.1 Cordis 内核:从 QQ 机器人到 Agent 框架最新

这套架构跑在 Cordis 插件内核之上。Cordis 是从 Koishi(国内老牌 QQ 机器人框架)中抽出来的微内核,作者是 GitHub 上的 Shigma。它只管三件事——加载插件、卸载插件、管理插件之间的依赖,本身不提供任何 Agent 能力[2]

Cordis 的核心技术叫"可逆副作用":每个插件注册时产生的所有副作用都会被追踪,卸载时自动回收,不留垃圾、不漏内存。翻译成使用体验就是热插拔——装插件、卸插件、换整套 UI,都不用重启,系统跑着跑着就把自己的一部分换掉了[2]

Cordis 配套论文《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式),由 DeepSeek 联合北京大学研发[1][3]

与同类产品的本质区别

Claude Code 和 Codex 更像一台装好的 Mac——你可以装各种软件,但核心系统是定死的;DSH 更像一台能自己换主板、换显卡、换操作系统的 DIY PC,哪儿不满意就换哪儿。

3、插件生态爆发最新

社区反应速度令人惊叹。8月13日当晚,36氪实测时一个目录收录了 288 个插件仓库;到8月14日,GitHub 上打 dsh-plugin 标签的仓库已经超过 1000 个,还在持续增长[2]

两个主要的插件目录:

3.1 必装插件 Top 10

以下插件均已超过 100 GitHub Star,按 Star 数排名(截至 2026-08-16)[6]

#插件名功能安装命令
1iPolloWork Design Studio画布式可视化文档编辑器,原生集成在 DSH 对话中dsh plugin --profile web add deepseek-idesign
2Mirage DSH统一挂载本地目录、内存存储和远程资源到一棵路径树dsh plugin --profile web add @struktoai/mirage-dsh
3DSH Web UIWeb UI 增强全家桶:任务看板、Git 图谱、手机远程、Token 统计dsh plugin --profile web add @linxin666/dsh-web-ui-all
4Modlens截图/图表/UI 图片转为 OCR 文本+布局信息,给纯文本模型加"眼睛"dsh plugin --profile web add @liustack/modlens
5DSH TUIClaude Code 风格的全屏终端界面,流式输出+上下文进度条+TPS 表dsh plugin --profile dsh-tui add @deepseek-harness-tui/dsh-tui
6DSH Better Sidebar侧边栏改造成完整工作台:文件编辑器+终端+Git 面板+子代理管理dsh plugin --profile web add dsh-better-sidebar
7DSH Vision Toolkit图片问答、长截图 OCR、UI 还原、像素对比——不是简单桥接视觉 APIdsh plugin --profile web add @anionex/dsh-vision-toolkit
8DSH Agent Teams创建 Agent 团队、分配任务、共享状态——多 Agent 协作dsh plugin --profile web add @nanmicoder/dsh-agent-teams
9Graph Memory跨会话的图结构记忆,支持关系召回、PageRank、社区检测、向量搜索dsh plugin --profile web add graph-memory
10DSH Ads抽象艺术:给 Web 界面加上 2005 年中文网站风格的侧栏广告和弹窗(已有人做了屏蔽插件)dsh plugin --profile web add github:Nagi-ovo/dsh-ads

插件生态的"攻防战"

最绝的是 dsh-ads 这个插件,给 Web 界面加上复古中文网站风格的广告。按 36氪 当晚的实测报道,目录里还紧挨着一个专门屏蔽它的插件——广告是插件,去广告也是插件,生态自己先完成了一轮攻防[2]

3.2 远程渠道与安全插件

除了工具类插件,社区还涌现了一批远程渠道插件(qqbotdsh-weixin-botdsh-feishu-botdsh-wecom-bottelegram),装上后 DSH 就能变成在 QQ 群、飞书里被 @ 的机器人。沙箱也有多种社区隔离方案可选,从轻量容器到内核级强制访问控制都有人在做[2]

4、四种工作模式

模式核心特点开箱工具适合谁
标准模式工具最全,开箱即用文件编辑、Shell、联网搜索、Skills、规划、子 Agent、工作流绝大多数人,默认推荐
PTC 模式程序化工具调用,模型写一段代码编排多次工具调用Code Mode SDK,把十次来回合并成一次执行批量自动化、在意 Token 成本的重度用户
极简模式最小工具集,减少干扰仅保留一个持久 bash + 一个文件编辑器官方跑模型基准测试用
创造模式AI 可检查和改装自身运行时允许 Agent 检查当前插件环境,现场生成新工具想开发自定义插件和 Agent 的进阶玩家

使用建议:第一次用先开极简模式,让它在一个小目录里干一件简单的活,感受一下它的节奏;熟悉了再切标准模式。PTC 和创造模式等你想折腾插件的时候再碰[2]

4.1 创造模式实测最新

实测中,AI 在"创造模式"下生成了一个"统计汉字个数"的工具,耗时约 3 分钟,当场可用[3]。另有媒体测试让 DSH 创建一个名为"事实核查员"的 Agent,专门负责检查文章里的事实错误,约 11 分钟完成创建,新会话中可直接调用[7]

5、关键特性详解

5.1 全程轨迹审计(Trace)

DSH 内置轨迹视图,类似 IDE 的 Debug 面板。每一轮对话、每次工具调用、输入输出 Token 全部可展开查看。这是通过仅追加的会话日志实现的——模型看到的系统提示、推理过程、工具调用和结果、子 Agent 调度,全部按顺序记成一份只增不改的日志[1]

当 Agent 在第几十步做错决定时,开发者可以回到当时模型真正看到的上下文,确认问题来自模型判断、工具返回、提示词变化还是错误的上下文注入。这种透明度是 Claude Code 等闭源工具无法提供的。

5.2 缓存经济学最新

AI 按 Token 计费,DSH 通过上下文缓存显著降低成本。实测数据非常惊人:

  • 有开发者跑了一个插件开发任务:6 轮、115 步、LLM 累计思考 16 分 20 秒,输入 15.4M Token,缓存命中 99%——1540 万输入 token 里只有不到 1% 是真正新发给模型的[2]
  • 有网友用它生成小程序,14.5M Token,缓存命中率高达 99.9%,最后只花了 5 毛钱[2]
  • 同一任务对比:Codex 花了 7 块多,DSH 只要 2 块左右[2]

99% 的命中率不是手动调出来的,是 DSH 的架构天然喂出来的:系统提示词、工具定义、已注入的 Skill、会话历史全部排在消息序列最前面,且只要不在中途切模型/切模式,它们字节级不变——这就是前缀缓存最理想的命中对象[2]

5.3 峰谷定价(8月16日生效)最新

从 2026 年 8 月 16 日 16:00 UTC 起,V4 Pro 正式实行峰谷定价[5]

计费项低谷价格高峰价格单位
缓存命中输入0.3 元0.3 元/百万 token
缓存未命中输入3 元9 元/百万 token
输出8 元27 元/百万 token

来源:阿里云开发者社区 2026-08-14 报道。高峰时段为北京时间工作日白天。

对比涨价前(缓存命中 0.025 元、未命中 3 元、输出 6 元),高峰时段涨幅明显。但 99% 的缓存命中率意味着实际成本只有全 miss 的零头——缓存就是省钱的命根子[2]

5.4 模型自由切换

DSH 支持 40+ 家模型提供商。想省钱用便宜的、想要更强的用贵的,在设置里直接切换即可。这意味着:

  • 可以保留同一套会话、工具和权限体系,只替换模型适配器
  • 可以固定模型,比较不同上下文管理或 Agent 循环的效果
  • 对于模型评测,有助于分辨能力提升究竟来自模型还是外部工程优化[1]

6、实测报告:能干活,但得盯着最新

"人人都是产品经理"团队对 DSH 进行了多维度实测,结论是:简单任务能正常完成,复杂任务纠错后完成度不错,但长任务和并行执行仍存在问题[7]

6.1 简单任务:几乎无差距

让标准模式和极简模式分别制作一个咖啡馆网页,结果几乎没拉开差距。标准模式选了棕色主视觉,极简模式用了墨绿色,但页面结构、功能模块和交互都比较接近。至少在简单任务里,工具更多并不等于结果一定更好[7]

6.2 复杂任务:上限不低,但需人工验收

让 DSH 用 Three.js 制作鲁布·戈德堡机关(金属球滚下斜坡→撞倒多米诺骨牌→触发摆锤→弹起小方块)。第一版因果链就断了——小球没滚下来,骨牌却自己倒了。指出问题后,第二版修正了物理效果[7]

更复杂的 3D 机械陀飞轮测试中,DSH 跑了 40 多分钟,最终交付了打不开的成品——因为两个任务在同一文件夹运行,另一个任务覆盖了陀飞轮的首页文件。排除问题后,成品完成度较高,爆炸视图和速度调节功能正常[7]

6.3 横向对比:同一模型,三种工具

在 DSH、Codex、WorkBuddy 中接入同一个 API,使用相同提示词完成两个任务[7]

任务DSHCodexWorkBuddy
数据看板首次 2.5h 未完成;加视觉插件后 3 分钟完成,37 款模型数据最全约 8 分钟完成,部分数字重叠,数据覆盖不稳定约 30 分钟,部分图表渲染错误,柱状图方向反了
3D 滑索游戏约 13 分钟交付最快,但角色没挂在绳索上,纠正后修复未测试约 23 分钟,首次交付空白页面,重新修改后可用

来源:人人都是产品经理 2026-08-14 实测报道。

关键发现:自己的模型配自己的 Harness,确实比硬套别人家的壳顺手。V4 Pro 虽然也提供了 Codex、Claude Code 的接入文档,但那是适配别人的协议和交互;在 DSH 里,模型、工具、缓存、Trajectory 日志是一套一起设计的[2]

7、竞品横向对比

维度DeepSeek HarnessClaude CodeCodex
模型绑定V4 系列,支持 40+ 家绑定 Claude绑定 GPT
开源程度MIT 全开源 + 论文闭源 CLIApache 2.0(云端 API)
运行环境本地 / 自托管本地终端云端沙箱
扩展方式一切皆插件(含主循环)hooks + MCP有限扩展
会话审计轨迹视图,可逐字节重建消息树,不可还原云端
数据隐私数据全部在本地本地(需上传模型 API)云端处理
插件生态1000+ 社区仓库(3天)有限有限
缓存优化99% 命中率(架构天然)未公开未公开

整理自:GitHub 仓库、极客公园实测报道 2026-08-14、阿里云开发者社区 2026-08-14。

6.4 Composio 8 框架横评数据

第三方 AI 基础设施公司 Composio 于 2026 年 8 月做了一组对照测试,把同一个 DeepSeek V4-Flash 模型分别接入 8 套不同 Agent 框架,跑同一批 30 个真实多步任务[3]

指标最佳最差差距
任务通过率Pi Agent 67%OpenCode 47%20 个百分点
每成功任务成本Pi Agent ~$0.028Claude Code ~$0.195近 7 倍
中位完成时间Claude Code 122.7sOh My Pi 272.4s2.2 倍

这组数据直接证明:Harness 本身已经成为评测变量。同一个模型在不同框架下的成功率可以从 47% 到 67%——差距比换一个模型还大[1]

8、安装与快速上手

环境要求

  • Node.js 22.19+(22.x 系列)或 24+ 版本——低版本会报一堆看不懂的错,先 node --version 确认[2]
  • 任意主流模型的 API Key(默认使用 DeepSeek)
  • 支持 Windows、macOS、Linux 全平台(Windows 用户优先用 Web UI)

一键启动

# 一行命令启动 DSH Web 界面
npx @deepseek-ai/dsh web

# 浏览器打开 http://127.0.0.1:3080
# 填入 API Key,选择工作区,即可开始使用

从源码构建

git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web

首次使用三步走

  1. 配 API Key:进 Settings → Models,找到 DeepSeek 卡片填入 sk-...,Key 存在本地,界面只显示脱敏后的描述符[2]
  2. 选工作区:点"选择工作区",添加你想让 Agent 操作的项目目录,必须手动选中才解锁输入框[2]
  3. 派活:比如丢一句"总结这个仓库,告诉我主要的包结构",它就开始读文件、跑命令、维护执行计划[2]

安装插件

不用自己翻文档拼命令——把仓库地址丢给对话框里的 Agent,用大白话说"帮我装这个",它自己读完 README 就把活干了。遇到要改配置或重启会停下来等你批权限[2]

9、已知问题与安全提醒(最新)

10、行业意义与战略分析最新

DeepSeek 选在 API 调价的同一个晚上开源 Harness,不是巧合。这里有一层精妙的战略逻辑:

Anthropic 需要 harness 这层值钱,因为它卖的是模型加外壳的整体;DeepSeek 需要 harness 不值钱,因为这层一旦被拉平成公共品,竞争就被压回模型本身的能力和价格上——而那已经是 DeepSeek 的主场了。R1 当年把闭源模型的溢价打下来,这一次 DSH 想把闭源外壳的溢价也打下来[2]

对开发者

DSH 是目前研究 Agent 内部机制的最佳开源样本。从模型适配、工具组织、会话审计到插件生态,整套方案免费公开。开发者可以像搭积木一样重新组合 Agent,也可以深入源码理解每一个设计决策[1]

对企业

沙箱、存储、审批、凭证和遥测都能作为插件存在,理论上可以接入内部权限系统与审计要求。企业可以保留自己的基础设施,只替换需要优化的部分[1]

对行业

模型公司集体下场做 Agent 框架,意味着 AI 竞争的主战场正从"会思考的模型"转向"会干活的系统"。当 Agent 开始执行持续数小时甚至数天的任务,模型只是系统中的一个组件,运行层会越来越多地决定能力上限[1]

长期展望

短期来看,DSH 是研究 Agent 内部机制的最佳开源样本;长期来看,如果插件生态成形,它可能成为 Agent 世界的"标准底座"。MIT 许可证降低了采用门槛,但能否形成生态——开发者是否愿意持续维护插件、企业是否敢把生产权限交给第三方组件、插件能否跨版本稳定运行——才会决定这套架构能走多远[1]

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐