目录

  1. 引言:一个比喻讲清三层关系
  2. 九项 Agent 能力清单横向对比
  3. 四大先进性与行业影响
  4. 本地实盘:七项验证
  5. 客观评价与适用边界
  6. 总结

一、引言:一个比喻讲清三层关系

DeepSeek Harness 开源 12 小时突破 5 万 Star,成为本周 AI 圈最大事件。多数自媒体将其比喻为"马鞍"——模型是马,鞍是装备。但这一比喻暗示 Harness 是附属品,未能揭示其本质。

在这里插入图片描述

更准确的比喻:将智能体比作一台台式机,模型是软件,Harness 是硬件加操作系统,为软件提供可运行的环境。

顺此比喻,当前主流 AI 编程工具分为三类:

类型代表特点
品牌机Codex / Claude Code整机封装,主板(内核)不可改动
半兼容机WorkBuddy可换 CPU(模型)、可装 App(Skill),主板厂商定
兼容机DeepSeek HarnessCPU、电源、机箱、屏幕全散件,用户自行组装

品牌机与兼容机并非高低之分,而是"省心 vs 自由"的取舍。

二、九项 Agent 能力清单横向对比

DeepSeek 官方列出九项 Agent 能力——模型、工具、技能、会话、沙箱、存储、循环、调度、UI——声明全部由插件组合,可自由替换与重组。

模块DeepSeek HarnessCodex / Claude CodeWorkBuddy
模型任意换(OpenAI 格式)锁厂商自家模型可切换、自定义
工具插件随便加内置固定,MCP 扩展内置固定,连接器+MCP 扩展
技能插件自定义指令、subagentsskillhub 装/写
会话仅追加日志,可回放分叉产品定,部分可导入导出产品定
沙箱插件(提供方可换)云端沙箱写死执行环境产品定
存储插件产品定资料库、记忆产品架构
循环主循环也是插件写死厂商定,不开放替换
调度插件无用户级定时调度有自动化
UI插件(连界面都能换)给啥用啥产品界面

Codex 仅开放技能、工具(MCP)、模型三个接口;WorkBuddy 多开一个"调度"接口;DeepSeek Harness 九项全开放,主循环和界面均为可替换插件。

三、四大先进性与行业影响

3.1 全插件架构

模型、工具、技能、循环、UI 全部插件化。发布数日社区已产出 1000+ 插件(飞书机器人、企业微信网关、语音朗读、桌面封装)。品牌机需新能力须等厂商排期,兼容机当日即可由开发者和社区协作完成。

3.2 过程全透明

每步工具调用、思维链、返回结果均写入 append-only 日志,支持回放、分叉、重跑。业界称为"Agent 的 DevTools",品牌机黑盒无法提供同等可观测性。

注意:Harness 框架运行于本地,工具调度、文件读写、session log 均留在本地,但模型推理走 DeepSeek API,prompt 与上下文仍需送出。准确表述为"执行过程透明、环境可控",非"数据完全不出本地"。

3.3 模型无关

兼容任意 OpenAI 格式模型,轻量任务用 Flash,高难度切 Pro,缓存命中成本极低。实测 5,661,568 tokens 缓存读取,费用几乎为零。

3.4 工具执行本地完成

磁盘扫描、文件写入、Python 运行、网页抓取均在本地执行,非云端沙箱周转,对本地文件操作场景为硬性优势。

行业影响

官方实测同一 V4 Flash 模型在 8 个框架运行 30 个任务,完成次数 14 至 20,差距近三分之一。模型一致,Harness 不同,结果显著差异——Harness 不是中性包装纸,是直接决定效率的变量。

笔者在公益培训中验证了同一逻辑:同一讲师(模型),叠加"课程设计 Skill"(Harness 层),耗时从 1 小时降至 5 分钟。价值积累发生在 Harness 层,非模型层。DeepSeek 将这一层开源,实质是将竞争从模型层拉至 Harness 层。

未来方向:AI 工具竞争主战场将从"谁的模型更聪明"转向"谁的 Harness 更高效、更开放、更可控"。

四、本地实盘:七项验证

环境搭建

mkdir D:\deepseek-harness && cd D:\deepseek-harness
npx -y @deepseek-ai/dsh web

浏览器访问 http://127.0.0.1:3080,填入 DeepSeek 官网创建的 API Key。

安装

API Key

Harness界面

验证一:跨项目磁盘扫描

指令:扫描 D:\development,按修改时间倒序列出今日改过的 md 文件,每条给一句话摘要。结果:跨项目读取文件,自动生成摘要,通过。

在这里插入图片描述

验证二:真实写盘验证

指令:写入 test.md(我是谁 + 当前时间 + 测试目标),读回确认。步骤链:Think → Pwsh Get date → Write → Read。说明先调系统时间再写,非"假装"执行。

真写盘

验证三:自建 Skill

按 skill-creator 规范创建 test-harness-skill,创建成功,Skill 系统真实运行。

自建Skill

验证四:跨平台 Skill 复用

调用 WorkBuddy 上的 gzh-writer-enhanced 生成短文,Harness 可直接读取使用。说明 Skill 格式跨 Harness 通用,非私有协议。

跨平台Skill

验证五:长链路全自动抓取

curl 抓取 workbuddy.cn 首页 → 提取标题副标题 → 写入 md → 读回确认,5 步一气呵成。对比品牌机常见的中途询问"是否继续",Harness 完成度更高。

长链路

验证六:并行子任务执行

并行计算 1-100 的偶数和与奇数和,分叉两个上下文并行执行,汇总后自动交叉验证(2550+2500=5050=100×101/2),非简单输出两个数等用户核对。

并行

验证七:自我出账

复盘完整对话:9 条提问 / 105 次工具调用(pwsh 55 + read 28 + write 8 + job_output 6 + grep 4 + glob 3 + job_kill 1)/ 活跃耗时 16.5 分钟 / 输入 70,502 + 输出 38,805 = 109,307 tokens / 缓存读取 5,661,568 tokens。AI 首次交出自身运行明细账。

出账1

出账2

在这里插入图片描述

五、客观评价与适用边界

  1. 门槛仍偏高:命令行 + Web 起步,对非开发者不够友好。
  2. 仍在快速迭代:官方声明"会有破坏兼容性的变更",插件稳定性存不确定性。
  3. 品牌机亦有其价值:Codex、Claude Code 对仅需完成任务的普通用户更省心。
  4. 强 Harness 不能弥补弱模型:小模型 + 强 Harness 的天花板由模型逻辑能力决定。

品牌机与兼容机不是高低之分,而是"省心 vs 自由"的取舍。用户是否愿意投入学习成本换取任意拼装能力,才是选择 Harness 的真正门槛。

六、总结

DeepSeek 将"怎么攒这台电脑"的图纸开源,意味着普通人不再被动等待厂商提供功能,可自行拼装趁手工具。AI 工具竞争正从模型层向 Harness 层转移,对整个开发者生态和工具开放性而言,是值得持续关注的信号。

想,都是问题。干,就对了。

结尾

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐