厉害了DeepSeek Harness!村内又一开源倔起的地标

3天十三万星刷新GitHub历史,三天长出5700个插件仓库——DeepSeek这次交出的不是又一个大模型,而是一座让全世界开发者排队来盖房子的开源城池。

基于学习和实践,我整理了《AI Agent 学习手册》包含LLM基础知识、Claude Code 、OpenClaw、Vibe Coding、AI应用开发等内容,目前已经有近50w字干货,持续更新。

DeepSeek又搞了个大动作。

不是新模型,不是降价,而是一个叫 DeepSeek Harness 的东西,悄无声息地上了GitHub。
在这里插入图片描述

首个版本为 v0.1,并同步以 MIT 协议开放源代码:https://github.com/deepseek-ai/deepseek-harness

没有预热,没有发布会,甚至连个像样的宣传文案都没有——就往仓库里扔了一份代码,MIT协议,爱要不要。

结果呢?

30分钟,破万星。

90分钟,2.4万星。

42小时,10万星。

……

这是什么概念?DeepSeek自家的R1,破2万星用了5.7天;此前全球涨星最快的Grok-1,破2万星用了1.2天。而Harness把这个纪录直接压缩到了以小时计

我放下手里的bug,花了一整夜把它的代码、架构文档、社区生态翻了个底朝天。今天这篇文章,跟大家好好聊聊:这个让全世界开发者疯狂的东西,到底是什么?为什么这么猛?跟我们每个人有什么关系?

一、先搞懂一个问题:Harness到底是个啥?

很多朋友第一反应是"DeepSeek又发了个新模型?"

不是。

官方给了一个极其精简的公式:

Model + Harness = Agent

翻译成人话:模型是脑子,Harness是手脚。

你平时用的ChatGPT、DeepSeek聊天框,模型只能"动嘴"——给你输出一段文字。但真正的Agent要"动手"——它得能读你的文件、跑终端命令、上网查资料、拆分任务、管理记忆、出错了自己重试。

谁来干这些脏活累活?就是Harness。

打个比方:模型是发动机,Harness是方向盘、油门、刹车、仪表盘、底盘——整辆车的非发动机部分。发动机再猛,没有底盘你也就是个拖拉机。

过去,这套"底盘"被锁在各家公司的黑盒里。OpenAI有Codex,Anthropic有Claude Code,都是成品车——你只能开,不能掀开引擎盖。

DeepSeek说:我把整辆车的图纸都给你,连造车流水线都开源了。

二、“一切皆插件”:五个字,值十万颗星

Harness最核心的设计理念,官方原话是五个字:

一切皆插件。

什么意思?

一个Agent要运转,需要一堆零件:模型适配器、工具注册表、技能系统、会话管理、沙箱、存储、任务调度、循环控制、甚至连界面UI——全部拆成独立插件。

你可以:

  • 换模型:今天用DeepSeek V4,明天用Claude,后天用GPT,一行配置搞定

  • 换工具:不想用自带的文件编辑器?写个插件换掉

  • 换界面:嫌默认Web UI丑?社区有几十套主题插件随便换

  • 换存储:不想存本地?接个远程数据库插件

  • 换调度策略:觉得任务拆分逻辑不好?自己写一个

不用fork源码,不用改一行核心代码,纯靠配置和插件就能重新组装。

这套架构的底层是一个叫 Cordis 的插件元框架。Cordis只干三件事:加载插件、卸载插件、管理依赖关系,除此之外什么都不做。

更狠的是,Cordis有两个杀手锏特性:

  1. 时间可组合性:插件卸载后,能完整撤销它产生的所有副作用——装了又拆,干干净净,不留痕迹

  2. 空间可组合性:插件依赖变化时,能动态重新处理依赖关系

这意味着什么?**Agent在运行过程中可以热插拔插件,甚至可以自己写插件、自己装、自己拆。**这不是科幻,是代码里已经实现的能力。

Cordis不是实验室玩具——它从Koishi聊天机器人框架孵化而来,已在生产环境跑了4年,经历过4000多个社区插件的实战检验。

这套架构的理论基础,是一篇北大和DeepSeek联合署名的论文:《A Programming Paradigm for Spatiotemporal Composability》。翻译过来就是"时空可组合的编程范式"——听起来很学术,但落地效果就是让你像搭乐高一样拼装Agent。

三、四种模式,覆盖从跑测试到搞创造

Harness内置了四种预设模式,每种加载不同的插件组合:

模式适合场景一句话解释
标准模式日常开发完整工具箱全开,能读写文件、跑命令、上网搜索
PTC模式复杂工作流模型自己写一段代码来批量调用工具,中间数据不用来回过模型,省Token利器
极简模式模型基准测试只留一个Shell和一个文件编辑器,最小环境跑分用
创造模式极客探索可以检查运行时、在内存里试验Cordis插件、当场组合新模式

说个细节:此前DeepSeek V4-Flash在TerminalBench基准测试中成绩突飞猛进,用的正是极简模式。别人拿它跑分,它顺便把纪录破了。

四、谁在造这辆车?——崔添翼和他的"三个月奇迹"

带队的人叫 崔添翼,这名字在技术圈本身就是一块招牌。

简单列一下他的履历:

  • 浙江大学毕业

  • ACM亚洲区金牌六次(算法竞赛选手应该知道这有多难)

  • 《背包问题九讲》作者——无数算法竞赛选手的启蒙教材

  • 在Jane Street(全球顶级量化交易公司)工作了近9年

  • 量化基金TSY Capital联合创始人

  • Koishi聊天机器人框架的作者(Cordis就是从这里孵化出来的)

  • 2026年3月加入DeepSeek

5月组建团队,8月交出作品。三个月,从零到GitHub十万星。

这个速度,就算是硅谷的顶级团队也得服气。前华尔街量化交易员带队,清华AI-Infra方向新锐紧随其后,三个月内上万次代码提交——这个工程密度,不是一般的高。

五、三天5700个插件:生态爆发不靠运营,靠架构

如果说Harness本身是一辆车,那真正的看点是:这辆车开上路三天,后面就跟了一个车队。

来看数据:

  • 发布24小时:dsh-plugin标签下突破700个插件仓库

  • 发布3天:插件仓库数量达到5700+

  • 第三方聚合目录Oh-My-DSH:监测到990个生态仓库,累计星标11.2万

这些插件都在干什么?我挑几个有代表性的:

实用派:

  • open-design(8.7万星):开源版Claude Design替代品,把编码Agent变成设计引擎,原型/落地页/仪表盘/幻灯片都能生成

  • OpenViking(2.8万星):字节出品的Agent上下文数据库,补上了Harness的记忆层短板

  • archify(1.3万星):一句话画架构图、时序图、数据流图,产出可导出的HTML

脑洞派:

  • colleague-skill:把一个人的聊天记录和文档喂进去,生成模仿他思维方式的"数字分身"

  • dsh-minigames:18款小游戏合集,包括俄罗斯方块、贪吃蛇——你可以在Agent工作台里摸鱼

  • dsh-ads:模拟2005年中文互联网风格的广告UI——是的,有人专门做了个怀旧皮肤

  • 鲸鱼桌面宠物:DeepSeek的logo是鲸鱼,所以做鲸鱼桌面宠物的项目有69个,这是最容易撞车的赛道

最有意思的是,连界面本身都是插件。有人把工作台打扮成了"女仆咖啡馆"风格——侧栏写着DeepSeek的品牌slogan,输入框两边站着两位女仆,右上角显示DeepSeek-V4-Pro模型。一台能读写文件、跑终端命令的Agent工作台,顶着一身女仆装认真执行你的需求。

这画面说不上违和,甚至有点燃。

功能强不强是一回事;社区愿不愿意给它换皮、整活、表达热爱,是另一回事。这才叫生态。

为什么三天就能长出这么多插件?答案就四个字:接入成本极低。

"万物皆插件"把接入门槛压到了一行清单声明。写个dsh.bundle配置文件,你的项目就能挂进生态。存量项目纷纷来占位——四万星的老牌简历构建器reactive-resume主动适配了DSH,字节、腾讯系的项目也来挂靠。

谁都没理由不来。

六、6毛钱 vs 70块钱:成本打到了地板

说完架构和生态,说点最实际的——

有媒体做了一组实测对比:在完成相同任务、效果相近的情况下——

方案成本
Claude(Anthropic)约9.8美元 ≈ 70元人民币
DSH + DeepSeek V4 Pro6毛钱

成本差了120倍。

为什么能这么便宜?除了模型本身定价低,还有一个被很多人忽略的架构级省钱设计:

插件按需加载 → 系统提示词和工具定义保持稳定 → 前缀缓存更容易命中 → 每轮请求更便宜。

而一个什么都往系统提示词里塞、前缀天天变的框架,会反复打爆缓存,烧钱如流水。

省钱和开放,被DeepSeek同时焊进了架构里。这不是技术洁癖,这是白花花的钱。

在一些特定任务中,DSH可以实现高达99%的缓存命中率。这个数字意味着什么?意味着绝大多数时候,模型不需要重新"读"一遍上下文,直接从缓存里拿——又快又便宜。

七、跟Claude Code比,到底谁更强?

这是大家最关心的问题。直接上对比:

维度DeepSeek HarnessClaude Code
开源协议MIT(源码全开)专有(客户端开源,模型闭源)
架构插件化内核,无特权核心垂直整合单体
模型绑定模型即插件,可接任意厂商绑定Anthropic模型
运行时自扩展支持(Agent可自己写插件)不支持
热插拔组件支持不支持
会话日志append-only明文,可审计回放托管式记录
成本极低(6毛钱级)较高(70元级)
成熟度开发者预览版,有破坏性变更生产级
交互形态本地Web UI + headless终端原生

一句话总结:DSH赢在架构和成本,Claude Code赢在成熟度。

DSH最有说服力的优势是审计性——所有模型可见的内容都会被记录到append-only日志里,你可以精确回放模型在任何一步看到了什么、调用了什么工具、在哪一步出错。对于有合规要求的团队,这是整个发布中最硬的论据。

而DSH最讽刺的地方在于:**它本身可以运行Claude模型。**你可以在DSH里跑Claude,也可以跑GPT,也可以跑任何OpenAI兼容的模型——模型只是插件之一。

但说实话,v0.1阶段,"替代Claude Code"还言之过早。官方README用加粗大写字母提醒:项目处于developer preview阶段,一定会有破坏性兼容变更。翻译成人话:现在拿去跑核心生产链路,大概率要返工;想研究架构、抢插件生态位,现在正是窗口期。

八、为什么说这是中国AI的一个重要时刻?

过去几年,中国AI公司在大模型层面一直在追赶——参数、能力、评测分数,你追我赶。但在模型之上的工程层,在Agent运行框架这个层面,我们一直是缺席的。

OpenAI有Codex,Anthropic有Claude Code,它们不仅卖模型,还卖"模型怎么干活"的整套方案。控制了工程层,就控制了开发者的工作流。

DeepSeek Harness的意义在于:这是中国公司第一次在"模型+工程外壳"层面,与Anthropic正面抗衡。

而且不只是对标——它选择了一条完全不同的路:

  • 别人做成品车,它开源造车图纸

  • 别人锁死生态,它把每个零件都开放

  • 别人靠订阅赚钱,它把成本打到地板

更关键的是生态已经跑起来了:

  • QQ Bot已集成DeepSeek Harness,支持单聊和群聊

  • 国家超算互联网上线了DSH全套源码,科研院所和企业可以一键拉取部署

  • 插件作者遍布全球,三天5700个仓库——这不是中国开发者的自嗨,是全球开发者的用脚投票

九、工程师视角:我的真实判断

作为一个写了十年代码的软件工程师,我对DSH的判断是:

架构层面:这是一次真正的范式创新。 "一切皆插件"不是营销口号,是从底层元框架到上层UI贯彻到底的设计哲学。Cordis的时空可组合性,让Agent运行时的热插拔成为可能——这在当前所有Agent框架中是独一无二的。

生态层面:爆发速度前所未有。 三天5700个插件,这不是运营驱动的,是架构驱动的——接入成本被压到一行声明,社区自然会补齐所有缺口。

成熟度层面:还是毛坯房。 v0.1就是v0.1,bug不少,文档还在完善,API随时可能变。现在拿来跑生产环境,要做好返工准备。但如果你想研究Agent架构、想抢占插件生态位,现在就是最好的窗口期

战略层面:意义远超产品本身。 DeepSeek从"模型提供商"跨向了"开发者入口争夺者"。当模型能力趋于同质化,谁能圈住开发者和工作流,谁就圈住未来。

写在最后

回到标题——为什么说这是"村内又一开源倔起地标"?

"倔"不是"崛"的错别字。是倔强的倔,是不服输的倔。

在一个所有人都觉得"Agent框架是美国公司的专利"的时代,DeepSeek用三个月时间,交出了一份让全世界排队来盖房子的开源答卷。

它没有先做生态。它先做了一台让生态自己长出来的机器。

模型会过时,框架会迭代,但"把造车权交出去"这个决定,会在很长一段时间里被记住。

崔添翼在社交媒体上说:这是一个预览版本,可能存在很多粗糙之处,希望大家多提意见。

谦虚了。但社区已经用13万颗星投了票。

最后给朋友们三个建议:

  1. 如果你是开发者:花十分钟跑起来看看,npx @deepseek-ai/dsh web,一行命令,打开浏览器就能体验

  2. 如果你是技术管理者:关注但别急着上生产,v0.1的破坏性变更是迟早的事,但可以作为技术预研方向

  3. 如果你是插件作者:现在就是抢位的黄金窗口,设计类和记忆类插件是当前最热的赛道

模型决定AI的下限,插件生态决定它的上限。

DeepSeek Harness,至少拿到了入场券。

对了,基于学习和实践,我整理了《AI Agent 学习手册》包含LLM基础知识、Claude Code 、OpenClaw、Vibe Coding、AI应用开发等内容,目前已经有近50w字干货,持续更新。

关于DeepSeek Harness,你还有什么要补充的?上手了么?评论区聊聊~

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐