厉害了DeepSeek Harness!村内又一开源倔起的地标
厉害了DeepSeek Harness!村内又一开源倔起的地标
3天十三万星刷新GitHub历史,三天长出5700个插件仓库——DeepSeek这次交出的不是又一个大模型,而是一座让全世界开发者排队来盖房子的开源城池。
基于学习和实践,我整理了《AI Agent 学习手册》包含LLM基础知识、Claude Code 、OpenClaw、Vibe Coding、AI应用开发等内容,目前已经有近50w字干货,持续更新。
DeepSeek又搞了个大动作。
不是新模型,不是降价,而是一个叫 DeepSeek Harness 的东西,悄无声息地上了GitHub。

首个版本为 v0.1,并同步以 MIT 协议开放源代码:https://github.com/deepseek-ai/deepseek-harness
没有预热,没有发布会,甚至连个像样的宣传文案都没有——就往仓库里扔了一份代码,MIT协议,爱要不要。
结果呢?
30分钟,破万星。
90分钟,2.4万星。
42小时,10万星。
……
这是什么概念?DeepSeek自家的R1,破2万星用了5.7天;此前全球涨星最快的Grok-1,破2万星用了1.2天。而Harness把这个纪录直接压缩到了以小时计。
我放下手里的bug,花了一整夜把它的代码、架构文档、社区生态翻了个底朝天。今天这篇文章,跟大家好好聊聊:这个让全世界开发者疯狂的东西,到底是什么?为什么这么猛?跟我们每个人有什么关系?
一、先搞懂一个问题:Harness到底是个啥?
很多朋友第一反应是"DeepSeek又发了个新模型?"
不是。
官方给了一个极其精简的公式:
Model + Harness = Agent
翻译成人话:模型是脑子,Harness是手脚。
你平时用的ChatGPT、DeepSeek聊天框,模型只能"动嘴"——给你输出一段文字。但真正的Agent要"动手"——它得能读你的文件、跑终端命令、上网查资料、拆分任务、管理记忆、出错了自己重试。
谁来干这些脏活累活?就是Harness。
打个比方:模型是发动机,Harness是方向盘、油门、刹车、仪表盘、底盘——整辆车的非发动机部分。发动机再猛,没有底盘你也就是个拖拉机。
过去,这套"底盘"被锁在各家公司的黑盒里。OpenAI有Codex,Anthropic有Claude Code,都是成品车——你只能开,不能掀开引擎盖。
DeepSeek说:我把整辆车的图纸都给你,连造车流水线都开源了。
二、“一切皆插件”:五个字,值十万颗星
Harness最核心的设计理念,官方原话是五个字:
一切皆插件。
什么意思?
一个Agent要运转,需要一堆零件:模型适配器、工具注册表、技能系统、会话管理、沙箱、存储、任务调度、循环控制、甚至连界面UI——全部拆成独立插件。
你可以:
-
换模型:今天用DeepSeek V4,明天用Claude,后天用GPT,一行配置搞定
-
换工具:不想用自带的文件编辑器?写个插件换掉
-
换界面:嫌默认Web UI丑?社区有几十套主题插件随便换
-
换存储:不想存本地?接个远程数据库插件
-
换调度策略:觉得任务拆分逻辑不好?自己写一个
不用fork源码,不用改一行核心代码,纯靠配置和插件就能重新组装。
这套架构的底层是一个叫 Cordis 的插件元框架。Cordis只干三件事:加载插件、卸载插件、管理依赖关系,除此之外什么都不做。
更狠的是,Cordis有两个杀手锏特性:
-
时间可组合性:插件卸载后,能完整撤销它产生的所有副作用——装了又拆,干干净净,不留痕迹
-
空间可组合性:插件依赖变化时,能动态重新处理依赖关系
这意味着什么?**Agent在运行过程中可以热插拔插件,甚至可以自己写插件、自己装、自己拆。**这不是科幻,是代码里已经实现的能力。
Cordis不是实验室玩具——它从Koishi聊天机器人框架孵化而来,已在生产环境跑了4年,经历过4000多个社区插件的实战检验。
这套架构的理论基础,是一篇北大和DeepSeek联合署名的论文:《A Programming Paradigm for Spatiotemporal Composability》。翻译过来就是"时空可组合的编程范式"——听起来很学术,但落地效果就是让你像搭乐高一样拼装Agent。
三、四种模式,覆盖从跑测试到搞创造
Harness内置了四种预设模式,每种加载不同的插件组合:
| 模式 | 适合场景 | 一句话解释 |
|---|---|---|
| 标准模式 | 日常开发 | 完整工具箱全开,能读写文件、跑命令、上网搜索 |
| PTC模式 | 复杂工作流 | 模型自己写一段代码来批量调用工具,中间数据不用来回过模型,省Token利器 |
| 极简模式 | 模型基准测试 | 只留一个Shell和一个文件编辑器,最小环境跑分用 |
| 创造模式 | 极客探索 | 可以检查运行时、在内存里试验Cordis插件、当场组合新模式 |
说个细节:此前DeepSeek V4-Flash在TerminalBench基准测试中成绩突飞猛进,用的正是极简模式。别人拿它跑分,它顺便把纪录破了。
四、谁在造这辆车?——崔添翼和他的"三个月奇迹"
带队的人叫 崔添翼,这名字在技术圈本身就是一块招牌。
简单列一下他的履历:
-
浙江大学毕业
-
ACM亚洲区金牌六次(算法竞赛选手应该知道这有多难)
-
《背包问题九讲》作者——无数算法竞赛选手的启蒙教材
-
在Jane Street(全球顶级量化交易公司)工作了近9年
-
量化基金TSY Capital联合创始人
-
Koishi聊天机器人框架的作者(Cordis就是从这里孵化出来的)
-
2026年3月加入DeepSeek
5月组建团队,8月交出作品。三个月,从零到GitHub十万星。
这个速度,就算是硅谷的顶级团队也得服气。前华尔街量化交易员带队,清华AI-Infra方向新锐紧随其后,三个月内上万次代码提交——这个工程密度,不是一般的高。
五、三天5700个插件:生态爆发不靠运营,靠架构
如果说Harness本身是一辆车,那真正的看点是:这辆车开上路三天,后面就跟了一个车队。
来看数据:
-
发布24小时:dsh-plugin标签下突破700个插件仓库
-
发布3天:插件仓库数量达到5700+
-
第三方聚合目录Oh-My-DSH:监测到990个生态仓库,累计星标11.2万
这些插件都在干什么?我挑几个有代表性的:
实用派:
-
open-design(8.7万星):开源版Claude Design替代品,把编码Agent变成设计引擎,原型/落地页/仪表盘/幻灯片都能生成 -
OpenViking(2.8万星):字节出品的Agent上下文数据库,补上了Harness的记忆层短板 -
archify(1.3万星):一句话画架构图、时序图、数据流图,产出可导出的HTML
脑洞派:
-
colleague-skill:把一个人的聊天记录和文档喂进去,生成模仿他思维方式的"数字分身" -
dsh-minigames:18款小游戏合集,包括俄罗斯方块、贪吃蛇——你可以在Agent工作台里摸鱼 -
dsh-ads:模拟2005年中文互联网风格的广告UI——是的,有人专门做了个怀旧皮肤 -
鲸鱼桌面宠物:DeepSeek的logo是鲸鱼,所以做鲸鱼桌面宠物的项目有69个,这是最容易撞车的赛道
最有意思的是,连界面本身都是插件。有人把工作台打扮成了"女仆咖啡馆"风格——侧栏写着DeepSeek的品牌slogan,输入框两边站着两位女仆,右上角显示DeepSeek-V4-Pro模型。一台能读写文件、跑终端命令的Agent工作台,顶着一身女仆装认真执行你的需求。
这画面说不上违和,甚至有点燃。
功能强不强是一回事;社区愿不愿意给它换皮、整活、表达热爱,是另一回事。这才叫生态。
为什么三天就能长出这么多插件?答案就四个字:接入成本极低。
"万物皆插件"把接入门槛压到了一行清单声明。写个dsh.bundle配置文件,你的项目就能挂进生态。存量项目纷纷来占位——四万星的老牌简历构建器reactive-resume主动适配了DSH,字节、腾讯系的项目也来挂靠。
谁都没理由不来。
六、6毛钱 vs 70块钱:成本打到了地板
说完架构和生态,说点最实际的——钱。
有媒体做了一组实测对比:在完成相同任务、效果相近的情况下——
| 方案 | 成本 |
|---|---|
| Claude(Anthropic) | 约9.8美元 ≈ 70元人民币 |
| DSH + DeepSeek V4 Pro | 约6毛钱 |
成本差了120倍。
为什么能这么便宜?除了模型本身定价低,还有一个被很多人忽略的架构级省钱设计:
插件按需加载 → 系统提示词和工具定义保持稳定 → 前缀缓存更容易命中 → 每轮请求更便宜。
而一个什么都往系统提示词里塞、前缀天天变的框架,会反复打爆缓存,烧钱如流水。
省钱和开放,被DeepSeek同时焊进了架构里。这不是技术洁癖,这是白花花的钱。
在一些特定任务中,DSH可以实现高达99%的缓存命中率。这个数字意味着什么?意味着绝大多数时候,模型不需要重新"读"一遍上下文,直接从缓存里拿——又快又便宜。
七、跟Claude Code比,到底谁更强?
这是大家最关心的问题。直接上对比:
| 维度 | DeepSeek Harness | Claude Code |
|---|---|---|
| 开源协议 | MIT(源码全开) | 专有(客户端开源,模型闭源) |
| 架构 | 插件化内核,无特权核心 | 垂直整合单体 |
| 模型绑定 | 模型即插件,可接任意厂商 | 绑定Anthropic模型 |
| 运行时自扩展 | 支持(Agent可自己写插件) | 不支持 |
| 热插拔组件 | 支持 | 不支持 |
| 会话日志 | append-only明文,可审计回放 | 托管式记录 |
| 成本 | 极低(6毛钱级) | 较高(70元级) |
| 成熟度 | 开发者预览版,有破坏性变更 | 生产级 |
| 交互形态 | 本地Web UI + headless | 终端原生 |
一句话总结:DSH赢在架构和成本,Claude Code赢在成熟度。
DSH最有说服力的优势是审计性——所有模型可见的内容都会被记录到append-only日志里,你可以精确回放模型在任何一步看到了什么、调用了什么工具、在哪一步出错。对于有合规要求的团队,这是整个发布中最硬的论据。
而DSH最讽刺的地方在于:**它本身可以运行Claude模型。**你可以在DSH里跑Claude,也可以跑GPT,也可以跑任何OpenAI兼容的模型——模型只是插件之一。
但说实话,v0.1阶段,"替代Claude Code"还言之过早。官方README用加粗大写字母提醒:项目处于developer preview阶段,一定会有破坏性兼容变更。翻译成人话:现在拿去跑核心生产链路,大概率要返工;想研究架构、抢插件生态位,现在正是窗口期。
八、为什么说这是中国AI的一个重要时刻?
过去几年,中国AI公司在大模型层面一直在追赶——参数、能力、评测分数,你追我赶。但在模型之上的工程层,在Agent运行框架这个层面,我们一直是缺席的。
OpenAI有Codex,Anthropic有Claude Code,它们不仅卖模型,还卖"模型怎么干活"的整套方案。控制了工程层,就控制了开发者的工作流。
DeepSeek Harness的意义在于:这是中国公司第一次在"模型+工程外壳"层面,与Anthropic正面抗衡。
而且不只是对标——它选择了一条完全不同的路:
-
别人做成品车,它开源造车图纸
-
别人锁死生态,它把每个零件都开放
-
别人靠订阅赚钱,它把成本打到地板
更关键的是生态已经跑起来了:
-
QQ Bot已集成DeepSeek Harness,支持单聊和群聊
-
国家超算互联网上线了DSH全套源码,科研院所和企业可以一键拉取部署
-
插件作者遍布全球,三天5700个仓库——这不是中国开发者的自嗨,是全球开发者的用脚投票
九、工程师视角:我的真实判断
作为一个写了十年代码的软件工程师,我对DSH的判断是:
架构层面:这是一次真正的范式创新。 "一切皆插件"不是营销口号,是从底层元框架到上层UI贯彻到底的设计哲学。Cordis的时空可组合性,让Agent运行时的热插拔成为可能——这在当前所有Agent框架中是独一无二的。
生态层面:爆发速度前所未有。 三天5700个插件,这不是运营驱动的,是架构驱动的——接入成本被压到一行声明,社区自然会补齐所有缺口。
成熟度层面:还是毛坯房。 v0.1就是v0.1,bug不少,文档还在完善,API随时可能变。现在拿来跑生产环境,要做好返工准备。但如果你想研究Agent架构、想抢占插件生态位,现在就是最好的窗口期。
战略层面:意义远超产品本身。 DeepSeek从"模型提供商"跨向了"开发者入口争夺者"。当模型能力趋于同质化,谁能圈住开发者和工作流,谁就圈住未来。
写在最后
回到标题——为什么说这是"村内又一开源倔起地标"?
"倔"不是"崛"的错别字。是倔强的倔,是不服输的倔。
在一个所有人都觉得"Agent框架是美国公司的专利"的时代,DeepSeek用三个月时间,交出了一份让全世界排队来盖房子的开源答卷。
它没有先做生态。它先做了一台让生态自己长出来的机器。
模型会过时,框架会迭代,但"把造车权交出去"这个决定,会在很长一段时间里被记住。
崔添翼在社交媒体上说:这是一个预览版本,可能存在很多粗糙之处,希望大家多提意见。
谦虚了。但社区已经用13万颗星投了票。
最后给朋友们三个建议:
-
如果你是开发者:花十分钟跑起来看看,
npx @deepseek-ai/dsh web,一行命令,打开浏览器就能体验 -
如果你是技术管理者:关注但别急着上生产,v0.1的破坏性变更是迟早的事,但可以作为技术预研方向
-
如果你是插件作者:现在就是抢位的黄金窗口,设计类和记忆类插件是当前最热的赛道
模型决定AI的下限,插件生态决定它的上限。
DeepSeek Harness,至少拿到了入场券。
对了,基于学习和实践,我整理了《AI Agent 学习手册》包含LLM基础知识、Claude Code 、OpenClaw、Vibe Coding、AI应用开发等内容,目前已经有近50w字干货,持续更新。
关于DeepSeek Harness,你还有什么要补充的?上手了么?评论区聊聊~
更多推荐


所有评论(0)