摘要:2026 年 8 月 13 日,DeepSeek 在同一天放出两记重拳:DeepSeek-V4-Pro 正式版,以及一个以 MIT 协议完全开源的智能体框架 DeepSeek Harness(dsh)v0.1 开发者预览版。后者在 GitHub 上几乎一夜之间冲上 5 万星、登顶 Hacker News,被开发者称为"Agent 领域的 Linux 时刻"。这篇文章从架构、理论、生态与竞争格局四个维度,拆解这个宣称要"正面挑战 Claude Code 与 Codex"的框架。

一事件:一天两记重拳

2026 年 8 月 13 日晚间,DeepSeek 在公布 API 峰谷调价通知后,接连放出两个消息:

  1. DeepSeek-V4-Pro-0813 正式版开源:MoE 混合专家架构,总参数 1.6 万亿,推理时仅激活 490 亿参数;100 万 token 上下文窗口,最大输出 38.4 万 token;支持思考/非思考模式与 low/high/max 三档思考强度;权重基于 MIT 协议开放,可在通用算力卡上直接运行。
  2. DeepSeek Harness v0.1 开发者预览版:一套基于 Cordis 元框架构建的 Agent Harness,MIT 协议全量开源,代码即刻可下载、可二次开发。

如果说 V4-Pro 回答的是"模型有多强",Harness 回答的则是"模型强了之后,怎么用起来"。前者是大脑,后者是身体和工作台。

GitHub 仓库 deepseek-ai/deepseek-harness 

https://github.com/deepseek-ai/deepseek-harness

发布后热度惊人:Hacker News 讨论帖直冲 TOP 1,几个小时内 Star 破 3 万,发布次日早晨已超 5.5 万星、4 千余 fork。作为对比,OpenAI 的 Codex CLI 用了 16 个月才达到约 10.6 万星。DeepSeek 官方给出的定义是一句话公式:

Model + Harness = Agent —— 大模型负责思考推理,Harness 承担模型之外的全部工程化工作:工具调用、任务规划、执行调度、上下文组织、沙箱边界。产品定位聚焦代码智能体(Code Agent)赛道,直接对标 Anthropic 的 Claude Code 与 OpenAI 的 Codex

二Harness 是什么:模型之外的另一半

传统聊天模型收到问题返回文本即告结束;而 Coding Agent 需要的是"理解任务 → 定位文件 → 修改代码 → 运行命令 → 检查结果 → 继续迭代"的持续循环。决定循环效果的不只是模型智力,还包括:

  • 模型拿到了哪些工具(文件系统、Shell、搜索、LSP……)
  • 系统提示词如何组织、上下文如何压缩与裁剪
  • 出错后是否重试、任务如何拆分
  • 权限审批与沙箱边界如何设计

Harness 解决的就是从"模型输出"到"真正执行"之间的最后一公里。这一点在战略上远比表面看起来重要:DeepSeek 不再满足于只做一个"可以被调用的模型",而是正式切入模型上层的开发者生态入口。Claude Code 是 Anthropic 的入口,Codex 是 OpenAI 的入口,Harness 是 DeepSeek 给出的答案。

三一切皆插件:没有内核的 Agent 框架

Harness 最核心的设计原则只有六个字:一切皆插件(Everything is a Plugin)。这不是营销口号,而是架构事实。绝大多数 Agent 框架的架构是"核心引擎不可变,你只能在预留的插件接口处扩展";而 Harness 的架构完全不同:

共享上下文(Context)
 ├── 模型适配器(插件,可替换)
 ├── 工具注册表(插件,可替换)
 ├── 会话日志(插件,可替换)
 ├── Agent Loop(插件,可替换)  ← 连循环本身都能换
 ├── 系统提示词(插件,可替换)
 ├── 沙箱策略(插件,可替换)
 ├── 审批策略(插件,可替换)
 └── ... 你自己的插件

没有"特权核心"。想换什么,就把对应插件替换掉,不需要 fork 源码,不需要改一行框架代码。连 Agent Loop 本身都可以替换成你自己的实现,其他什么都不用改。

3.1 底座:Cordis 元框架

Harness 的底层是一个叫 Cordis 的元框架——它只负责插件的加载、卸载与依赖关系解析。所有具体组件都通过 Cordis 服务(Service)与事件(Event)协作,在配置层自由组合。三大设计:

  • 插件向共享 Context 注册服务:模型适配器注册 ctx.llm,工具系统注册 ctx.tools,会话管理注册 ctx.sessions,其他插件通过 Context 获取服务,无需直接 import。
  • 类型化事件通信agent/pre-steptools/pre-executesession/event……事件就是扩展点,拦截行为只需要监听事件,不需要改源码。
  • 可逆副作用:插件注册的服务、监听的事件、创建的资源全部可逆。插件卸载时一切自动回滚——这意味着运行时热插拔,Agent 运行中可动态加载和卸载插件,无需重启。

3.2 能力接缝:换一个 Provider,整个产品跟着变

一个"接缝"由 Service Definition(声明接口)、Service Provider(实现接口)、Consumer(使用接口,通常是模型面对的工具)三角色组成。一个 Provider 的替换可以改变整个产品的行为——比如把文件系统与子进程的 Provider 指向远程沙箱,Bash、PTY、LSP 全部自动迁移到远程执行,不需要改任何工具代码。

3.3 会话日志:模型可见 = 已记录

这是社区评价最高、也是 Claude Code 不具备的能力。模型看到的一切——系统提示词、思维链、工具调用与结果、子 Agent 调度、每一次上下文注入——都会写入一份仅追加(append-only)的会话日志Trajectory 视图按来源展示这些事件,恢复、分叉、检索、回放全部共享同一份事件流。

更关键的是它是一条运行时不变量:程序强制保证"模型可见 = 必入日志",任何要发给模型的内容都必须能从日志重建。这意味着任何时候你都能精确重构"Agent 当时看到了什么、为什么这么决策"——审计不再是猜测,而是回放。在"推理轨迹加密化"成为反向趋势的 2026 年,这种默认明文、默认本地、默认可审计的设计姿态显得尤为难得。

3.4 四种运行模式

模式 能力 适用场景
标准模式 完整工具组合:文件编辑、Shell、搜索、技能、规划、子代理、工作流 日常编码开发
PTC/Code 模式 程序化工具调用:模型生成一段 TypeScript 代码一次编排多轮工具调用,中间数据留在运行环境,只有最终结果进入上下文 批量操作、复杂任务编排,大幅降低 Token 消耗
极简模式 仅保留 shell + 文件编辑两个工具 最小环境下的模型基准测试
创造模式 标准模式 + 运行时检查、在内存中试验 Cordis 插件、组合全新模式 插件开发、探索"自进化"

极简模式是整盘棋里最耐人寻味的一步:一个只有两个工具的 Agent 不是产品决策,而是评测装置——最小脚手架下模型还能不能干活,测的是模型而非框架。官方所有 V4 模型的 Agent 基准成绩(Terminal Bench 2.1 达 87.9、DeepSWE 从 12.8 跃升至 62.7)正是在 Harness 极简模式下跑出来的。模型与框架一体两面,互相验证。

3.5 沙箱与安全

沙箱方面 Harness 同样认真:Linux 用 Landlock/bwrap、macOS 用 Seatbelt、Windows 用 ACL restricted-token 进程运行器——操作系统级隔离机制,与浏览器隔离不可信代码同级。在"模型会执行任意生成命令"的场景里,这是底线工程,但行业内大量 Agent 工具恰恰没有做到。

四理论底座:时空可组合性

Harness 不是凭空搭出来的。随项目同步发布的还有一篇 88 页论文——《A Programming Paradigm for Spatiotemporal Composability》(面向时空可组合性的编程范式),作者为北京大学 Yifan Shi、Wei Zhang 与 DeepSeek 的 Tianyi Cui(崔添翼)。

论文要解决的是每个写过插件系统的开发者都遇到过的痛:插件插上去,就拔不下来。论文实测 VSCode Marketplace 排名前 100 的扩展,87 个包含可执行代码,一旦激活就无法在运行时单独卸载,禁用或删除必须重启整个扩展宿主。过去这还只是"重启一下"的麻烦;但在 Agent 语境下,工具集、执行环境、权限、沙箱、会话状态高度纠缠,重启意味着上下文丢失、任务中断,代价完全不同。

论文把问题拆成两个正交维度:

  • 时间可组合性:组件被移除时,它对系统状态做过的所有修改必须完全回滚。解法叫"可逆副作用"——每个操作执行时自动记录逆操作,运行时负责追踪与恢复。开发者只需声明"我要做什么",框架保证"卸载时如何撤销",类似 C++ 的 RAII 与 React 的 useEffect cleanup,但被提升为通用运行时机制。
  • 空间可组合性:组件之间的依赖必须被结构化声明并动态解析。解法叫"响应式共效应"——当依赖的服务出现、消失或被替换时,框架主动通知组件。配套铁律是生命周期包含:服务提供者必须比消费者活得久,提供者卸载时消费者先被自动卸载,杜绝悬空引用。

两者统一为一套类型系统,论文给出形式化证明:插件可以在运行时任意加载和卸载,系统始终保持一致性。而且这不是实验室玩具——Cordis 从 Koishi 聊天机器人框架中孵化,已在生产环境运行四年,超过 4000 个社区插件验证过这套机制。

项目负责人崔添翼本身也是话题人物:浙大毕业、ACM 亚洲区金牌六次、《背包问题九讲》作者(无数算法竞赛选手的启蒙教材)、曾在 Jane Street 工作近 9 年、量化基金 TSY Capital 联合创始人,2026 年 3 月加入 DeepSeek。前华尔街量化交易员带队、清华 AI-Infra 方向新锐紧随其后、三个月内上万次提交——工程密度相当高。

五正面交锋:Harness vs Claude Code vs Codex

维度 DeepSeek Harness Claude Code Codex CLI
开源协议 MIT(源码全开) 专有(无开源许可) Apache 2.0
实现语言 TypeScript / Node Rust Rust
架构 插件化内核(Cordis),无特权核心 垂直整合单体 垂直整合 + 可配置
模型绑定 模型即插件,可接任意厂商 Anthropic 模型 OpenAI 模型为主
交互形态 本地 Web UI (:3080) + headless + Python SDK 终端原生 + 多端 CLI + IDE + 桌面
会话日志 append-only、明文、本地、可审计回放 托管式记录 有限
运行时自扩展 支持(cordis_define 等,审批门控) 不支持 不支持
热插拔组件
成熟度 开发者预览版,将有破坏性变更 生产级 生产级

5.1 Harness 的三个真实优势

第一,审计性作为架构属性而非功能。append-only 日志 + "模型可见=已记录"不变量,使任何一次决策都可以精确回放。对有合规与审计要求的企业,这是整个发布中最有说服力的论据。

第二,免 fork 的能力替换。想让 Claude Code 或 Codex CLI 在远程执行子进程,只能套壳或 fork;而在 Harness 里实现一个 Service Provider、在配置里挂上即可,框架不动。

第三,长任务的单位成本。V4-Pro 专门针对 Harness 做过后训练调优,价格远低于美国前沿梯队。多小时的仓库级重构任务,token 大量消耗在文件遍历而非硬推理上,成本差距会指数级放大。

还有一个极具讽刺性的细节:Harness 本身可以运行 Claude 和 Codex。官方随包附带的 Provider 目录里,Anthropic、OpenAI、Bedrock、Vertex、Azure 一应俱全;它甚至能读 Claude Code 的 hooks.json 与 AGENTS.md/CLAUDE.md 文件,还可以把 Claude Code 或 Codex 当作子 Agent Provider 接入(默认关闭)。DeepSeek 赌的是"价值沉淀在基础设施层而非模型层"——所以它愿意让你的框架跑着竞对的模型。

5.2 成熟的差距同样真实

社区共识是:dsh 赢了架构这一栏,输了成熟度这一栏——而在 v0.1 阶段,成熟度恰恰是决定你装不装它的那一栏。官方明说"THERE WILL BE COMPATIBILITY-BREAKING CHANGES"(将会有破坏性变更),不适合承载每日生产工作流;交互形态目前只有 Web UI;托管式后台 Agent、GitHub PR 工作流等企业级能力尚未成型;在绝对输出质量上,本周流传的对比仍显示 Claude Code 领先,DeepSeek 的优势是"每美元的算力",不是"天花板"。

六生态与社区反响

发布即巅峰的热度背后,社区态度复杂而立体的:

  • 支持者认为这是 Agent 框架的"Linux 时刻":内核可模块化、按需组合,MIT 协议 + 全插件化 + 可跑任意模型,是行业里"较为激进"的设计方案,能显著降低对 Claude Code 这类海外工具的依赖。
  • 质疑者直接点出插件化系统的长期隐忧:"所有依赖社区插件来提供功能的产品,头六个月都运行得很好,之后就是不兼容、过时、缺乏一致性和治理的噩梦。"Cordis 的形式化保证解决了"卸载干净",解决不了"插件生态治理"。
  • 务实派指出:Star 数不等于生产采用。Claude Code 已占据 Vibe Coding 默认选择的心智位置,DSH 要形成飞轮,取决于 npm 插件生态能否沉淀、框架稳定性能否快速收敛、DeepSeek 模型的 Agent 能力能否持续逼近 Claude。

生态数据本身相当亮眼:内测期间社区已产出约 300 个插件,开源后迅速突破 1000 个;官方内置插件 100+,Plugin Store 已预留。项目暂不接受外部 PR(引导开发者通过 Discussions 与社区插件共建),官方包与社区包被同等对待——"这个仓库是一个想法、一个官方样板与灵感来源,而不是强制标准"。

七风险与争议

成熟度风险:v0.1 是明确的开发者预览版,接口仍在快速迭代,破坏性变更随时可能发生。

供应链与安全风险:一个工具插件能碰文件和外网,一个存储插件掌握完整会话,一个循环插件可能改变 Agent 的决策路径。插件来源验证、权限边界、依赖冲突、版本兼容、供应链安全,都是进入生产环境之前必须跨过的坎。开放程度越高,治理成本越高。

自进化的双刃剑:创造模式 + cordis_define/cordis_run 工具族意味着 Agent 可以在会话中途编写、激活、销毁自己的插件——"自进化软件"的雏形。但内测用户也指出:插件要么"用完即扔",要么需要"设计、验证和维护",当前模型能力尚无法自主完成后者的全流程。Cordis 解决了"扔得干净","设计得对"仍需模型能力再上台阶。

八战略意义:从模型层到执行层

  1. DeepSeek 正式切入执行层竞争。过去 DeepSeek 的竞争焦点在模型性能、开源权重、低价 API——全部在模型层。入口即生态,Harness 意味着 DeepSeek 开始争夺"模型之上的开发者入口"。
  2. 模型 + 框架形成自反馈闭环。极简模式跑基准、V4-Pro 针对 Harness 调优、Harness 为 V4-Pro 释放 Agent 能力——"模型迭代 → 产品验证 → 反馈优化"的闭环正式建立。同天发布不是巧合,而是同一套逻辑的两面。
  3. 私有化部署的结构性优势。MIT 开源的模型权重(可跑通用算力卡、适配国产 GPU)+ MIT 开源的 Agent 框架 = 政企私有化场景下唯一完整的国产 Agent 方案。Claude Code 与 Codex 在这个场景里根本无法参与。
  4. 中国 AI 公司首次在基础设施层面定义架构范式。Harness 不是在做应用,而是在定义 Agent 的运行架构——把插件化从口号做成带形式化证明的系统。这个"Agent 的安卓"叙事,是 DeepSeek 对"开源即护城河"路线的最新注脚。

九结论

DeepSeek Harness 很难被只看作一个现成的 Agent 产品——它更像一个早期的 Agent OS,一个架构宣言。

  • 拿 Coding Agent 产品的成熟度标准衡量,它目前确实不如 Claude Code / Codex,差距至少以年计;
  • 但拿"可自由组装、可接入任意模型、可私有化部署的 Agent 框架"衡量,它已经站在了一条不同的赛道上——赌的是"插件化 Agent 平台"范式会比"紧耦合编程助手"走得更远

V4-Pro 以约六十分之一的价格逼近 Claude Fable 5 的 Agent 性能,再搭配一个完全开源、无特权核心、连 Agent Loop 都能换掉的运行框架——DeepSeek 摆出的姿态很清楚:模型可以做可替换的零件,框架也可以是,唯独生态与开发者入口要握在自己手里。

下一步值得观察的三件事:npm 插件生态能否形成飞轮、框架稳定性能否快速收敛(v0.2/1.0 的节奏)、以及 DeepSeek 模型的 Agent 能力能否在 Harness 上持续逼近 Claude Code 的组合体验。自进化的完整闭环——Agent 自己写插件、自己装上、自己评估——还需要基础设施层之外的能力补齐,但至少,地基已经打下去了。

参考来源:DeepSeek 官方发布、GitHub(deepseek-ai/deepseek-harness)、《A Programming Paradigm for Spatiotemporal Composability》论文、科创板日报 / 第一财经 / IT之家 / 量子位等媒体报道、VentureBeat、Hacker News 社区讨论。文中数据以官方文档与发布时公开信息为准。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐