DeepSeek Harness 深度调研报告
一、概述与定位
DeepSeek Harness(简称 dsh)是 DeepSeek AI 于 2026 年 8 月 13 日以 MIT 协议开源的 Agent 运行基础设施,当前处于 开发者预览版(v0.1.0-rc.5)。它不是一个模型,而是模型之外的一整套 "控制系统"—— 用官方的定义来说:
Agent = Model + Harness
Harness 负责让模型理解环境、调用工具、管理上下文、处理失败、恢复任务、控制权限,并在长时间运行中保持不偏离目标。DeepSeek 把开源边界从 "模型权重" 推进到了 "模型如何工作" 的运行层。
仓库采用 pnpm monorepo 结构,包含 50+ 个包,累计超过 12,000 次提交,19 位贡献者。核心技术栈为 TypeScript/Node.js,附带 Python SDK 和基于 Linux Landlock 的原生沙箱模块。
二、核心架构深度解析
2.1 底层基石:Cordis 元框架
DeepSeek Harness 最不寻常的选择是其底层并非自研或使用主流框架(如 LangGraph、OpenAI Agents SDK),而是 Cordis—— 一个起源于 Koishi(QQ/ Discord 机器人框架) 的插件运行时,刚发布 v4 版本并附带论文《A Programming Paradigm for Spatiotemporal Composability》。
Cordis 的核心概念是 "时空可组合性"(Spatiotemporal Composability):
-
时间可组合性:插件卸载时,其注册过的所有服务、事件监听器和副作用能够被自动撤销(reversible effects),干净地回收资源,不留下残留状态。
-
空间可组合性:插件之间可以声明依赖关系,当依赖组件发生变化时,系统自动重新建立协作关系,无需手动重连。
这意味着插件 "能来也能干净地走",为 Agent 的动态重组和自我修改奠定了基础。Cordis 本身只做元框架(加载、卸载、依赖解析、配置协调、热更新),不掺和任何具体业务逻辑。
2.2 核心理念:一切皆插件
这是 DeepSeek Harness 的设计灵魂。没有特权核心—— 模型适配器、工具注册表、会话日志、甚至 Agent 循环本身,全部都是可替换的插件。开发者通过配置文件(cordis.yml)选择、替换或扩展任何能力,无需修改 Harness 主体代码。
具体来说,一个运行中的 dsh 是一棵插件树,由以下层次按顺序叠加组成:
Profile(命名组合) └─ Bundle 1(按声明顺序堆叠) └─ Bundle 2 └─ ... └─ profile 级 cordis.patch.yml(用户补丁) └─ home 级 cordis.patch.yml └─ --patch 命令行覆盖
-
Profile:存储在 Harness 主目录中的命名组合,列出它堆叠哪些 Bundle,持有用户安装的外部插件和自定义补丁。内置
web和headless两个模板。 -
Bundle:Cordis 配置行和对应代码的分发格式,每个 Bundle 声明自己在
package.json的dsh字段中。 -
Patch:通过行 ID 定位并替换整行配置,或插入新行。
dsh-base 是每个 Profile 的第一层,包含模型适配器、工具、持久化、沙箱与审批策略、设置、凭证、遥测;dsh-web-app 叠加浏览器应用;dsh-headless 叠加一次性运行器。
2.3 能力三角色模型(Capability Seam)
DeepSeek Harness 提出了一个结构化的能力扩展范式 —— 每个可替换能力("接缝"/seam)由三个角色组成:
| 角色 | 职责 |
|---|---|
| Service Definition | 声明接口(类型定义) |
| Service Provider | 实现接口 |
| Consumer | 使用该能力,通常是面向模型的工具 |
一个包可以合并多个角色,但单独一个角色不构成完整的接缝。这种设计的威力在于:替换一个 Provider 就能改变整个产品行为。例如,文件系统和子进程 Provider 共享同一个执行世界,把它们指向远程沙箱后,Bash、PTY 和 LSP 全部随之迁移,无需逐个修改。
2.4 会话日志:仅追加的事件流
会话日志是模型所见上下文的唯一事实来源。系统提示词、思维链、工具调用及结果、子 Agent 调度、上下文注入 —— 一切到达模型请求的内容都必须可从日志中重建,并有运行时不变量断言这一点("Model-visible means logged")。
这带来了几个直接能力:
-
回放(Replay):从事件流重新构建完整交互
-
分叉(Fork):在任意边界点创建子会话
-
恢复(Resume):崩溃后从日志继续
-
搜索与可观测性:Trajectory 视图按来源查看每条记录
-
遥测与训练数据:完整轨迹可用于离线分析
模型消息历史不再单独保存,而是由 deriveMessages() 从日志投影生成。原始 assistant/chunk 事件保留了回放和 UI 保真度。
2.5 四种运行模式
| 模式 | 插件组合 | 定位 |
|---|---|---|
| Standard | 完整工具集:文件编辑、Shell、文件 / 网页搜索、技能、规划、目标、子 Agent、工作流 | 日常 Agent 任务 |
| Code(PTC) | Standard 全部能力 + 程序化工具调用 SDK | 模型生成 TypeScript 代码来编排多轮工具调用,减少往返 |
| Minimal | 仅持久 Bash + str_replace_editor 两个工具 | 模型基准测试,最小化外围差异 |
| Creator | Standard + 运行时检查 + 插件实验 + 预设编写引导 | 插件开发者,创建自定义 Agent 预设 |
PTC(Programmatic Tool Calling) 是值得关注的设计:模型不再逐个调用工具,而是生成一段代码,由代码在一次执行中批量查询、分支处理和聚合结果。这可以显著减少模型 - 工具往返次数和上下文堆积,但对沙箱隔离、超时和权限控制提出了更高要求。
2.6 自我修改(Self-modification)
这是 DeepSeek Harness 最具实验性也最有野心的特性。通过 Creator 模式中的自指 Cordis 工具,Agent 可以:
-
检查当前运行时的插件树
-
在内存中动态挂载或卸载临时插件
-
将实验结果组合成新的运行模式
官方提供了 pnpm run demo:cordis 演示,允许 Agent 修改自己正在运行的插件环境。这相当于 "汽车在行驶中给自己换发动机"—— 距离稳定的 "自我进化" 仍有很长的工程路径,但架构上已经留出了接口。
2.7 Agent 循环与事件系统
一次 Step = 一次模型请求 + 它调用的工具;一次 Turn = 零或多个 Step。完整的 Turn 流程:
turn/start ├─ claim next-step input + 排队消息 ├─ 组装 prompt sections + tool schemas ├─ agent/pre-step(瀑布事件,可拒绝或改写) ├─ step/start ├─ agent/request → llm/stream → assistant/chunk* → assistant/message ├─ tool/call* → tools/pre-execute → tools/execute → tools/post-execute → tool/result* ├─ step/end └─ 若有工具欠账或新输入 → claim → next step turn/end
事件分为三个域:
-
Session 事件:持久化事实,追加到日志
-
Agent 事件(
agent/*):携带活跃 Agent 的实时扩展点 -
Capability 事件(
fs/*,tools/*,telemetry/*):在不引入循环依赖的情况下附加策略和适配器
其中 agent/pre-step、agent/request、llm/stream 和三个 tools/* 事件是瀑布型(waterfall),监听器必须调用 next() 才能传递,否则短路整个链条 —— 这是一种强大的中间件机制。
三、技术栈与工程实践
3.1 包结构概览
仓库按功能分组组织了 50+ 个 @deepseek-ai/dsh-* 包:
| 分组 | 关键包 | 职责 |
|---|---|---|
| core | session, system-prompt, tools, agent, agent-loop, scope | 产品 API 脊柱 |
| llm | llm | 消息 / 流词汇表 + 适配器接缝 + DeepSeek Provider |
| 执行 | shell, subprocess, terminal, fs, lsp, e2b | Shell / 文件 / 语言服务器能力 |
| web | web | 网页搜索 / 抓取 Provider + 工具 Consumer |
| 编排 | subagent, workflow, todo, plan | 子 Agent 委派、工作流、待办、计划模式 |
| 上下文 | compaction, context | 上下文压缩、请求上下文 |
| 安全 | guard, sandbox(landlock), interaction, credentials | 循环卫生、沙箱、审批交互、凭证 |
| 高级 | self-modification, skill, preset, bundle | 自我修改、技能注册、预设、可安装 Bundle |
| 集成 | hooks, acp, sdk | Claude Code/Codex Hook 桥、ACP 服务器、JSON-RPC SDK |
| 持久化 | session, identity, settings | 持久会话、匿名身份、用户设置 |
| 原生 | node-addon-landlock-run | Linux Landlock 沙箱原生模块 |
| Python | python/ | Python SDK + 捆绑运行时 |
3.2 工程质量
从 AGENTS.md 可以看出极其严格的工程规范:
-
100% 单文件测试覆盖率(CI 门禁,
packages/*/*/src下每个文件) -
TypeScript strict 模式 +
noImplicitAny,每个any必须解释原因 -
每个模块和导出都有 JSDoc,由
verify-export-jsdoc强制检查 -
跨文件 TypeScript 克隆检测(jscpd)
-
keyless snapshot 测试:每个非平凡的模型可见或用户可见行为变更必须附带可重放的快照测试
-
e2e 测试:真实 API 测试,无
DEEPSEEK_API_KEY时自动跳过 -
Agent Note 制度:每个非平凡变更必须在同一 PR 中附带架构决策记录
-
双语文档:中英文文档同步维护,VitePress 网站
3.3 安全模型
-
Linux Landlock 原生沙箱(
@deepseek-ai/node-addon-landlock-run),比 Docker 更轻量 -
权限 / 审批交互(
dsh-interaction):高风险操作需用户批准 -
凭证引用(
dsh-credentials):支持环境变量和.env,不硬编码 -
循环守卫(
dsh-guard):工具超时、循环卫生检查 -
配置错误 "大声失败":缺失引用在加载时即报错,不静默跳过
四、与主流 Harness 的对比分析
4.1 总览对比表
| 维度 | DeepSeek Harness | Claude Code | OpenAI Codex | OpenHands | Cursor | Cline | Aider | LangGraph |
|---|---|---|---|---|---|---|---|---|
| 架构哲学 | 一切皆插件,元框架驱动 | 单体 CLI + Hooks | 单体 CLI + 云沙箱 | 事件溯源,Docker 沙箱 | IDE 内嵌 Agent | VS Code 扩展 | 纯 CLI,Git 原生 | 图式状态机 |
| 开源协议 | MIT | 专有(运行时开源) | Apache 2.0(CLI) | MIT | 专有 | Apache 2.0 | Apache 2.0 | MIT |
| 语言 | TypeScript/Node.js + Python | Rust | TypeScript (Node.js SEA) | Python | TypeScript/Electron | TypeScript | Python | Python |
| 模型灵活性 | 可插拔 LLM 适配器(当前 DeepSeek 为主) | 仅 Anthropic | 仅 OpenAI | LiteLLM 100+ 提供商 | 多提供商 | 多提供商(BYOK) | 任意模型含本地 | 任意模型 |
| 插件 / 扩展 | Cordis 插件(一切可替换) | MCP + Skills + Hooks (~30 事件) | MCP + 内置工具 | MCP + 微代理(Skill 兼容) | MCP + Rules | MCP + Memory Bank | Git 钩子 | 自定义节点 |
| 可观测性 | 仅追加事件日志,可回放 / 分叉 | OpenTelemetry,工具内容默认不记录 | 内置追踪 | 事件日志(EventLog) | 基础追踪 | 会话历史 | Git 提交历史 | LangSmith |
| 沙箱 | Linux Landlock(原生) | macOS Seatbelt / Linux bubblewrap | Seatbelt / bubblewrap / PowerShell | Docker 容器 | 云 VM / 本地 | 本地(VS Code) | 本地 | 无内置 |
| 自我修改 | 有(Creator 模式,动态插件挂载) | 无 | 无 | 无 | 无 | 无 | 无 | 无 |
| 多 Agent | 子 Agent + 工作流插件 | 并行子 Agent(Task 工具) | 子 Agent(handoff) | 微代理 | 单 Agent 为主 | 单 Agent | Architect/Editor 双模型 | 图式多节点 |
| 上下文管理 | 压缩插件 + 事件日志投影 | 自动压缩 + Skills 渐进披露 | 自动管理 | 内存压缩服务 | 基础 | 上下文窗口管理 | Git diff 管理 | 检查点持久化 |
| 运行模式 | 4 种(Standard/Code/Minimal/Creator) | 5 种权限模式 | 3×3 模式矩阵 | 交互 / Headless | Agent/Chat | Plan/Act | 结对编程 | 同步 / 流式 |
| 成熟度 | 开发者预览(v0.1-rc) | 生产级 | 生产级 | 生产级 | 生产级 | 生产级 | 生产级 | 生产级 |
| 主要界面 | Web UI (3080) + CLI + ACP | 终端 + IDE 扩展 | 终端 + 编辑器 + 云 | Agent Canvas(可视化) | IDE | VS Code | 终端 | 编程 API |
4.2 逐维度深度对比
架构可组合性
这是 DeepSeek Harness 与所有竞品最本质的区别。
-
Claude Code 虽然有强大的 Hooks 系统(~30 个生命周期事件),但其核心循环、工具注册表、会话管理是固定的单体结构,Hooks 只能在固定节点插入逻辑,不能替换核心组件本身。
-
OpenHands 的事件溯源架构(Agent → Action → Workspace → Observation → EventLog)在理论上很优雅,内存压缩、安全审查、子 Agent 委派都是订阅事件流的服务,但它的组件替换仍需修改代码或配置特定服务,没有统一的插件卸载 / 依赖解析机制。
-
LangGraph 用图(节点 + 条件边)建模工作流,适合确定性的分支流程,但图结构本身是静态定义的,运行时动态重组能力有限。
-
DeepSeek Harness 通过 Cordis 实现了真正的运行时可组合性:不仅能添加功能,还能替换任何核心组件(包括 Agent 循环本身),且卸载时副作用自动清理。这是从 "可扩展框架" 到 "可重组运行时" 的范式跃迁。
可观测性与回放
-
Claude Code 输出 OpenTelemetry,但工具输入 / 输出内容默认不记录在 span 中(需
OTEL_LOG_TO_TOOL_CONTENT=1显式开启,且有 60KB/span 截断)。 -
OpenHands 的 EventLog 是 append-only 的,设计理念与 dsh 接近,但其主要服务于内部状态管理,面向用户的回放 / 分叉体验不如 dsh 的 Trajectory 视图完整。
-
DeepSeek Harness 将 "模型可见即可记录" 作为运行时不变量强制断言,这意味着不存在 "模型看到了但日志里没有" 的盲区。完整的 reasoning chunk(取决于模型接口返回)也被保留,支持按来源过滤查看。
沙箱与安全
-
Claude Code:macOS Seatbelt / Linux bubblewrap,FS 写入限制在 cwd 子目录,网络通过主机名白名单代理。已知与 watchman、docker、WSL2 有兼容性问题。开源了
@anthropic-ai/sandbox-runtime。 -
Codex CLI:三模式(read-only /workspace-write/danger-full-access)× 三审批策略(untrusted /on-request/never)。已知在 MCP server 模式下沙箱与跨进程 IPC 交互有 bug。
-
OpenHands:Docker 容器完全隔离,最安全但最重。
-
DeepSeek Harness:基于 Linux Landlock 的原生 Node.js 插件,比 Docker 轻量、比纯 OS 沙箱更精细。同时有 E2B 沙箱的 POC 实现,支持远程沙箱 Provider 替换。但目前 Landlock 仅支持 Linux,macOS/Windows 支持尚不明确。
插件生态与扩展性
-
MCP 已成为行业标准工具连接协议(Claude Code、Cline、CrewAI、OpenCode 均原生支持)。DeepSeek Harness 当前没有明确的 MCP 原生支持,其工具扩展通过 Cordis 插件实现,MCP 服务器理论上可以作为工具来源的插件接入,但非一等公民。
-
Anthropic Skills 作为开放标准(渐进式披露:启动时仅加载元数据,触发时加载正文)被 OpenHands 等兼容。DeepSeek Harness 有自己的
dsh-skill技能注册系统,与 Anthropic Skills 格式是否兼容尚不明确。 -
Hook 生态:Claude Code 的~30 个 Hook 事件 + 5 种 Hook 类型(command/http/mcp_tool/prompt/agent)是目前最丰富的策略注入面。DeepSeek Harness 的事件系统在理论上更通用(任何事件都可被监听),但面向用户的 Hook 配置成熟度不如 Claude Code。
自我修改与自进化
这是 DeepSeek Harness 的独家特性。没有任何其他主流 Harness 允许 Agent 在运行时检查和修改自己的插件树。这一特性的战略意义在于:
-
当 Agent 发现自身能力不足时,可以自主开发、安装和调用新插件
-
为 "递归自我改进"(recursive self-improvement)留出了架构接口
-
但同时也带来了巨大的安全风险 —— 一个能修改自己运行时的 Agent,如果被误导或劫持,可能关闭安全守卫、提升权限
目前这一特性被限制在 Creator 模式中,不进入 Standard/PTC/Minimal 模式,是合理的安全隔离。
模型锁定
-
Claude Code 深度绑定 Anthropic 模型,无法使用其他模型。
-
Codex 绑定 OpenAI 模型。
-
DeepSeek Harness 虽然架构上支持可插拔 LLM 适配器,但当前默认且主要支持 DeepSeek 模型,其他模型适配器的成熟度未知。这是其当前最大的实际限制之一 —— 架构开放但生态尚未跟上。
-
OpenHands / Cline / Aider / OpenCode 在模型灵活性上领先,支持任意 LiteLLM 兼容模型或本地模型。
五、优势分析
5.1 架构前瞻性最强
"一切皆插件" 不是营销口号,而是通过 Cordis 的可逆副作用和依赖解析真正落地的。Agent 循环、会话日志、工具注册表这些在其他框架中 "不可触碰" 的核心,在 dsh 中都是可替换的配置行。这种架构为未来 3-5 年的 Agent 演化留出了最大空间。
5.2 可观测性设计最严格
"模型可见即可记录" 作为运行时不变量强制断言,这在行业中是独有的。大多数框架的追踪是 "尽力而为" 的,而 dsh 把它提升为架构约束。这对调试、审计、离线训练和合规都有深远价值。
5.3 自我修改能力开辟新范式
Creator 模式的动态插件挂载是目前唯一的 "Agent 可以改造自己" 的生产级(虽仍在预览)实现。如果安全问题能得到妥善解决,这可能是通向真正自适应 Agent 的关键路径。
5.4 工程质量极高
100% 单文件覆盖率、严格的 TypeScript 类型系统、JSDoc 强制、快照测试制度、双语文档、Agent Note 架构决策记录 —— 这套工程规范在开源 Agent 项目中属于顶级水平,甚至超过许多商业项目。
5.5 MIT 协议 + 完全开源
不同于 Claude Code(专有)、Cursor(专有)、Devin(专有),dsh 以 MIT 协议完全开源,包括核心运行时、Web UI、Python SDK、原生沙箱。这消除了供应商锁定的法律风险。
5.6 轻量级沙箱
基于 Landlock 的原生沙箱比 Docker 容器启动更快、开销更小,适合本地开发和高频 Agent 迭代。同时支持通过 Provider 替换切换到 E2B 等远程沙箱。
5.7 四种模式覆盖完整实验光谱
从 Minimal(基准测试)到 Standard(日常使用)到 Code(程序化调用)到 Creator(自我改造),四种模式对应了四种 Agent 研究和开发方法,这在其他框架中是分散的、需要自行组合的。
六、不足与风险
6.1 成熟度极低,破坏性变更不可避免
当前版本为 v0.1.0-rc.5,GitHub Releases 页面为空,官方明确警告 "将会有破坏兼容性的变更"。SESSION_FORMAT_VERSION 仍为 0 且无兼容性承诺,SQLite schema 使用单调递增版本号且后端拒绝旧格式。这意味着:
-
现在基于 dsh 开发的插件和配置,在正式版发布时很可能需要重写
-
不适合任何生产环境部署
-
社区插件生态需要等 API 稳定后才能真正繁荣
6.2 模型生态单一
虽然架构支持可插拔 LLM 适配器,但当前实际只有 DeepSeek Provider 是一等公民。对于已经在使用 Claude、GPT、Gemini 的开发者来说,迁移成本和模型质量风险是实际障碍。相比之下,OpenHands(LiteLLM 100+ 提供商)、Cline、Aider 在模型灵活性上遥遥领先。
6.3 Cordis 学习曲线陡峭
Cordis 是一个相对小众的框架(来自 Koishi 机器人社区),其 "时空可组合性"、可逆副作用、瀑布事件、配置协调等概念对大多数 AI 开发者来说是陌生的。官方文档也承认 "建议使用 Agent 来探索代码库",侧面反映了理解门槛。这会拖慢社区贡献和插件生态的形成速度。
6.4 MCP/Skills 等行业标准支持不明
MCP 已成为 Agent 工具连接的事实标准,Anthropic Skills 也在被广泛兼容。DeepSeek Harness 有自己的工具和技能系统,但是否原生支持 MCP、是否兼容 Anthropic Skills 格式,在公开文档中不明确。如果不能接入已有的 MCP 服务器和 Skills 生态,dsh 将面临 "重新发明轮子" 和 "生态孤岛" 的风险。
6.5 自我修改的安全风险
一个能检查和修改自己插件运行时的 Agent,本质上拥有了 "关闭自己安全开关" 的能力。虽然目前限制在 Creator 模式,但:
-
插件来源验证、权限边界、依赖冲突、版本兼容和供应链安全都尚未经过实战检验
-
恶意插件或被误导的 Agent 可能卸载
dsh-guard、修改审批策略、提升沙箱权限 -
开放程度越高,治理成本越高,这是插件化架构的固有代价
6.6 跨平台支持不完整
原生沙箱基于 Linux Landlock,macOS(需 Seatbelt)和 Windows(需 PowerShell 约束)的支持状态不明。开发文档要求 Node.js 22.19+ 或 24+,对环境有一定要求。相比之下,Claude Code 和 Codex 在三大平台上都有成熟的沙箱实现。
6.7 无基准测试成绩
官方 BENCHMARK.md 仅说明如何运行 jsonrpc-agent 极简变体,未公布与其他 Harness 的对比成绩。AIMultiple 在 2026 年 8 月对 17 个 Agent Harness 进行的 A-Code Bench 中,dsh 尚未被纳入。实际任务成功率、Token 效率、运行时间等关键指标缺乏第三方验证。
6.8 社区和生态尚在起步
虽然发布首日获得了大量关注(有报道称 37k stars),但:
-
贡献者仅 19 人
-
社区插件数量极少(
dsh-plugin话题下的仓库刚起步) -
Discord 社区和 GitHub Discussions 尚在早期
-
没有经过大规模生产使用的反馈循环
6.9 与 MCP 的定位重叠风险
"一切皆插件" 很容易让人联想到 MCP,但两者处在不同层级:MCP 解决 "如何连接外部工具",Harness 解决 "何时调用工具、是否需要审批、结果如何处理、失败如何重试"。但对普通开发者来说,这种区分可能不够直观,存在认知混淆和重复建设的风险。
七、适用场景与建议
7.1 最适合的场景
-
Agent 运行时研究:如果你在研究 Agent 架构、上下文管理、循环策略,dsh 的可组合性让你可以像换零件一样实验不同设计,而无需 fork 整个项目。
-
插件 / 工具开发者:如果你想为 Agent 开发新的能力插件,dsh 的能力三角色模型提供了清晰的扩展范式,且 MIT 协议无商业限制。
-
需要深度可观测性的场景:如果你需要完整回放、审计、离线分析 Agent 行为,dsh 的仅追加事件日志和运行时不变量是目前最严格的实现。
-
自我修改 / 自适应 Agent 研究:Creator 模式是目前唯一的生产级(预览)自我修改平台。
-
DeepSeek 模型用户:如果你已经在使用 DeepSeek 模型,dsh 提供了最深度集成的运行时。
7.2 不适合的场景
-
生产环境部署:v0.1 预览版,破坏性变更不可避免,不建议用于任何生产工作负载。
-
需要多模型支持:当前模型生态单一,建议选择 OpenHands、Cline 或 Aider。
-
快速上手 / 开箱即用:Cordis 学习曲线陡峭,建议选择 Claude Code、Cursor 或 Cline。
-
企业级合规需求:沙箱跨平台支持、SOC2 合规、权限治理等尚未成熟。
-
依赖 MCP 生态:如果你的工作流依赖大量现有 MCP 服务器,需先确认 dsh 的 MCP 支持程度。
7.3 给不同角色的建议
| 角色 | 建议 |
|---|---|
| AI 研究者 | 密切关注,重点研究 Cordis 插件模型和自我修改机制,可用于论文实验 |
| 插件开发者 | 现在可以开始学习 Cordis 和 dsh 的能力三角色模型,为正式版做准备 |
| 企业架构师 | 纳入技术雷达的 "评估" 象限,等待 v1.0 稳定版和 MCP 支持后再评估生产采用 |
| 日常开发者 | 继续使用 Claude Code/Cursor/Cline,dsh 暂不适合作为日常工具 |
| DeepSeek 模型用户 | 可以尝试 Standard 模式,体验深度集成,但注意数据和配置可能不兼容未来版本 |
八、总结与展望
DeepSeek Harness 是 Agent Harness 领域的一次架构范式实验。它没有在 "谁的 Agent 更聪明" 这个维度上竞争,而是选择了一个更根本的问题:Agent 的运行时应该如何被组织,才能支持持续演化?
"一切皆插件" 不是一个新口号,但通过 Cordis 的时空可组合性真正落地为 "任何组件都可替换、卸载即清理、依赖自动解析",这在 Agent 领域是首次。配合仅追加事件日志的严格可观测性和 Creator 模式的自我修改能力,dsh 描绘了一个可重组、可回放、可自进化的 Agent 运行时愿景。
然而,愿景和产品之间有巨大的鸿沟。当前的 dsh 更像是一张精心设计的蓝图而非一个完工的建筑:架构极其优雅,工程规范极其严格,但模型生态单一、行业标准支持不明、社区刚起步、跨平台支持不完整、零生产验证。
它的最大优势(架构灵活性和自我修改)也正是它的最大风险来源 —— 一个能改造自己的 Agent,需要比传统 Agent 强得多的安全模型和治理框架,而这些在 v0.1 阶段尚未经受考验。
短期(6 个月内):dsh 将主要在研究者和早期采用者中传播,插件生态逐步形成,API 快速迭代。
中期(1-2 年):如果能稳定 API、补齐 MCP/Skills 支持、扩展模型适配器,dsh 有机会成为 Agent 运行时的重要选项,特别是在需要深度定制和可观测性的企业场景中。
长期(3-5 年):如果自我修改能力能在安全框架下成熟,dsh 可能定义 "自适应 Agent" 这一新类别,就像 Docker 定义了容器、Kubernetes 定义了编排一样。
DeepSeek 把开源竞争从 "谁的模型更好" 推进到了 "谁的运行时更灵活"。这一步的战略意义不亚于开放模型权重 —— 当 Agent 开始执行持续数小时甚至数天的任务时,模型只是系统中的一个组件,运行层将越来越多地决定能力上限和使用边界。
---
更多推荐


所有评论(0)