DeepSeek Harness 开源:模型之外的战争刚刚开始-龍德明宇
DeepSeek Harness 开源:模型之外的战争刚刚开始
作者:龍德明宇

8月13日这一天,DeepSeek 放出了两个动作。凌晨,V4 Pro 正式版上线,架构和预览版完全一致,Agent 能力却暴涨;晚上,DeepSeek Harness(DSH)开发者预览版开源,MIT 协议,GitHub 同步开放。
后者是更值得注意的信号。这不是新模型,也不是 API 客户端,而是一整套把模型接进文件系统、终端、网页和工具,并组织上下文、工具调用与任务执行的 Agent 运行框架。DeepSeek 第一次把手伸到了模型输出之后的执行层。
一切皆插件:它不是又一个 Claude Code
DSH 最核心的设计是「一切皆插件」。模型、工具、会话、沙箱、存储、循环、调度、UI,所有能力都由插件组合而成,可自由替换、灵活重组,底层基于 Cordis 这套可组合框架,设计思想源自一篇关于时空可组合性的编程范式论文。
它提供标准、PTC、极简、创造等多种 Agent 预设。同一个进程里,可以同时运行写作 Agent、编码 Agent、研究 Agent,各自看到不同的工具和指令,不必启动多套服务。
所以它不像 Codex 那样交付一个「拿来即用的 Agent」,更像一套「组装 Agent 的运行时」。据参与内测的媒体介绍,内测用户短短几天就自发开发了约三百个插件,连跨会话长期记忆、界面改版都是纯插件实现。
最值得注意的线索:官方跑分用的是它自己
V4 Flash 正式版的更新日志里藏着一行容易被忽略的字:公开基准测试中的 Code Agent 任务,使用「DeepSeek Harness 极简模式(即将发布)」作为框架进行测试。
换句话说,DeepSeek 对自家模型 Agent 能力的评测,本身就带着自己的 Harness。官方公式「Model + Harness = Agent」在这里是字面意义的:模型之外的所有工程化工作,都属于 Harness 的范畴。
这解释了一个反常识的现象:同一个模型,放进不同 Harness,效果可以差出数倍。第三方测试中,同一个 V4 Flash 接入八种 Harness 完成三十项任务,最多完成二十项、最少十四项,单任务成本差最高达七倍。模型划定能力上限,harness 决定这份能力最终兑现多少。
模型是空无,Harness 提供结构
这恰好印证了我一直写的一个判断:模型本身是「空无」,它只提供统计预测的潜能;是 harness 这种外在结构,把潜能组织成真实的执行能力。V4 Pro 正式版与预览版架构完全一致,能力却大幅跃升,靠的正是后训练与这套「脚手架」。DeepSeek 从产业层面验证了这个理论。
当多个 Agent 被放进同一个系统
单个 Agent 的能力边界由「Model + Harness」定义,下一个问题自然浮现:当多个 Agent 被放进同一个系统,它们之间的「关系」该如何设计?
我在此前的文章中论证过:多 LLM 之间的交互不构成真正意义上的「关系」,而是以 Harness 为中介的「结构性耦合」;关系不是「涌现」的,而是「被设计」的。这指向一个工程方向:关系工程。
DeepSeek 开源 Harness,等于把「如何定义单个 Agent」的主动权交还给开发者。而当越来越多的 Agent 被组装进同一个系统,「如何定义 Agent 之间的关系」就会成为下一个战场。这个问题的答案,可能比谁的开源协议更宽松更重要。
延伸阅读
更多推荐



所有评论(0)