模型是大脑,Harness是身体:一个教务处副处长眼中的DeepSeek Harness

导读:DeepSeek Harness(DSH)不是新大模型,而是让大模型变成能干活的Agent(智能体)的那层"身体工程"。本文基于 DSH v0.1开发者预览版(2026年8月13日开源),从教育管理者的视角,把"Harness"概念掰开揉碎,聊聊它对高校信息化意味着什么。适合高校信息化管理者、教务运维人员、关注AI Agent架构的技术管理者阅读。

⚠️ 适用范围:本文内容基于DSH v0.1预览版,官方已明确"后续会有破坏兼容性的变更",生产环境请勿直接使用。


一、先讲清楚:Harness到底是什么

8月13日晚上,DeepSeek开源了一个叫DeepSeek Harness(以下简称DSH)的东西——不是新大模型,而是让大模型变成能干活的Agent(智能体)的那层"身体",GitHub首日2.8万Star,两天破10万1。技术群里讨论得热火朝天,办公室一位年轻老师跑来问我:“处长,DeepSeek不是早就有了吗,这次又发了个啥?”
DeepSeek Harness官方主页截图

我给他打了个比方:你认识一位博学的教授,学问极好,但常年坐在图书馆里,不能出门、不能动手,你问他什么他都能答,可事情还得你自己去办。这次DeepSeek做的,是给这位教授配了一副身体——能走、能拿东西、能按规矩办事的身体。

这个比方不是我随口编的。DSH官方给出的公式就是:Model + Harness = Agent2。模型负责理解和推理,Harness负责把推理变成真实世界里的动作。这篇文不写代码(官方一行命令就能跑:npx @deepseek-ai/dsh@0.1.0 web),而是想从教育管理者的视角,把"Harness"这个概念掰开揉碎,聊聊它对高校信息化意味着什么。

Harness的词源与AI含义对照

层面 原义(马具) AI领域含义 教务类比
本体 套在马身上的挽具 大模型之外的那层工程系统 教务处给助管配的工位+手册+权限
作用 把马的力气传导到车上 把模型推理变成真实动作 让助管从"能答"变成"能办"
关键组件 缰绳、挽索、车辕 工具接入、上下文管理、错误重试、操作留痕 OA账号、办事流程、请示制度、留痕机制

Harness,原义是"马具"——套在马身上,把马的力气传导到车子上的那套挽具。在AI领域,它指大模型之外、让模型能干活的那一层工程系统:给模型什么工具、怎么组织上下文、出错后怎么重试、每一步操作留不留痕。

用教务场景打个比方:模型是新入职的研究生助管,聪明、学得快;Harness是教务处给这位助管配的一整套东西——工位、业务手册、OA账号权限、办事流程、出错时的请示制度。没有这套东西,再聪明的助管也只能坐在那儿回答问题,办不成一件事。

这个概念值得认真对待,因为它纠正了一个流行误解:很多人以为"AI能不能干活"取决于模型够不够强。DSH用产品形态告诉你:模型只是半身,另一半在模型之外。这不是DeepSeek一家的看法——OpenAI有Codex,Anthropic有Claude Code,三家顶级厂商不约而同地往"模型之外"发力3。但DSH是第一个把这一层单独拿出来、开源、做成独立产品的。

三家厂商"模型之外"布局对比

厂商 产品 开源状态 产品形态 核心差异
DeepSeek DSH(基于Cordis) ✅ MIT开源 独立产品,一切皆插件 首个将Harness层单独开源
OpenAI Codex ❌ 闭源 嵌入GitHub Copilot生态 与IDE深度绑定
Anthropic Claude Code ❌ 闭源 CLI工具+API服务 强调安全沙箱设计

关键判断:三家的共同方向说明——AI竞争的重心正在从"模型本身"转向"模型之外的执行层"。谁掌握了这一层,谁就掌握了Agent时代的话语权。


二、拆解DSH:三个值得教育管理者记住的设计

设计一:“一切皆插件”——分工的工业化

DSH基于一个叫Cordis的插件元框架构建,配套还有一篇北京大学与DeepSeek联合署名的论文4。它的核心主张是:模型、工具、技能、会话、沙箱、存储、Agent主循环、调度、UI——全部是可插拔的插件,没有一个改不动的"特权内核"。想换模型?换个插件。想加个工具?挂个插件。发布当天内测社区就已攒下约300个插件5

这事对非技术读者意味着什么?我用教务系统做个类比。传统做法里,教务系统是"定制开发"的:想加个功能,找厂商改源码,排期三个月。"一切皆插件"相当于把教务系统改造成乐高底板:成绩录入是一块积木,排课是一块积木,换一家厂商只需要换那块积木,不用推翻整个系统。

💡 真实经历:我校三年前上教务系统时,想给"学籍异动审批"加一个"自动核验先修课"的环节。找厂商报价、排期、改代码,前后折腾了两个月才上线。如果当时系统是"插件化"架构,这个功能本可以作为一个独立模块挂上去,周期可能缩短到两周。这种"系统烟囱、想改一个功能要求爷爷告奶奶"的痛,做过信息化的人都有体会。

DSH甚至支持接入OpenAI、Anthropic、Google、Kimi等近40家模型提供方6——连"大脑"本身都是可替换的插件。这意味着在DSH的世界里,系统的中心不再是模型,而是模型之外的这层脚手架

设计二:极简模式——跑分透明化的"裸测"规矩

DSH内置四种运行模式,管理者至少要理解它们的区别:

运行模式 工具配置 典型用途 管理者关注点
标准模式 全工具集 日常Agent任务 功能最全,但权限范围最大
PTC模式 模型写代码组合多步工具 复杂编排任务 灵活性高,调试难度大
极简模式 仅shell+文件编辑 公开基准跑分 ⚠️ 跑分透明化的关键
创造模式 AI自检+改装插件 插件开发与迭代 实验性强,非生产可用

最值得管理者玩味的是极简模式。DeepSeek在V4-Pro正式版的官方公告里写了一个脚注:所有公开基准测试成绩,都是用DSH极简模式、max思考档位、topp=0.95、temperature=1.0的固定配置跑出来的7

为什么这很重要?因为AI基础设施公司Composio在8月做过一组对照实验:把同一个模型接入8套不同的Agent框架,跑同一批30个真实任务,任务通过率从47%到67%,相差20个百分点8。也就是说,"这个模型跑分多少"从来不是一个纯粹的模型属性,而是"模型+脚手架"的联合成绩

跑分透明化的意义

对比维度 以前的做法 DSH立的新规矩
脚手架 各家用各的,不公开 开源+配置写死在脚注
可比性 成绩无法横向比较 同配置可复现
信任基础 读者只能"盲信"厂商 读者可自行验证

以前各家厂商报跑分,用的脚手架各不相同,成绩没法横向比较。DeepSeek把跑分用的脚手架开源出来、配置写死在脚注里,等于立了个规矩:报成绩,先亮装备。

这条规矩的精神,教务系统的人其实最熟悉——评教数据怎么统计、口径是什么,不说明白,任何"满意度95%"都没有意义。数字必须附带生产它的装置。

设计三:全程轨迹审计——Agent时代的"办事留痕"

DSH内置追记式(append-only)会话日志:模型看到的每一条信息、每一次工具调用、每一回上下文注入,全部写入不可篡改的事件流,可以在Trajectory视图里回放、分叉、检索9

做行政的人对这套逻辑天然亲切。OA系统为什么要留痕?因为办事必须可回溯、可问责。DSH把行政系统"留痕"的理念搬进了AI:Agent每一步操作都可逐字节重建,出了错能精确倒查到是哪一步、基于什么信息做出的决策。

💡 真实经历:去年期末排考时,教务系统突然把一个考场排重了——两个班的考试被安排到同一间教室的同一时段。排查时发现系统日志只记了"排考完成",没有记录中间哪一步出了问题,最后只能靠经验猜是数据导入时考场容量字段被覆盖了。如果当时有DSH这种"逐字节可重建"的轨迹审计,排查就像调监控录像,几分钟就能定位。

这一点对高校场景的分量怎么强调都不过分。设想一个"教务助管Agent"帮学生办休学申请:它查了学籍、核了条件、提交了流程。如果中间出了错——比如误判了修读年限——没有轨迹审计,你只能看到错误的结果,没法回答"它当时为什么这么判断"。有了轨迹审计,排查就像调监控录像。


三、泼三盆冷水:DSH现在还"不能全信"

说好话容易,管理者更该看到风险。三盆冷水:

⚠️ 第一盆:它还是预览版

v0.1开发者预览,官方明确说"后续会有破坏兼容性的变更"1。现在把它用于生产环境,就像在还没竣工验收的楼里办公。尝鲜、研究、学习架构,可以;把真实业务压上去,不行。

⚠️ 第二盆:安全边界是行业性难题

Agent能操作文件、执行命令,权限给大了可能"删库跑路",给小了又干不成活。这个边界怎么划,目前整个行业都没有成熟方案5。高校数据敏感(学籍、成绩、人事),在权限插件和审计机制成熟之前,校内部署务必谨慎。

权限场景 风险等级 当前状态 建议
Agent读写本地文件 🔴 高 行业无成熟方案 仅在隔离沙箱中运行
Agent执行shell命令 🔴 高 依赖沙箱隔离 禁止生产环境直接使用
Agent调用教务API 🟡 中 需自定义权限插件 最小权限原则+全程审计
Agent查询公开数据 🟢 低 风险可控 可在测试环境试用

⚠️ 第三盆:免费的是脚手架,不是脑力

DSH本体MIT开源免费,但模型调用按token计费,账单照样来10。别被"开源免费"四个字带偏了预算测算。

成本测算示例:假设一个"教务问答Agent"日均处理200次学生咨询,每次平均消耗2000 token(输入+输出),按DeepSeek API当前定价估算,月度token费用约在数百元量级。这在高校信息化预算中不算大数,但必须提前纳入预算,不能等到账单来了才想办法。


四、对高校信息化的三条落地启示

给管理者

今后评估任何"AI+业务"方案,把问题从"用了什么模型"改成"模型之外的执行层怎么设计"——工具给了哪些、权限怎么收、轨迹留不留。这三问比模型选型更能决定项目成败。方案汇报里只谈模型参数、不谈执行层设计的,大概率没想清楚。

管理者三问检查清单

检查项 要问什么 达标标志
工具边界 Agent能操作哪些系统/数据? 有明确的工具清单和权限矩阵
权限收口 出错时能拦住吗? 有分级审批和熔断机制
轨迹留痕 出了错能倒查吗? 有不可篡改的操作日志

给信息化技术人员

DSH值得作为架构范本研究,而不是产品直接用。重点学三样:插件化(你的教务系统接口能不能做成可插拔)、预设体系(不同角色=不同插件组合,学生/教师/教务员各一套"岗位+工作环境")、轨迹审计(Agent进校园前的合规地基)。

一行命令就能在本机跑起来:

# 安装并启动DSH Web界面(锁定v0.1.0预览版)
npx @deepseek-ai/dsh@0.1.0 web
# 官方给出得一键安装命令
npx @deepseek-ai/dsh web

# 验证启动成功:浏览器打开后应看到DSH控制台
# 预期输出:DSH Web UI running at http://localhost:3000

DSH运行界面

⚠️ 环境要求:Node.js 18+,建议在隔离环境中运行,不要连接生产数据库。周末两小时足够建立直觉11

给教师和研究者

关注"极简模式"立下的新规矩——以后看任何AI能力测评,先问"用的什么脚手架、什么配置"。没有交代测评装置的跑分,和没有交代统计口径的评教数据一样,只能当参考,不能当依据。


五、回到那位年轻老师的问题

“这次DeepSeek发了个啥?”——发了一副身体,以及一个观念:AI竞争的重心,正在从"谁的大脑更聪明"转向"谁的身体更好用、更可信"。

模型是大脑,决定能想多深;Harness是身体,决定能干多远、留不留痕。DeepSeek把身体开源、把跑分的装备公开、把每一步行动记进不可篡改的日志——这三件事加在一起,是给整个行业递了一份"Agent该怎么被治理"的参考答案。


速查卡:DSH核心信息一览

项目 内容
全称 DeepSeek Harness(DSH)
版本 v0.1开发者预览版(2026-08-13开源)
许可证 MIT开源免费
底层框架 Cordis插件元框架
GitHub Star 首日2.8万,两天破10万
核心公式 Model + Harness = Agent
四大模式 标准 / PTC / 极简 / 创造
模型支持 近40家提供方(OpenAI/Anthropic/Google/Kimi等)
启动命令 npx @deepseek-ai/dsh@0.1.0 web
生产可用性 ❌ 预览版,不可用于生产
审计能力 ✅ 追记式会话日志,不可篡改

留一个问题给大家:如果未来每个学生都配一个"学业Agent",你希望它的"办事留痕"记录,由谁来保管、按什么规则调阅? 欢迎在评论区聊聊。


系列导航:上一篇《从命令行到自然语言:CLI、TUI、GUI、API、LUI的进化逻辑与设计理念》。

变更提示:本文基于DSH v0.1预览版撰写。DSH仍在快速迭代中,官方已预告"破坏兼容性的变更",后续版本API可能有较大调整。如需了解最新变化,请关注DeepSeek官方文档

参考文献


  1. IT之家. 对标Claude Cowork:DeepSeek Harness公测,同步开放插件生态[EB/OL]. (2026-08-13). https://www.ithome.com/0/989/446.htm ↩︎ ↩︎

  2. 新浪科技. DeepSeek Harness发布时间确认:2026年8月13日开源[EB/OL]. (2026-08-13). https://cj.sina.cn/articles/view/7879777295/1d5abdc0f06801hi8k ↩︎ ↩︎

  3. DAMO开发者矩阵. DeepSeek Harness (DSH) 深度解析:从Cordis架构到自进化Agent的可能性[EB/OL]. (2026-08-14). https://damodev.csdn.net/6a7e927f662f9a54cb9c95a2.html ↩︎

  4. 腾讯云开发者社区. DeepSeek Harness是什么?为什么开源后这么火?一文梳理[EB/OL]. (2026-08-14). https://developer.cloud.tencent.com/article/2726636 ↩︎ ↩︎

  5. 2. ↩︎ ↩︎

  6. 新浪科技. DeepSeek Harness支持哪些第三方大模型?如何接入?[EB/OL]. (2026-08-14). https://k.sina.com.cn/article_7879848900_1d5acf3c4068039yjc.html ↩︎

  7. DeepSeek API文档. DeepSeek-V4-Pro正式版上线[EB/OL]. (2026-08-14). https://api-docs.deepseek.com/zh-cn/news/news260813/ ↩︎

  8. 4.(注:该对照测试不同框架配置存在差异,结论应谨慎解读) ↩︎

  9. 博客园. DeepSeek Harness 2026:一切皆插件——开发者预览版完全指南[EB/OL]. (2026-08-14). https://www.cnblogs.com/sing1ee/p/22455466 ↩︎

  10. QCode.cc. DeepSeek Harness + Cordis(2026):开发者预览指南[EB/OL]. (2026-08-14). https://qcode.cc/deepseek-harness-guide ↩︎

  11. 电子工程专辑. DeepSeek Harness首发实测![EB/OL]. (2026-08-15). https://www.eet-china.com/mp/a517716.html ↩︎

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐