DeepSeek V4 Pro 正式版 + Harness v0.1 开源:1M 上下文、384K 输出、“一切皆插件“的 Agent 框架上手
8 月 12 日深夜到 8 月 13 日晚,DeepSeek 连续放出两记大招:V4 Pro 正式版(DeepSeek-V4-Pro-0813)上线,Agent 基建 DeepSeek Harness(DSH)v0.1 开发者预览版开源公测。本文按时间线、硬指标、架构、上手命令、可观测性、框架对比、定价、插件生态的顺序展开,内容均可直接照做。
01 事件背景:48 小时内的两记大招
先理清时间线,这次发布其实是两件事:
- 2026-04-24:V4 预览版发布,Pro/Flash 双版本齐发,均支持 1M 超长上下文,权重与技术报告同步开源,已全面适配华为昇腾等国产算力平台。
- 2026-08-02:团队负责人崔添翼面向全球公开征集 Harness 内测用户,短时间内吸引数十名全球开发者报名。
- 2026-08-12 深夜:V4 Pro 正式版(DeepSeek-V4-Pro-0813)悄然上线,官方同步预告 API 大幅涨价。
- 2026-08-13:Harness v0.1 开发者预览版正式开源(MIT 协议),基于 Cordis 元框架构建,配套插件生态同步开放。一个工程细节:发布时 GitHub 仓库一度非公开,随后转为公开。
产品定位上,Harness 精准对标 OpenAI Codex 与 Anthropic Claude Cowork,主打编程与办公场景——但它的野心远不止"又一个代码 Agent"。
02 V4 双版本与 Pro-0813 硬指标
2.1 双版本定位
V4 从预览版起就是双版本策略:
| 版本 | 定位 | 上下文 | 核心特点 |
|---|---|---|---|
| V4-Pro | Agent 能力、世界知识、推理性能 | 1M | 性能对标顶级闭源模型,主攻复杂推理 |
| V4-Flash | 轻量经济型 | 1M | 推理能力接近 Pro,参数更小、更快更便宜 |
官方口径:百万上下文成标配;两版本均已与主流 Agent 产品完成适配优化。
2.2 Pro-0813 硬指标
正式版把规格进一步拉满:
- 架构:MoE,总参 1.6 万亿,推理时每个 token 仅激活 490 亿参数
- 上下文:1M(100 万 token);最大输出:384K token
- 交互模式:思考(默认)/ 非思考双选项
- 能力:JSON 结构化输出、Tool Calls、Responses API、Anthropic API 兼容
- 权重:MIT 协议开源,国产 GPU / 通用算力卡无需厂商定制即可直接运行
最后一条值得划重点:权重开放意味着模型底座从对特定算力的依赖中解耦,开发者可下载自建、不再依赖云端单一服务,直接降低政企私有化门槛、提升供应链抗风险能力。
2.3 评测数据(官方内部口径)
据 DeepSeek 内部测评,正式版相比预览版提升明显,多项测试接近甚至超越 Claude Fable 5:
| 基准 | 预览版 | 正式版 0813 | 变化 |
|---|---|---|---|
| Terminal Bench 2.1 | 72.1 | 87.9 | +15.8 |
| DeepSWE | 12.8 | 62.7 | 约 4.9 倍 |
| DSBench-Hard | — | 67.2 | 翻倍 |
外部基准上,官方称智能体性能对标 Claude Fable 5,在 AutomationBench(考验 AI 智能体能否真正干活)和 CyberGym(网络攻防实测)两项上甚至反超。以上均为官方内部测评口径,第三方复测结果待跟进——工程上对厂商自报的 benchmark 保持一丝怀疑,是基本功。
03 Harness 架构解析:Agent = Model + Harness
3.1 一个公式,两种分工
DeepSeek 官网上有一条非常重要的公式:
Agent = Model + Harness
模型负责思考推理,Harness 负责真正去干活。你熟悉的 Claude Code、OpenAI Codex、WorkBuddy,本质都是 Harness——配上模型才能运转,否则只是空壳。资深研究员陈德里的定义更狠:"除模型本身以外的所有工作,都属于 Harness 的范畴。"工具、Skills 技能系统、会话、沙箱、存储、Agent 循环、任务调度、子 Agent、工作流……一个 Agent 要连续干活,背后是这一整套系统在支撑。
3.2 一切皆插件
在过去,这些全被封装在一个叫"产品"的壳里(比如 Codex),普通用户能自定义的只有 Skill 和 MCP 之类的外围能力。DeepSeek Harness 的做法是:把所有这些全部变成插件——模型、工具、技能、会话、沙箱、存储、循环、调度、UI,每个环节都是可独立加载、卸载、替换、重组的插件,无需改动 DSH 源码。理解了这一点,就明白它为什么叫 Harness、不叫 DeepSeek Code:DeepSeek 做的不是一款 Agent 产品,而是一套 Agent 基建,所以版本号也老老实实写着"开发者预览版"。
3.3 Cordis:那个克制又疯狂的内核
"一切皆插件"能成立,全靠内核 Cordis。其作者已加入 DeepSeek,这次随产品发布了一篇 88 页的论文(北大 + DeepSeek 联合署名《A Programming Paradigm for Spatiotemporal Composability》)。
Cordis 干的事情极其克制——只负责插件的加载、卸载和依赖管理。但它的两个核心特性堪称疯狂:
- 时间可组合性(Temporal Composability):插件卸载后,它之前产生的副作用能否完整撤销、不留脏数据;
- 空间可组合性(Spatial Composability):插件依赖的其他插件变化时,能否动态重新建立依赖关系。
有了这两点,Agent 可以在运行过程中随时插拔插件而状态不崩。更深远的意义:插件既然可随时更换,Agent 就能在运行中不断给自己开发、安装、卸载插件。社区有个比喻:**Agent 发现自己没有扳手,现场造了一把插到自己手上,接着用它继续干活。**这才是"一切皆插件"的真正野心——让 Agent 能够自进化。
3.4 四种模式对照表
Harness 预设了四种模式。请记住,它们只是模板,不是内核本身——真正的内核只有 Cordis:
| 模式 | 插件集 | 适用场景 |
|---|---|---|
| 标准 | 完整工具组合(文件、Shell、搜索、Skills、计划、子 Agent 等) | 日常开发 |
| PTC | 标准能力 + Code Mode SDK(模型写 TS,一次 run_code 组合多轮调用) | 结构化、批量、可并行任务,省 Token |
| 极简 | 持久 Bash + 文件编辑器,固定系统提示词 | 模型基准测试 |
| 创造 | 标准能力 + 运行时检查 + 内存试验插件 | 创造新模式/新插件,Agent 自进化 |
补充说明:
- PTC 模式(程序化工具调用):模型写一段 TypeScript,在一次
run_code里组合多轮工具操作——原来需要五次往返的"读取→搜索→筛选→并行调用→整理"可压进一次执行,更省 Token、适合结构化批量任务;但对模型的代码规划能力要求高、调试也难。 - 极简模式只给模型一个持久 Bash 和一个文件编辑器,系统提示词固定为"你是一个有帮助的软件工程助手",专门用于模型基准测试,日常使用会非常难受。
- 创造模式最特别:它拥有标准模式的完整能力,还能检查正在运行的 Cordis 环境、在内存中试验插件,从而创建新的 Agent 和插件——比如"只允许读代码、禁止改文件的安全审计模式",或"接入公司内部搜索、固定模型、带三种专属 Skills 的研究 Agent"。Agent 直接改造自己,这就是自进化。
04 安装与上手:从一行 npx 到源码编译
上手门槛极低,前提是装好 Node.js。环境要求:Node.js 22.19 及以上 22.x 版本,或 24 及以上版本。
快速启动,一行命令:
npx @deepseek-ai/dsh web
本地网关会弹出 http://127.0.0.1:3080 ,填上 DeepSeek API Key 就能进入。这个界面本身也是一个 UI 插件——已有开发者做了皮肤插件,甚至有人把侧边栏改造成了 VS Code 式的工作台。
如需从仓库源码运行:
git clone https://github.com/deepseek-ai/deepseek-harness.git
cd deepseek-harness
pnpm install
pnpm run build
pnpm dsh web
dsh 命令行工具用于产品配置与启动,支持 Web、Headless 等多种运行模式,并可通过插件机制扩展;指定配置文件启动:
dsh --profile <name>
几个上手细节:
- 模型不锁死。界面里可选 Flash/Pro 并调节思考强度,更支持自定义模型提供方、Base URL、协议与模型列表——接 GLM 完全没问题,不会绑死在 DeepSeek 模型上。
- 工作区即边界。选择工作区、添加项目目录,就是 Agent 可操作的文件范围,权限边界一目了然。
- 开源协议 MIT;文档站:https://www.deepseek.com/harness/ ;API 平台:https://platform.deepseek.com/ 。
05 轨迹日志:会话即只追加事件流
Harness 有一个对开发者极其友好的设计:会话是一份只追加(append-only)的事件日志。
模型看到的系统提示词、用户消息、推理内容、工具调用与结果、权限变化、上下文注入与压缩、子 Agent 调度……全部按顺序记成事件,下一轮模型看到的历史也是从这份日志重新推导出来的,不再单独保存。技术含义:
- 会话日志是 Agent 全部交互历史的唯一事实来源;
- 模型消息历史由日志推导生成,恢复、分叉、检索与回放共享同一事件流;
- Trajectory 视图按来源查看:系统提示词、思维链、工具调用与结果、子 Agent 调度、上下文注入。
当 Agent 在第几十步跑偏时,你可以在轨迹视图里回到它当时真正看到的上下文,确认问题出在模型判断、工具返回、提示词还是上下文注入——可观测、可审计、可复现。一个安全提醒:完整事件流可能包含代码与敏感信息,可回放提升可审计性的同时,也扩大了需要保护的数据面,日志脱敏和访问控制要提前想好。
实际干活能力的媒体实测数据:翻译一份 88 页论文耗时 22 分钟,首 Token 启动平均 1.4 秒、缓存命中率 98%,任务中派发 10 个子代理协同补齐;写贪吃蛇游戏,极简模式 50 秒完成。最大的感受是流程极度透明——每一步工具调用、每个子代理派发都在轨迹里摊开,这是多数闭源 Agent 产品给不了的。
06 定位对比:与 MCP、OpenAI Agents SDK、Claude Agent SDK、LangGraph
先厘清一个常见混淆:MCP 和 Harness 不在同一层。
- MCP:连接 AI 应用与外部数据、工具、工作流的开放标准,解决"怎么连";MCP 服务器可以作为 Harness 的工具来源。
- Harness:更上层的运行控制层——何时把工具交给模型、调用前是否审批、失败是否重试、何时派出子 Agent、什么条件下停止。
与主流 Agent 框架的对比:
| 框架 | 核心能力 | Harness 的差异点 |
|---|---|---|
| OpenAI Agents SDK | 工具、Agent 交接、护栏、追踪 | 这些能力被拆成可配置组合的插件 |
| Claude Agent SDK | Claude Code 的工具、循环、上下文管理 | 同上 |
| LangGraph | 持久化执行、人类介入、状态恢复 | 同上 |
一句话总结:Harness 的差异化不是多出某个独有能力,而是把各家框架分散的能力进一步拆成可独立替换的插件单元,在配置层自由组合。MCP 负责"怎么连",Harness 负责"何时、以什么方式把能力交给模型"。
07 定价速览与涨价预告
V4 双版本首发定价(单位:元/百万 tokens,首发口径 2026-08-13):
| 模型 | 输入-缓存命中 | 输入-未命中 | 输出 |
|---|---|---|---|
| V4 Pro | 0.025 元 | 3 元 | 6 元 |
| V4 Flash | 0.02 元 | 1 元 | 2 元 |
即 V4 Pro 首发定价约为 Flash 的三倍。
但注意这是首发口径。官宣正式版的同时,官方预告 API 将大幅涨价——据博主实测,V4 Pro 缓存命中价涨幅达 12 倍,高峰期输出价最高 27 元,"价格屠夫"的性价比神话第一次受到挑战。具体以官方最新公告为准,准备接入 API 的团队建议先按涨价后的口径重算预算。
08 开源生态与插件开发
Harness 的生态策略很明确:官方只做内核与第一方插件,剩下的交给社区。
- 社区插件建议添加
dsh-plugin标签便于检索; - 无需修改源码即可替换/扩展任一能力:所有业务组件均为独立插件,通过 Cordis 服务与事件协同,可在配置层自由组合;
- Cordis 支持副作用追踪、依赖解析、配置协调与热更新。
第三方插件入口已同步上线,一个微型生态正在成型:
dsh-at-file:输入框里@直接调用文件;dsh-genui:让模型在回复里渲染图表、表格、Diff、Mermaid 和交互面板;DSH-better-sidebar:把文件管理、真实终端、Git、内嵌浏览器塞进侧边栏;ModLens:给纯文本模型补上视觉能力。
战略层面,这次开源把 DeepSeek 的开源范围从模型延伸到了Agent 工程体系:开放权重解决"谁能运行模型",开放 Harness 触及"谁能决定模型如何工作"。MIT 协议只能降低采用门槛,生态能否滚起来,取决于开发者是否持续维护插件、企业敢不敢把生产权限交给第三方组件。
09 结语:工程视角的三点点评
- 当前是 v0.1 开发者预览版,破坏性变更在所难免。生产环境请锁定版本号、做好插件版本管理,别追最新。
- "一切皆插件"是把双刃剑。对开发者是自由,对小白是门槛;运行时热插拔能力越强,对插件作者的约束越重要(副作用撤销、依赖声明都得规范),否则"状态不崩"的前提就不存在。
- 值得持续跟进。官方口径的能力涨幅相当激进(见 2.3 节),等第三方复测与生态插件数量起来后,Harness 是否配得上"Agent 基建"四个字会有更清晰的答案。
这可能不是一个完美的产品,但它是 DeepSeek 风格的产品——他们更在意科研与探索。就像那句 slogan:探索未至之境。
更多推荐



所有评论(0)