2026 Agent Harness 全景盘点:从 Claude Code、Codex 到昨日开源的 DeepSeek Harness,一张地图看懂「Model + Harness」时代

更新时间:2026-08-14(北京时间)
信息截止:2026-08-14 10:50 CST
标签Agent Harness Harness Engineering DeepSeek Harness Claude Code Codex OpenClaw Hermes Agent Deep Agents
适用读者:AI 工程师、架构师、技术选型决策者、Agent 方向研究者


TL;DR(核心要点)

  1. 2026 年 AI 工程的第一公式是 Agent = Model + Harness。模型负责推理与生成,Harness 负责把模型能力落到真实环境:工具调用、上下文管理、沙箱执行、记忆持久化、错误恢复与任务闭环。这一术语由 OpenAI 与 LangChain 在 2026 年初共同确立,现已成为行业共识。
  2. 工程范式完成了三级跳:Prompt Engineering(2023)→ Context Engineering(2025)→ Harness Engineering(2026)。模型层的竞争边际收益递减,Harness 层成为新的护城河。
  3. 昨天(2026-08-13)晚上,DeepSeek 发布了 Harness 开发者预览版 v0.1,MIT 协议开源,主打「一切皆插件」:模型、工具、技能、会话、沙箱、存储、循环、调度、UI 全部是基于 Cordis 元框架的可替换插件,并提供标准 / PTC / 极简 / 创造四种运行模式。这是 DeepSeek 首款 Agent 产品,也是首个由头部模型厂商开源的「全栈可组装」Harness。
  4. 当前主流 Harness 工具可分为五大阵营:模型厂商旗舰(Claude Code、OpenAI Codex、DeepSeek Harness)、开源社区(OpenCode、OpenClaw、Hermes Agent)、IDE 内嵌(Cursor、Trae)、框架自建(LangChain Deep Agents、Open SWE、各家 Agents SDK)、通用任务型(Manus、WorkBuddy、Trae Work、Kimi Work)。
  5. 选型没有全局最优,只有场景最优:重型代码工程看 Claude Code / Codex;私有化与可组装性看 DeepSeek Harness;个人全能助理看 OpenClaw / Hermes;企业自建看 Deep Agents / Open SWE;IDE 重度用户看 Cursor / Trae。

目录

  1. 概念正名:Harness 到底是什么
  2. 简史:Harness 如何在 9 个月内成为行业主词
  3. 解剖学:成熟 Harness 的六层参考架构
  4. 全景盘点:五大阵营、十四款主流工具
  5. 焦点深潜:DeepSeek Harness v0.1 逐层拆解
  6. 横向对比与选型矩阵
  7. 趋势研判:关于 Harness 的七个判断
  8. FAQ:高频问题速答
  9. 参考资料

一、概念正名:Harness 到底是什么

1.1 定义:模型之外的一切

Harness 原意为「马具」——缰绳、马鞍、挽具的总称。在 AI Agent 语境下,它指包裹在大模型外部的全部运行时基础设施。用一个被广泛引用的公式表达:

Agent = Model + Harness
  • Model:无状态的推理引擎。只接收 token、输出 token;读不了你的代码库、写不了文件、跑不了测试,也不记得上一次会话做过什么。
  • Harness:除模型权重以外的所有代码、配置与执行逻辑——上下文管理、工具调用、沙箱、记忆、调度、权限、验证回路、可观测性。

一个更锋利的操作性定义是:如果你没在做模型训练或推理服务本身,那你干的活多半都属于 Harness 范畴。

一个流传甚广的类比:模型是一位被绑住手脚的天才顾问,Harness 是给它配备的整间办公室——电话、电脑、秘书、日历与会议室。Model + Harness 才构成一个能真正交付工作的 Agent。

1.2 术语消歧:此 Harness 非彼 Harness

为避免检索与讨论中的混淆,需要区分三个同名概念:

术语 含义 代表
Agent Harness(本文主题) 模型外部的运行时基础设施,让 Agent 可靠干活 Claude Code、Codex、DeepSeek Harness
Evaluation Harness 模型能力评测的执行框架,是另一个独立领域 EleutherAI lm-evaluation-harness、HELM、Inspect AI
CI/CD 平台 Harness 一家持续交付软件公司的商标名 Harness.io

2025 年 11 月底 Anthropic 的一场内部实验成为分水岭:他们让 Claude Code 在一条高级指令下「克隆 claude.ai」,结果即便是 Opus 4.5 这样的前沿模型也无法稳定完成——上下文窗口耗尽、半成品无人接手、过早宣布完工。结论直指要害:不是模型不够聪明,而是缺少一个让它持续、可靠工作的 Harness。

1.3 为什么「模型决定上限,Harness 决定下限」

中金研究在 2026 年 6 月的报告《Agent Harness:模型之外、智能之内》中的概括最为精炼:Agent Harness 是在模型外围构建一套可控、可编排、可验证的系统层,使 Agent 稳定完成复杂长程任务。CMU、耶鲁等机构在 2026 年 6 月发布的 Harness 工程综述进一步给出了实证:在不改模型权重的情况下,仅调整 Harness 层本身,就可能显著改变 Agent 在 coding 与 terminal benchmark 上的表现。


二、简史:Harness 如何在 9 个月内成为行业主词

Harness 的爆火是一场「连环事件驱动的完美风暴」。以下是关键时间线:

时间 事件 意义
2025 年 OpenClaw(「龙虾」)发布 MIT 开源 Agent 执行网关,插件生态先行
2025-11 下旬 Anthropic 发布《Effective harnesses for long-running agents》 提出长时 Agent 双智能体架构(初始化 Agent + 编码 Agent)
2026-01 LangChain 发布 Deep Agents(伴随 LangChain 1.0) 把 Claude Code 式设计抽象为开箱即用的开源 harness
2026-02-05 Mitchell Hashimoto(HashiCorp 联创)发文喊出「Engineer the Harness」 「Harness 工程师」角色首次被命名
2026-02-11 OpenAI 发布《Harness engineering: leveraging Codex in an agent-first world》 披露 3 名工程师 + Codex、5 个月、近 100 万行生产代码、0 行人工手写、约 1500 个自动 PR 的实验;Harness Engineering 正式成为方法论
2026-02 Nous Research 开源 Hermes Agent 「自进化」路线登场,2 个月 5.1 万 Star
2026-03 DeepSeek 组建 Harness 团队(崔添翼负责) 头部模型厂商下场做独立 Harness 产品线
2026-04 Claude Code 源码泄露事件(约 57MB) 全球开发者「狂欢式学习」,Claude Code 成为 Harness 设计的事实教科书
2026-06 CMU/耶鲁等发布 Harness 工程综述;中金发布 Agent Harness 研究报告 学术与金融研究同时入场,概念完成正名
2026-08-01 崔添翼在 X 发帖招募 DeepSeek Harness 内测 招募帖变成开源 Agent 生态大摸底
2026-08-12 DeepSeek Harness 公众号注册(「黑鲸」头像),内测口碑刷屏 有内测用户称愿称其为「宇宙最强」
2026-08-13 DeepSeek Harness v0.1 开发者预览版发布,MIT 开源 首个头部模型厂商开源的全栈可组装 Agent Harness
2026-08-14 DeepSeek V4 Pro 正式上线 「模型 + Harness」双线齐发

一条隐藏主线值得注意:OpenAI 产品负责人 Thibault Sottiaux 在 2026 年 8 月初公开表示,「再过 2–3 个月,Codex 这样的 Harness 就是个原始工具了」——Harness 正在从单机工具向云原生 Agent 基础设施演进。


三、解剖学:成熟 Harness 的六层参考架构

对比 Claude Code、Codex、DeepSeek Harness、Deep Agents 等头部项目,可以归纳出一套「六层 + 事件流」的参考架构。这也是后文盘点每一款工具时的统一分析框架:

职责 典型机制
L1 上下文工程层 管好模型的「注意力」 项目指令文件(CLAUDE.md / AGENTS.md)、静态底座 + 动态模块的缓存优先 Prompt 组装、渐进式上下文压缩
L2 记忆层 跨会话的「经验」 追加式会话日志、FTS5 全文检索 + LLM 记忆、向量存储、进度日志(progress log)
L3 工具与环境层 给模型「手脚」 Bash/Shell、文件编辑(str_replace_editor)、联网检索、沙箱隔离、MCP 工具接入
L4 编排层 任务的拆解与调度 Plan→Work→Review 闭环、子 Agent / Agent Teams、Cron 定时、后台任务
L5 验证与恢复层 让错误「出不了门」 Verification Agent、闭环测试、hooks 生命周期钩子、错误恢复、断点续跑/分叉/回放
L6 治理与安全层 让系统「可审计」 权限门控、Human-in-the-loop 审批、审计日志、策略约束(guardrails)
横切:事件流 一切行为可追溯 append-only 事件日志(DeepSeek Harness 的 Trajectory 视图即此层产品化)

一个判断 Harness 成熟度的简单标准:看它如何对待失败。初级 harness 把错误抛给用户;成熟 harness 把错误转化为反馈回路——自动重试、测试闭环、日志回放、架构护栏。


四、全景盘点:五大阵营、十四款主流工具

4.0 总览表(2026-08-14 快照)

工具 阵营 开源 一句话定位
Claude Code 模型厂商旗舰 闭源(源码曾泄露) 终端工程级 Coding Agent 的行业标杆
OpenAI Codex 模型厂商旗舰 闭源 Harness Engineering 的发源地,云端全自主
DeepSeek Harness 模型厂商旗舰 MIT 开源(v0.1) 一切皆插件的可组装 Harness,昨日发布
OpenCode 开源社区 完全开源(Go+JS) 多模型、可定制、隐私优先的终端 harness
OpenClaw 开源社区 MIT 50+ 平台接入的个人 Agent 执行网关
Hermes Agent 开源社区 开源 会「自我进化」的通用 Agent
Cursor IDE 内嵌 闭源 IDE 内实时协作的 Agent Harness
Trae / Trae Work IDE 内嵌 闭源 字节系的 AI IDE 与本地 Agent
Deep Agents 框架自建 开源 LangChain 出品的开箱即用 harness
Open SWE 框架自建 开源 企业内部 Coding Agent 的收敛架构
OpenAI Agents SDK / Google ADK / MS Agent Framework / CrewAI / Mastra 框架自建 开源 各家厂商的 Agent 开发底座
Manus 通用任务型 闭源 长程通用任务的自主 Agent
WorkBuddy / Kimi Work 通用任务型 闭源 国产本地办公 Agent

4.1 模型厂商旗舰 Harness

① Claude Code(Anthropic)——「行业标杆教科书」
  • 定位:终端 Coding Agent,深度重构与大型代码库场景的事实标准。
  • Harness 设计亮点(2026-04 源码泄露后被社区系统性拆解,公认是学习 Harness 设计的最佳教材):
    • 三层架构:技能层(Skill,封装代码审查等任务流程)→ 工作流层(Workflow,编排执行顺序)→ 配置层(Profile,全局规则),核心是 Plan→Work→Review 闭环;
    • 8 类基础工具(bash、read、edit 等)+ 子代理机制;
    • 缓存优先的 Prompt 组装:「静态底座 + 动态模块」,静态在前、动态在后,最大化 KV 缓存命中,显著降低成本与延迟;
    • 三层渐进式上下文压缩对抗长任务上下文腐烂;
    • 六大内置 Agent,其中 Verification Agent 充当「代码质检官」;
    • hooks 机制实现编辑后自动触发测试等流程自动化;CLAUDE.md 作为项目级「说明书」。
  • 战绩:据第三方评测数据(2026-07),Claude Code 以 80.9% 通过率位居 SWE-bench Verified 榜首;在至顶 AI 实验室的六维评测中总分 82.5。
  • 适合谁:中大型代码库的深度重构、需要严谨工程闭环的专业开发者。
② OpenAI Codex(CLI / Cloud / IDE)——「Harness Engineering 发源地」
  • 定位:OpenAI 生态的 Agent 全家桶,本地 CLI + 云端全自主双形态。
  • 关键事实
    • 2026-02 官方文章披露的「百万行实验」:小团队用 5 个月、约 1500 个自动 PR、0 行人工手写代码做出内部 beta 产品。工程师的角色从写代码变为设计环境、指定意图、建立反馈回路
    • Codex App Server 进一步明确了 harness 的完整边界:不止「用户—模型—工具」核心 loop,还包括线程生命周期与持久化、配置与鉴权、工具执行扩展、客户端与运行时之间的协议层;
    • 至顶 AI 实验室六维评测中,Codex 以 91.6 分排名第一(Manus 86.4、Claude Code 82.5、OpenClaw 79.9);SWE-bench Verified 77.3%。
  • 适合谁:OpenAI 生态用户;希望把整条任务「扔进云端异步跑完」的团队。
③ DeepSeek Harness——「昨日发布的开源全栈工作台」(详见第五章深潜)

4.2 开源社区 Harness

④ OpenCode——「社区之王」
  • 完全开源(Go + JS),由开源社区(Anomaly 团队)维护,截至 2026-05 GitHub Star 约 158k,是终端类 harness 中 Star 数最高的开源项目之一。
  • 卖点:多模型任意切换、隐私优先、可深度定制,国内可用性在终端类工具中最好。
  • 适合谁:不愿绑定任何一家模型厂商、重视数据隐私、喜欢折腾的开发者。
⑤ OpenClaw(「龙虾」)——「个人 Agent 的调度中心」
  • MIT 开源,2025 年发布,定位为 AI Agent 执行网关 / 多渠道消息路由器:接入 50+ 消息平台,把各种模型与能力「调度」起来。
  • Harness 特征:MEMORY.md 记忆约定、沙盒隔离执行、内置 Cron 定时任务、庞大插件生态。
  • 2026 年初成为开源史上增速最快的项目之一,催生了「养龙虾」式的个人 Agent 文化。
  • 适合谁:想要一个「常驻的、跨平台的个人 AI 管家」的用户。
⑥ Hermes Agent(「爱马仕」)——「自进化路线旗手」
  • Nous Research 于 2026-02 开源,主打越用越聪明
    • Skills 自动创建(对比 OpenClaw 的手动创建);
    • 跨会话记忆:FTS5 全文索引 + LLM 提炼;
    • RL 轨迹导出——把 Agent 运行轨迹变成训练数据,形成「使用 → 进化」闭环;
    • 6 种执行环境、内置 Cron、支持任意模型。
  • 开源不到 2 个月 Star 破 5.1 万、贡献者 300+,迭代至 v0.8.0。
  • 与 OpenClaw 的本质差异:OpenClaw 是「管理 AI 资源的调度中心」,Hermes 是「会自主学习的 AI 员工」。
  • 适合谁:关注 Agent 自我进化与 RL 数据飞轮的研究型用户。

4.3 IDE 内嵌 Harness

⑦ Cursor——「IDE 里的 Harness」
  • 把 Agent Harness 直接嵌进编辑器:上下文采集与 IDE 状态深度耦合,实时辅助体验最顺滑。
  • 短板:离开 IDE 的长程自主任务能力弱于终端类 harness。
  • 适合谁:以编辑器为第一现场的日常开发。
⑧ Trae / Trae Work(字节跳动)
  • Trae 是 AI IDE,Trae Work 是面向本地办公场景的 Agent。在「同一项目跑多 harness」的对照实验中,Trae 的 Harness 差异主要体现在上下文组织与工具权限策略上。
  • 适合谁:国内环境、追求开箱即用与中文生态的开发者。

4.4 框架自建型 Harness(给「造马具的人」)

⑨ Deep Agents(LangChain)
  • 2026-01 随 LangChain 1.0 发布,官方定位非常直白:「不是框架,是 harness」——一匹已经套好缰绳的马。
  • 逆向分析了 Claude Code / Deep Research / Manus 的共性,固化三件套:任务规划(planning)+ 虚拟文件系统(长任务外存)+ 子 Agent(上下文隔离),底层跑在 LangGraph 有状态运行时之上,可接入 LangGraph Store 获得跨会话持久记忆。
  • 适合谁:要在自家产品里嵌入「Claude Code 式能力」、又要完全可控的企业团队。
⑩ Open SWE(LangChain 生态)
  • 2026 年发布的开源框架,源于一个重要观察:Stripe、Ramp、Coinbase 三家独立开发内部 Coding Agent,最终收敛到相同的五大架构模式。Open SWE 把这种收敛直接产品化,是「Harness 解剖学」的第一个大规模生产验证。
⑪ 厂商 SDK 矩阵
  • OpenAI Agents SDKGoogle ADKMicrosoft Agent FrameworkCrewAIMastraLlamaIndex Workflows:这些属于「给你积木自己拼」的 DSL / Runtime 层,与 Deep Agents、DeepSeek Harness 这类「成品 harness」构成上下游关系。选型原则:简单任务用 SDK 直连,长程自治任务用成品 harness 或在其上做二次封装。

4.5 通用任务型 Harness

⑫ Manus
  • 通用长程任务 Agent(调研、PPT、网站生成等),至顶评测总分 86.4、仅次于 Codex。
  • 其创始人 Peak Ji 的上下文工程实践(KV-cache 优先、todo.md 外存、文件系统当记忆)被 Google DeepMind 工程师 Philipp Schmid 专文总结,已成为 Harness 设计的经典案例。
⑬ WorkBuddy / ⑭ Kimi Work
  • 国产本地办公 Agent 代表(另有 Trae Work),主打「把 Agent 装进自己的电脑」,在国内网络与工作流环境下可用性最好。DeepSeek Harness 的「Agent 预设」能力,正是对标这类现成工具的个性化方向。

五、焦点深潜:DeepSeek Harness v0.1 逐层拆解

发布时间:2026-08-13 晚间 | 版本:v0.1 开发者预览版 | 协议:MIT | 仓库:deepseek-ai/deepseek-harness(CLI 名 dsh

这是昨天刚发布、也是本文时效性最强的部分。DeepSeek Harness 是 DeepSeek 的首款 Agent 产品,由 2026 年 3 月成立、崔添翼负责的 Harness 团队打造,从招募内测到开源发布仅用约两周。

5.1 设计哲学:一切皆插件

DeepSeek Harness 基于 Cordis 插件元框架构建。Cordis 负责插件的加载、卸载与依赖管理;Agent Harness 中的一切能力都是插件

模型 / 工具 / 技能(Skill) / 会话 / 沙箱 / 存储 / 循环 / 调度 / UI
        └────────────── 全部是可独立加载、卸载、替换的 Cordis 插件 ──────────────┘

插件之间通过服务与事件协作,在配置层自由组合——开发者不改源码即可替换、扩展任一能力。这把 Agent 构建从「黑盒」变成了「可组装」,企业可以无缝私有化部署,也天然支持换用 OpenAI、Anthropic 等第三方模型:框架先行,不绑定特定模型

5.2 四种运行模式:一套底座,四种人格

四种模式本质是预设的插件集合快照,共享同一 Cordis 底座,实现「一次开发、多态运行」:

模式 加载策略 适用场景
标准模式 完整工具组合:文件编辑、Shell、联网检索、Skill 调用、多 Agent 编排 日常全功能开发,从零构建项目
PTC 模式(Programmatic Tool Calling) 模型生成 TypeScript 程序来组合多轮工具调用 需要确定性、精细化控制工具链的场景,兼顾效率与可解释性
极简模式 仅持久 bash + str_replace_editor 双工具 轻量任务;更是基准测试的「纯模型能力」对照组
创造模式 支持内存内调试、自定义 Agent preset 生成 打造专属 Agent(写代码、写作等预设),孵化新模式

极简模式的存在尤其体现「懂行」:它给评测社区提供了一个标准化的低干预环境,用来度量模型本身的 Agent 能力,剥离 harness 加成——这正是 Harness 综述论文强调的「控制变量」思路。

5.3 事件流:一切有迹可循

DeepSeek Harness 把「可追溯」做成了第一公民:

  • 模型看到的一切都写入仅追加(append-only)会话日志
  • Trajectory 视图按来源查看每条信息;
  • 恢复、分叉、检索、回放共享同一份事件流——调试一个失败任务可以像 git 一样 fork 出多个分支重新尝试。

5.4 能力清单与快速上手

官方能力面:项目管理、长任务执行、多 Agent 协同、Skill 集成、联网搜索、上下文管理

上手门槛压到极低——npx 一行命令即可拉起 Web UI;完整部署则克隆 deepseek-ai/deepseek-harness 仓库,在配置层选择模式与插件组合即可。

5.5 冷静评价

  • 优势:①头部模型厂商背书 + MIT 协议,是「可组装 harness」路线的第一个大厂开源样本;②PTC 与事件流回放的设计在工程先进性上对标甚至局部超越了闭源竞品;③与同日上线的 V4 Pro / 登顶调用榜的 V4-Flash 形成「模型 + Harness」闭环。
  • 风险提示:官方明确 v0.1 为早期预览版,「核心插件与基础接口将持续快速迭代」——意味着 API 尚不稳定,生产引入需锁定版本、做好跟进升级的准备。

六、横向对比与选型矩阵

6.1 核心维度对比(截至 2026-08-14)

维度 Claude Code Codex DeepSeek Harness v0.1 OpenCode OpenClaw Hermes Agent Deep Agents
开源/协议 闭源 闭源 MIT 开源 MIT 开源 开源
模型绑定 Claude 系 GPT 系 不绑定(框架先行) 多模型 多模型 任意模型 多模型
扩展机制 Skill/hooks/子代理 声明式提示词+协议层 全插件化(Cordis) 配置+插件 插件生态 自进化 Skills 规划+文件系统+子Agent
记忆/可追溯 三层压缩+CLAUDE.md 线程持久化 append-only 日志+分叉回放 会话管理 MEMORY.md FTS5+LLM、RL 轨迹导出 LangGraph Store
多 Agent 子代理/Agent Teams 云端并行 多 Agent 编排插件 子代理 网关调度 支持 原生支持
私有化部署 受限 受限 原生支持 原生支持 原生支持 原生支持 原生支持
成熟度 预览版(快速迭代) 中(快速迭代) 中高

6.2 场景选型速查

你的场景 首选 备选
10 万行级代码库深度重构 Claude Code Codex
云端异步批量任务、零手写代码流水线 Codex Claude Code(后台任务)
私有化部署 / 必须可审计可组装 / 国产合规 DeepSeek Harness OpenCode
多模型自由切换、隐私敏感 OpenCode Hermes Agent
跨平台个人 AI 管家 OpenClaw Kimi Work / WorkBuddy
研究型:自进化与 RL 数据回流 Hermes Agent
把 harness 嵌入自家产品 Deep Agents / Open SWE DeepSeek Harness 插件化二开
IDE 重度用户、实时协作 Cursor Trae
非代码长程任务(调研/文档/网站) Manus Trae Work

七、趋势研判:关于 Harness 的七个判断

  1. 竞争焦点已经换挡。 模型跑分的边际收益在递减,「Model + Harness」的协同落地能力成为新赛点——DeepSeek 资深研究员陈德里在 V4 Pro 发布日的表述也印证了这一点。
  2. 开源可组装路线将倒逼闭源阵营。 DeepSeek Harness 用 MIT + 全插件化把「黑盒 harness」变成公共基础设施,类似当年 DeepSeek 对模型价格的冲击。
  3. Harness 正在云原生化。 OpenAI 高管已明言本地 harness「再火俩月」就是原始工具;线程持久化、协议层、远程执行将成为标配。
  4. 事件流与可回放成为分水岭。 append-only 轨迹、分叉、回放从调试特性升级为 harness 的核心架构(DeepSeek Harness、Codex App Server 殊途同归)。
  5. PTC(程序化工具调用)会普及。 用代码而非逐次 JSON 调用编排工具,是确定性、效率与可解释性的三重优化,预计半年内被主流 harness 跟进。
  6. 「Harness 工程师」岗位化。 从 Mitchell Hashimoto 命名该角色,到 883 实体、1590 条关系的 Harness 知识图谱出现,这已是一门有方法论、有综述论文、有产业报告的正式学科。
  7. 评测将被 harness 重塑。 极简模式这类「纯模型对照环境」会催生新的基准范式:先量模型裸能力,再量 harness 加成,二者分开报价。

八、FAQ:高频问题速答

Q1:Agent Harness 和 Agent 框架(如 LangChain)是一回事吗?
A:不是。框架给你积木让你自己拼;harness 是已经套好缰绳的完整运行系统。二者是上下游关系——例如 Deep Agents 就是「用 LangGraph 运行时实现的成品 harness」。

Q2:DeepSeek Harness 和 Claude Code 谁更强?
A:截至发布日(2026-08-14)无法直接对比:前者是 v0.1 预览版,后者是经过一年打磨的闭源成熟产品。DeepSeek Harness 的差异化在于开源、可组装、不绑定模型;能力上限需等正式版与第三方基准验证。内测用户的「宇宙最强」评价仅供参考。

Q3:Harness Engineering 和 Context Engineering 是什么关系?
A:包含关系:Prompt ⊂ Context ⊂ Harness。上下文工程管「喂什么」,Harness 工程还包括工具与环境、编排、验证、治理,是给模型搭出完整工作环境。

Q4:个人开发者现在该上车哪一款?
A:编码为主选 Claude Code 或 Codex;想折腾、重隐私选 OpenCode;想要全能个人助理选 OpenClaw;想体验最新的可组装范式,npx 一行命令试试 DeepSeek Harness。

Q5:「evaluation harness」(如 lm-evaluation-harness)也是这个概念吗?
A:不是。那是模型评测执行框架,属于另一个领域;但二者正在交汇——如 DeepSeek Harness 的极简模式就是为基准评测设计的。


九、参考资料

  1. DeepSeek Harness 团队:《DeepSeek Harness 开发者预览版发布:一切皆插件》,2026-08-13(腾讯网/每日经济新闻/PingWest 品玩同日报道)
  2. OpenAI:《Harness engineering: leveraging Codex in an agent-first world》,2026-02-11(InfoQ 中文报道,2026-02-27)
  3. Anthropic:《Effective harnesses for long-running agents》,2025-11
  4. 中金研究:《Agent Harness:模型之外、智能之内》,2026-06-04
  5. 智源社区:《全网最详细 Agent Harness 综述》(CMU/耶鲁/杜兰/亚马逊联合论文解读),2026-06-02
  6. 智东西:《120 万星!开发者排队"投简历",DeepSeek 一条内测帖变成了 Agent 开源大摸底》,2026-08-04
  7. 界面新闻:《黄仁勋押注,DeepSeek 内测,详解 Harness 到底是什么?》,2026-08-03
  8. 36kr:《OpenAI 高管:Codex 这样的 Harness,也就再火俩月》,2026-08-09
  9. SegmentFault 思否:《Hermes、Codex、Claude Code、OpenClaw 深度对比:四大终端 AI Agent 完整选型指南》,2026-05-11
  10. 稀土掘金:《2026 终端 AI 编码 Agent 六大工具深度横评》,2026-05-14
  11. 今日头条(至顶 AI 实验室):《Codex、Manus、Claude Code、OpenClaw 谁才是最强的 Agent》,2026-06-25
  12. 博客园:《DeepSeek Harness 2026:一切皆插件 — 开发者预览版完全指南》,2026-08-13
  13. 腾讯云开发者社区:《Agent = Model + Harness:模型决定上限,Harness 决定下限》,2026-05-20
  14. 中国计算机学会(CCF):《驾驭工程崛起:大模型智能体 Harness 技术体系与前沿进展》,2026-04

结语:如果说 2025 年的问题是「哪个模型更聪明」,那么 2026 年的问题已经变成「谁给模型配了更好的办公室」。DeepSeek Harness 昨天以 MIT 协议把整间「办公室」的图纸开源了出来——无论它最终能否成为事实标准,「Model + Harness」的公式都已经写进了这个时代的工程基因里。下一步,轮到你了:选好你的马具,或者,亲手打造一副。

本文事实性信息均基于截至 2026-08-14 的公开报道与官方发布;评测分数为对应来源在各自测试条件下的结果,不构成绝对排名。欢迎在评论区聊聊你现在的主力 Harness 是哪一款。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐