一、从"拼参数"到"拼 Harness":为什么是现在?

过去两年的 AI 热潮,叙事重心几乎全在模型本身——参数量、上下文长度、基准测试分数、价格战。但一个越来越明显的瓶颈是:再聪明的模型,如果只能"动嘴不动手",在企业场景中的价值就封顶了。

所谓"动手",指的是:

  • 自主拉取代码仓库、定位 Bug、修改并提交 PR;
  • 在多步骤工作流中保持状态、跨工具协调;
  • 连续运行数小时甚至数天而不丢失上下文;
  • 在企业内网或本地设备上完成全部推理,不把代码和数据上传云端。

这些能力不取决于模型有多聪明,而取决于围绕模型搭建的那套调度、记忆、沙箱、插件编排系统——也就是 DeepSeek 官方招聘页上写的 Harness

二、DeepSeek Harness v0.1:一切皆插件的 Agent 运行时

核心设计

DeepSeek 于 8 月 13 日晚正式推出 Harness v0.1 开发者预览版,同步以 MIT 协议在 GitHub 开源。团队负责人为崔添翼(前 Jane Street 九年量化交易经验,2026 年 3 月加入 DeepSeek)。

官方给出的核心公式简洁有力:

Model + Harness = Agent

  • Model(模型):负责推理与决策;
  • Harness(缰具/工程层):负责将决策转化为可落地的操作——改代码、跑测试、联网搜索、调用外部 API、管理会话状态等。

图 1:示意图 —— DeepSeek Harness 的"一切皆插件"分层架构(非真实界面截图)。基础模型可热插拔替换;Harness 层的全部能力(模型接入、工具调用、技能、记忆、沙箱、调度、UI 等)均为独立插件;最终输出为可自主执行任务的智能体。

关键特性

根据 ZOL 中关村在线、DoNews 快讯、极客公园等多家媒体的公开报道,Harness v0.1 具备以下特征:

特性说明
元框架基于 Cordis 插件元框架构建
插件化模型、工具、技能、会话、沙箱、存储、循环、UI 全部以标准 Cordis 插件实现
配置驱动仅需修改配置文件即可增删模块、定制能力,无需改动源码
四种运行模式标准(全功能)、PTC 程序化工具调用、极简(仅 Shell+文件编辑,用于基准测试)、创造(实时调试/动态定义新行为)
启动方式本地 Node.js 环境,npx 一键启动 Web 交互界面
原生支持DeepSeek V4 Pro 与 V4 Flash

为什么选 MIT 协议?

MIT 协议意味着企业可以自由商用、修改、闭源分发自己的衍生产品。这对希望私有化部署 Agent 工作流但又不想被 GPL 类协议约束的团队是一个重要信号。

三、同一天的另外两件事:同一拐点的不同切面

如果说 DeepSeek Harness 解决的是"怎么搭一个通用的 Agent 运行时",那么同日发布的另外两个项目则分别瞄准了两个更具体的痛点。

图 2:开源 Agent 框架时间线(2026-08)。基于公开报道整理,截至 2026-08-14。蓝色/绿色/橙色标记为开源/开放权重事件,灰色为同期闭源背景事件。

Arcee NAC:解决"上下文腐烂"的长周期 Agent

Arcee AI 于 8 月 14 日宣布开源 NAC(Apache 2.0 协议)。这个框架自 2024 年 4 月起就是 Arcee 内部研究团队的日常工具,在过去三个月中已接管大量核心代码提交(覆盖预训练、后训练、数据流等环节)。

NAC 的核心设计目标是解决传统 Agent 处理长周期任务时的"上下文腐烂"问题——即随着任务时间拉长,早期信息逐渐被遗忘或扭曲。它主打轻量化和灵活性,既可以独立运行,也可以作为抽象层被 OpenAI Codex 或 Claude Code 调用。

Meta Muse Glimmer:30B 参数的本地 Agent 模型

Meta 几乎同时发布了 Muse Glimmer——一款 300 亿参数的开放权重模型,专为在本地硬件上运行 Agent 工作流设计。

关键技术路径:

  • 以更大的 Muse Spark 为教师模型,通过 logit 蒸馏进行预训练;
  • 后续经过长上下文训练(强化智能体能力与推理链路)、SFT、RL 和在线蒸馏;
  • 支持 131,000+ token 上下文窗口,接受文本+图像输入,支持函数调用与故障恢复;
  • 可在配备单块消费级 GPU 的 Mac 或 PC 上运行。

Meta 将 Glimmer 定位为"常驻运行"的本地智能体——常规任务在设备端处理,复杂任务交给云端大模型。这展示了一条完整的端到端流程:云端大模型训练 → 蒸馏为小模型 → 靠近用户部署为本地 Agent

四、事实对照表:三款方案的核心属性

以下对照表汇总了三个项目的公开属性。所有信息均来自各厂商公告或权威媒体转述,细节以官方文档为准。

图 3:三款开源 / 开放权重 Agent 方案对照表(属性来自公开报道,非排名、非评测结论)。

三者共同点:都在尝试把"模型能力"与"执行工程"解耦,让 Agent 从 demo 级演示走向可私有化、可长时运行的生产系统。

五、对开发者意味着什么:如何快速上手

如果你想在本地体验 DeepSeek Harness,最简路径如下(基于官方文档与媒体报道整理):

# 1. 确保 Node.js 环境(v18+)
node --version
2. 通过 npx 启动 Harness WebUI(无需全局安装)
npx deepseek-harness@latest
3. 浏览器打开交互界面,选择运行模式
- 标准模式:完整功能,适合首次体验
- 极简模式:仅 Shell + 文件编辑,适合基准测试

对于 Arcee NAC,可直接克隆 GitHub 仓库(Apache 2.0 协议):

git clone https://github.com/arcee-ai/nac.git
cd nac
npm install
npm run dev

Meta Muse Glimmer 的权重已上传至 Hugging Face,可通过 Transformers 或类似推理框架加载:

from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("meta/Muse-Glimmer-30B")
tokenizer = AutoTokenizer.from_pretrained("meta/Muse-Glimmer-30B")

注意:以上命令中的包名、仓库地址和模型 ID 来自媒体转述,可能与官方最终名称有出入。实际使用前请以各项目 GitHub/HF 页面为准。

六、局限与待核实事项

本文基于截至 2026-08-14 14:00 的公开报道撰写,存在以下已知局限:

  1. 部分数据口径冲突:DeepSeek V4 Pro 的调价幅度在不同媒体中说法不一——日经亚洲报道为每小时 15 美元定价;每日经济新闻称高峰输出价较现价上涨约 350%、缓存命中价涨至 12 倍;21 世纪经济报道称调价后高峰输出价为现价 4.5 倍。以 DeepSeek 官方 API 价格页面为准。
  2. 评测榜单矛盾:DeepSeek 内部测评称 V4 Pro 多项指标接近或超越 Claude Fable 5,但第三方报道引用的"智能指数"显示 V4 Pro 为 53 分、低于 Fable 5 的 62 分。不同榜单的评分体系不同,不应直接横向比较。
  3. 社区热度数据待确认:关于 Harness 在 Hacker News 冲上 TOP 1、GitHub 首日斩获 2.8 万 Star 的说法,目前仅见于 ai-indeed.com 单一来源。建议以 GitHub 实际 Star 数和 HN 排行验证。
  4. Gemini 3.7 Flash 作为背景参照:文中提及 Google 于 8 月 13 日发布 Gemini 3.7 Flash(距上代仅三周),强调 Coding 与 Agent 能力、API 降价 50%、FrontierCode 得分 43.6%(超过 Claude Sonnet 5)等信息来自 InfoQ 与 communeify 转述,未直接查阅 Google 官方技术报告。
  5. 命令示例中的标识符deepseek-harness@latest npm 包名、meta/Muse-Glimmer-30B HF 模型 ID 为推测性写法,需替换为官方 exact 名称。
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐