模型之后是 Harness:DeepSeek 开源 Agent 框架,AI 竞赛转向“让模型干活“
一、从"拼参数"到"拼 Harness":为什么是现在?
过去两年的 AI 热潮,叙事重心几乎全在模型本身——参数量、上下文长度、基准测试分数、价格战。但一个越来越明显的瓶颈是:再聪明的模型,如果只能"动嘴不动手",在企业场景中的价值就封顶了。
所谓"动手",指的是:
- 自主拉取代码仓库、定位 Bug、修改并提交 PR;
- 在多步骤工作流中保持状态、跨工具协调;
- 连续运行数小时甚至数天而不丢失上下文;
- 在企业内网或本地设备上完成全部推理,不把代码和数据上传云端。
这些能力不取决于模型有多聪明,而取决于围绕模型搭建的那套调度、记忆、沙箱、插件编排系统——也就是 DeepSeek 官方招聘页上写的 Harness。
二、DeepSeek Harness v0.1:一切皆插件的 Agent 运行时
核心设计
DeepSeek 于 8 月 13 日晚正式推出 Harness v0.1 开发者预览版,同步以 MIT 协议在 GitHub 开源。团队负责人为崔添翼(前 Jane Street 九年量化交易经验,2026 年 3 月加入 DeepSeek)。
官方给出的核心公式简洁有力:
Model + Harness = Agent
- Model(模型):负责推理与决策;
- Harness(缰具/工程层):负责将决策转化为可落地的操作——改代码、跑测试、联网搜索、调用外部 API、管理会话状态等。

图 1:示意图 —— DeepSeek Harness 的"一切皆插件"分层架构(非真实界面截图)。基础模型可热插拔替换;Harness 层的全部能力(模型接入、工具调用、技能、记忆、沙箱、调度、UI 等)均为独立插件;最终输出为可自主执行任务的智能体。
关键特性
根据 ZOL 中关村在线、DoNews 快讯、极客公园等多家媒体的公开报道,Harness v0.1 具备以下特征:
| 特性 | 说明 |
|---|---|
| 元框架 | 基于 Cordis 插件元框架构建 |
| 插件化 | 模型、工具、技能、会话、沙箱、存储、循环、UI 全部以标准 Cordis 插件实现 |
| 配置驱动 | 仅需修改配置文件即可增删模块、定制能力,无需改动源码 |
| 四种运行模式 | 标准(全功能)、PTC 程序化工具调用、极简(仅 Shell+文件编辑,用于基准测试)、创造(实时调试/动态定义新行为) |
| 启动方式 | 本地 Node.js 环境,npx 一键启动 Web 交互界面 |
| 原生支持 | DeepSeek V4 Pro 与 V4 Flash |
为什么选 MIT 协议?
MIT 协议意味着企业可以自由商用、修改、闭源分发自己的衍生产品。这对希望私有化部署 Agent 工作流但又不想被 GPL 类协议约束的团队是一个重要信号。
三、同一天的另外两件事:同一拐点的不同切面
如果说 DeepSeek Harness 解决的是"怎么搭一个通用的 Agent 运行时",那么同日发布的另外两个项目则分别瞄准了两个更具体的痛点。

图 2:开源 Agent 框架时间线(2026-08)。基于公开报道整理,截至 2026-08-14。蓝色/绿色/橙色标记为开源/开放权重事件,灰色为同期闭源背景事件。
Arcee NAC:解决"上下文腐烂"的长周期 Agent
Arcee AI 于 8 月 14 日宣布开源 NAC(Apache 2.0 协议)。这个框架自 2024 年 4 月起就是 Arcee 内部研究团队的日常工具,在过去三个月中已接管大量核心代码提交(覆盖预训练、后训练、数据流等环节)。
NAC 的核心设计目标是解决传统 Agent 处理长周期任务时的"上下文腐烂"问题——即随着任务时间拉长,早期信息逐渐被遗忘或扭曲。它主打轻量化和灵活性,既可以独立运行,也可以作为抽象层被 OpenAI Codex 或 Claude Code 调用。
Meta Muse Glimmer:30B 参数的本地 Agent 模型
Meta 几乎同时发布了 Muse Glimmer——一款 300 亿参数的开放权重模型,专为在本地硬件上运行 Agent 工作流设计。
关键技术路径:
- 以更大的 Muse Spark 为教师模型,通过 logit 蒸馏进行预训练;
- 后续经过长上下文训练(强化智能体能力与推理链路)、SFT、RL 和在线蒸馏;
- 支持 131,000+ token 上下文窗口,接受文本+图像输入,支持函数调用与故障恢复;
- 可在配备单块消费级 GPU 的 Mac 或 PC 上运行。
Meta 将 Glimmer 定位为"常驻运行"的本地智能体——常规任务在设备端处理,复杂任务交给云端大模型。这展示了一条完整的端到端流程:云端大模型训练 → 蒸馏为小模型 → 靠近用户部署为本地 Agent。
四、事实对照表:三款方案的核心属性
以下对照表汇总了三个项目的公开属性。所有信息均来自各厂商公告或权威媒体转述,细节以官方文档为准。

图 3:三款开源 / 开放权重 Agent 方案对照表(属性来自公开报道,非排名、非评测结论)。
三者共同点:都在尝试把"模型能力"与"执行工程"解耦,让 Agent 从 demo 级演示走向可私有化、可长时运行的生产系统。
五、对开发者意味着什么:如何快速上手
如果你想在本地体验 DeepSeek Harness,最简路径如下(基于官方文档与媒体报道整理):
# 1. 确保 Node.js 环境(v18+)
node --version
2. 通过 npx 启动 Harness WebUI(无需全局安装)
npx deepseek-harness@latest
3. 浏览器打开交互界面,选择运行模式
- 标准模式:完整功能,适合首次体验
- 极简模式:仅 Shell + 文件编辑,适合基准测试
对于 Arcee NAC,可直接克隆 GitHub 仓库(Apache 2.0 协议):
git clone https://github.com/arcee-ai/nac.git
cd nac
npm install
npm run dev
Meta Muse Glimmer 的权重已上传至 Hugging Face,可通过 Transformers 或类似推理框架加载:
from transformers import AutoModelForCausalLM, AutoTokenizer
model = AutoModelForCausalLM.from_pretrained("meta/Muse-Glimmer-30B")
tokenizer = AutoTokenizer.from_pretrained("meta/Muse-Glimmer-30B")
注意:以上命令中的包名、仓库地址和模型 ID 来自媒体转述,可能与官方最终名称有出入。实际使用前请以各项目 GitHub/HF 页面为准。
六、局限与待核实事项
本文基于截至 2026-08-14 14:00 的公开报道撰写,存在以下已知局限:
- 部分数据口径冲突:DeepSeek V4 Pro 的调价幅度在不同媒体中说法不一——日经亚洲报道为每小时 15 美元定价;每日经济新闻称高峰输出价较现价上涨约 350%、缓存命中价涨至 12 倍;21 世纪经济报道称调价后高峰输出价为现价 4.5 倍。以 DeepSeek 官方 API 价格页面为准。
- 评测榜单矛盾:DeepSeek 内部测评称 V4 Pro 多项指标接近或超越 Claude Fable 5,但第三方报道引用的"智能指数"显示 V4 Pro 为 53 分、低于 Fable 5 的 62 分。不同榜单的评分体系不同,不应直接横向比较。
- 社区热度数据待确认:关于 Harness 在 Hacker News 冲上 TOP 1、GitHub 首日斩获 2.8 万 Star 的说法,目前仅见于 ai-indeed.com 单一来源。建议以 GitHub 实际 Star 数和 HN 排行验证。
- Gemini 3.7 Flash 作为背景参照:文中提及 Google 于 8 月 13 日发布 Gemini 3.7 Flash(距上代仅三周),强调 Coding 与 Agent 能力、API 降价 50%、FrontierCode 得分 43.6%(超过 Claude Sonnet 5)等信息来自 InfoQ 与 communeify 转述,未直接查阅 Google 官方技术报告。
- 命令示例中的标识符:
deepseek-harness@latestnpm 包名、meta/Muse-Glimmer-30BHF 模型 ID 为推测性写法,需替换为官方 exact 名称。
更多推荐


所有评论(0)