DeepSeek之后,Agent真正的分水岭来了:为什么大家突然都在谈Harness?
过去两年,我们一直在比较模型。
谁代码能力更强。
谁上下文更长。
但到了Agent阶段,真正拉开产品差距的,开始变成模型外面的那套“Harness”。
最近“DeepSeek Harness”这个词开始频繁出现在开发者讨论里。
不少人第一反应是:
DeepSeek是不是也要做一个国产Claude Code?
但如果只这么理解,其实把Harness看小了。
它不是一个简单的聊天界面。
也不只是“给模型加几个工具”。
它更像把模型这台发动机,真正装进一辆可以上路的车。
先说清一个事实
目前DeepSeek官方公开GitHub能确认的是“Awesome DeepSeek Agent”生态,它提供DeepSeek V4 Pro / Flash接入Claude Code、OpenCode、Pi、Codex等Agent与编程助手的指南。
但网络上流传的“DeepSeek官方独立Harness产品、npx @deepseek-ai/dsh web、4小时34K stars”等细节,目前没有在DeepSeek官方仓库与公开文档中找到对应证据。
所以下面讨论的是Harness这套正在快速成熟的Agent架构,而不是把未经确认的信息写成官方发布。
01|模型是发动机,Harness才是整车
大模型本身最擅长的是理解、推理和生成。
但一个真正能“干活”的Agent,还要解决很多模型本身不会自动解决的问题。
它要记住目标。
要拆计划。
要调用工具。
要保存进度。
要检查结果。
失败以后还要继续。
普通模型
问题 → 回答
Agent + Harness
目标 → 规划 → 工具 → 执行 → 检查 → 修正 → 完成
所以更准确的公式其实是:
Agent =
Model
+ Context
+ Tools
+ Memory
+ Workflow
+ Guardrails
+ Feedback Loop
模型决定上限。
Harness决定这个上限到底能发挥多少。
02|为什么同一个模型,放进不同Agent里体验差很多
DeepSeek官方现在已经提供了不少Agent集成方式。
同样是DeepSeek V4 Pro或Flash。
可以放进Claude Code。
可以放进OpenCode。
可以放进Pi。
也可以放进其他Coding Agent。
模型没有变。
但真正使用起来,完成任务的方式却完全不一样。
原因就是Harness不同。
有的Harness更擅长找到正确文件。
有的更擅长控制终端。
有的会自动跑测试。
有的能在长任务里不断压缩上下文。
还有的会把高成本模型和低成本模型分工使用。
所以Agent产品真正的差异,正在从“模型是谁”慢慢转向“模型被怎么使用”。
03|一个真正好用的Harness,至少要管这5件事
STEP 1|目标不能丢
长任务执行十几轮以后,Agent依然要知道自己最初要解决什么,而不是越做越偏。
STEP 2|工具必须可控
读文件、写代码、运行测试、访问网页、调用数据库,都应该有明确权限,而不是给模型一个无限制Shell。
STEP 3|结果必须验证
模型说“完成了”不等于真的完成了,代码要跑测试,文档要检查格式,数据任务要验证结果。
STEP 4|失败必须能继续
遇到报错以后,不应该重新从第一步开始,而应该保留状态,继续定位问题。
STEP 5|成本必须有预算
Agent不能因为一次失败无限循环,要限制迭代次数、工具调用、Token和执行时间。
04|“一切皆插件”,其实是Harness最有想象力的地方
真正有意思的Harness,不应该把能力全部写死。
更适合Agent的方式,是把模型、工具、记忆、UI和工作流都做成可替换模块。
plugins:
model:
- deepseek-v4-pro
- qwen
tools:
- file_reader
- browser
- terminal
- document_parser
workflow:
- planner
- verifier
- retry
这样一套底座,可以组装成完全不同的产品。
加载代码编辑、终端和测试工具,就是编程Agent。
加载知识库、表格和文档能力,就是办公Agent。
加载视觉模型和网页工具,就可以继续做视觉审核、页面理解。
这也是Harness比“单一Agent应用”更值得关注的原因。
05|真正难的不是“接上模型”,而是让长任务闭环
很多Agent Demo第一次看很惊艳。
真正进入工作以后,最容易出问题的是长任务。
GOAL-101|目标漂移
执行轮次越来越多,Agent开始解决支线问题,忘记最初目标。
DONE-202|提前宣布完成
模型看到局部结果不错,就直接结束,但真正的验收条件还没有满足。
LOOP-303|无限循环
同一个错误反复修复、反复测试,Token和时间不断消耗。
while task_not_finished:
plan()
execute_tools()
verify_result()
if failed:
update_plan()
continue
if all_requirements_passed:
finish()
看起来很简单。
但真正决定Agent产品体验的,恰恰就是这个循环能不能跑稳。
06|为什么这件事也和多模型平台有关
Harness并不只属于编程Agent。
只要AI开始从“回答问题”走向“完成任务”,都会遇到同样的问题。
比如做一条AI短剧。
文本模型先拆剧情。
图像模型生成角色和场景。
视频模型完成镜头。
音频模型继续完成声音。
最后还可能把结果整理成PPT。
这时候,真正重要的就不只是“平台有多少模型”。
而是这些模型能不能被放进同一个任务里协同工作。
创源AIGC目前聚合了500+AI模型。
同时提供智能体、无限画布、AI漫剧、AI PPT、图片、视频、音频和对话等能力。
多模型工作区下一步真正值得做的,不只是增加模型数量,而是把Router、Workflow、Memory、Tool和Quality Gate真正连起来。
创源AIGC
https://178.nz/bo
500+AI模型、智能体、无限画布、AI漫剧、AI PPT等能力集中在同一个创作工作区。
07|如果DeepSeek以后真的做自己的Harness,我更关注这4件事
第一,Context选择是不是足够准。
第二,工具和沙箱是不是足够稳定。
第三,测试失败后的恢复循环是不是足够聪明。
第四,Pro、Flash甚至第三方模型能不能在同一个任务里合理分工。
最后
过去AI产品的主角是模型。
大家每天追参数。
追榜单。
追上下文长度。
但Agent时代开始以后,真正决定产品能不能长期工作的,会越来越多地转移到模型之外。
Context怎么给。
工具怎么管。
失败怎么恢复。
结果怎么验收。
模型怎么分工。
Model决定Agent有多聪明,Harness决定它能不能真正把事情做完。
更多推荐


所有评论(0)