进化方向2:内置评测闭环 思考、设计与实现

作者:DeepSeek Harness
代码:https://gitee.com/ZachPineappleman/dsh_benchmark_plugin.git

DeepSeek Harness Evolution #2: Built-in Evaluation Loop — Design, Theory, and Implementation

摘要

随着大语言模型(LLM)从对话工具演进为自主行动体,agent harness(智能体框架)已成为决定 agent 性能的关键变量1,而评测基础设施——用于度量、比较与回归 agent 行为的系统——却长期滞后。本文针对 DeepSeek Harness(dsh)的评测能力空白,设计与实现了一个内置评测闭环插件 dsh-benchmark。通过对现有评测生态的系统分析,我们提炼出四个核心缺陷:(G1)依赖实时 LLM 推理导致回归与消融成本高昂;(G2)无法隔离"模型变更"与"harness 变更"的指标波动;(G3)重最终结果、轻过程诊断;(G4)多 Agent 场景评测薄弱且汇总链路有损。 针对这些缺陷,本文提出三大创新点:(N1)零 token 离线回放回归——复用 dsh 的 llm-replay 机制,在严格边界(只允许替换 harness 层组件、禁止篡改模型输出)下实现 harness 消融回归,正面回应了 Replay Gap2 对静态回放局限性的质疑;(N2)确定性评测——HTTP live/record/mock 三模式录制回放与环境指纹采集,消除网络与环境噪声,支持"模型 vs harness"变量归因;(N3)分级验证体系——compiled/external-verifier/vote/model-self 四级裁判显式标注,配以程序化收答案模式,使评测可信度可审计。实现基于 dsh 底层设施(Python SDK、SessionEvent 事件溯源日志、llm-replay、headless 模式),不侵入 dsh 内核。74 项自动化测试与端到端示例验证了评测闭环的可用性:replay 模式实现零 token 回归、基线 diff 正确标记 pass→fail 回归、HTTP mock 保证确定性、程序化收答案量化交接丢失率。本文评测闭环不仅填补了 dsh 的评测空白,也为 AHE3、Harness-R14 等 harness 自动演化工作提供了可度量的评估支柱。

关键词:agent harness;评测闭环;离线回放;回归测试;确定性评测;分级验证;DeepSeek Harness;LLM Agent


1 引言

1.1 背景:Agent 评测的困境

LLM agent 正从"对话工具"演变为"可执行系统"——它们调用工具、修改工作区、产出具体工件。在这种工作流中,agent 的性能不仅取决于基座模型,还取决于 harness:管理上下文、工具、状态、约束、权限、追踪与恢复的系统层1。然而,现有基准评测普遍存在结构性缺陷:Harness-Bench 指出"现有基准通常抽象掉执行层,把完整 harness 与裸模型混为一谈"1;AgentCompass 指出评测流水线"高度碎片化且紧耦合"5;Protocol Validity 研究质疑"agent 基准是否真的度量了能力"6

DeepSeek Harness(dsh)作为"一切皆插件"的 agent harness,其底层设施——Python SDK、SessionEvent 事件溯源日志、llm-replay 离线回放、headless 模式——已经为评测闭环提供了完整的原料(详见第 3 章),但评测的上层编排(runner、指标、基线、报告)完全缺失。这正是本文的切入点。

1.2 问题陈述

本文围绕以下研究问题展开:

  • RQ1:如何利用 dsh 已有设施,构建一个零 token 成本的评测回归机制?
  • RQ2:如何使评测结果可归因——区分指标波动来自模型更新还是 harness 改动?
  • RQ3:如何让评测的可信度显式化——区分"可编译裁判"与"模型自评"?
  • RQ4:如何支持多 Agent 场景的程序化结果聚合,避免自然语言汇总的信息损失?

1.3 贡献

  1. 系统性评测设施盘点与 Gap 分析(第 3 章):梳理 dsh 可复用的评测原料,从文献中提炼四大 Gap。
  2. 三大创新点(第 4–6 章):零 token 离线回放回归、确定性评测、分级验证体系。
  3. dsh-benchmark 插件(第 5–6 章):完整实现评测闭环,74 项测试验证。
  4. 评估(第 7 章):验证回放回归、组件消融、确定性、程序化收答案的有效性。

1.4 论文组织

第 2 章回顾相关工作;第 3 章分析 dsh 评测设施并提炼 Gap;第 4 章给出系统设计;第 5 章描述实现;第 6 章聚焦三大创新点的技术细节;第 7 章评估;第 8 章讨论;第 9 章结论。


2 相关工作

2.1 Agent 评测基准

AgentBench7(2023)构建了覆盖操作系统、数据库、知识图谱等场景的通用多工具 Agent 基准,但评测依赖实时 LLM 推理、只看最终结果,缺少轨迹级分析与离线回放。SWE-bench8(2023)聚焦真实 GitHub issue 的代码修复,成为 coding-agent 的事实标准,但同样受限于高 token 成本与无法隔离 harness 变量。近期工作开始关注评测质量本身:Protocol Validity6 质疑基准的协议有效性;Transcript Analysis9 用 AI 扫描器检测基准缺陷(ground truth 访问、工具失败、猜测漏洞、答案格式歧义);How Many Tasks10 用回放分析部分任务预算的结论稳定性。AgentCompass5 提出统一评测基础设施,但聚焦跨 benchmark 统一,未提供离线回放与 harness 消融。

2.2 Harness 评测与消融

Harness-Bench1(2026)首次系统测量 harness 效应:同一模型在不同 harness 配置下性能差异显著,且现有基准无法隔离该效应——这是本文 Gap 2 的直接文献支撑。Agent Harness Survey(EFC)11 提出 Effective Feedback Compute,用轨迹级坐标区分"有用反馈"与"冗余交互",启示评测不应只看最终结果。AHE3 提出 harness 自动演化的三支柱闭环(组件可观测、经验可观测、闭环评估),其评估支柱正是本文评测闭环的定位。Harness-R14 从失败轨迹学习编辑可执行 harness,并明确警告"只看轨迹会过拟合,必须 hold-out 评测集"——支撑本文基线与环境指纹设计。

2.3 轨迹回放与确定性评测

Replay Gap2(2026)是本文必须正面回应的质疑:它指出"回放已记录轨迹、替换另一模型输出"的静态评测假设(轨迹其余部分不受影响)可能失效。本文的回应是正交设计:dsh-benchmark 的回放只允许替换 harness 层组件,严格禁止篡改模型输出——即固定模型输出、观察 harness 变化对执行的影响,这与 Replay Gap 批评的"替换模型输出"是不同维度。How Many Tasks10 则证明回放作为评测方法论的正向价值。在 HTTP 录制回放方面,WeChat Record-and-Replay12(2023)展示了工业级录制回放的可行性;opencode 的 http-recorder 提供了 cassette 设计参考。

2.4 确定性评测的工业证据

本文 N2(确定性评测)的紧迫性有权威工业证据支撑。AnthropicQuantifying Infrastructure Noise in Agentic Coding Evals13(2026)中量化显示:基础设施配置(硬件/并行度/环境)可使 agent 编程评测结果波动数个百分点,甚至可能混淆高性能模型之间的真实差距——这直接证明"评测结果可归因"(区分模型与 harness/环境变量)是评测基础设施的核心要求。Arena14(ACM 2025)提出在固定模型条件下评测 agent 框架——与本文"固定模型输出、只改 harness 层"的回放设计同一思想,验证了该范式的正当性。Terminal-Bench 215(2026)提供真实 CLI 环境的硬任务基准,AHE3 用其验证 harness 演化效果(84.7% pass@1)——展示了"评测基准 + harness 消融"组合的可行性。τ-bench16(2024)与 GAIA17(2023)分别覆盖工具-代理-用户交互与通用助手场景,是评测生态的补充参照。

2.5 多 Agent 评测与验证外置

EvoMap18 的实证(子 agent 算对 373 题、自然语言汇总丢 166 题、保留率 55.5%)揭示了多 Agent 评测的汇总损耗问题——这是本文"程序化收答案"模式的直接动机。PARL19 提出编排奖励设计(并行加速、拆分正确性、聚合质量),为多 Agent 评测的编排质量指标提供参考。验证外置思想(Apodex 的 Local/Global Verifier、AlphaProof 的 Lean 编译器裁判)确立"生成者不能兼任裁判"原则,支撑本文分级验证体系。Agents Catching Agents20 揭示临床多 agent 系统的捷径级联与基准作弊——进一步强化评测可信度(验证级别显式化)的必要性。

2.6 行业实践:AI Agent 测评平台("龙虾大学"生态)

2026 年兴起的 AI Agent 测评平台生态(社区戏称"龙虾大学",以 OpenClaw 等 Claw 系 agent 为对象)验证了"agent 能力需量化评测"这一需求,也暴露了第三方通用评测的共性缺口。代表性实践包括:

  • 龙虾智商测试(ClawSchool):以 skill 形式分发(clawdbot install teamolab/clawschool),agent 经 exec curl 调 API 取题、执行、提交证据评分;12 题/130 分/90 分钟。其防作弊约束(强制 curl、禁 web 工具、禁 TLS 绕过、非 JSON 即停)与本文"mock 未录制请求 fail-closed"同思路21
  • 虾佛大学(Clawvard):自称"全球首个个人 AI Agent 测试平台",50,000+ agent 完成测评。其官方研究《We Tested 45,000 AI Agents》基于 20,070 份有效评测,采用 16 题 + LLM-as-Judge + 专有评分算法,覆盖理解/执行/检索/推理/反思/工具/情商/记忆 8 维度22关键发现是"执行(Execution)是所有 agent 的短板"(均值 75.0,Memory 86.5 居首),并定义"Think-Do Gap"(Reasoning − Execution 全为正)——模型能想清楚但做不成事,根源在 Agent 架构、工具链与提示词工程(即 harness 层)。这一实证直接支撑本文 Gap 3(重结果轻轨迹)与"评测应量化执行类指标"的立场。
  • 龙虾大学(Claw Campus):提出 IQ(逻辑/代码)/EQ(语境/共情)/SQ(安全边界)三支柱评测与 L1-L5 执业资格认证,以及"影子模式"(agent 接入真实业务流评估后再上线)23

对比定位:上述平台均为第三方通用评测——每次测试需 agent 现场跑题(耗 token)、裁判依赖 LLM-as-Judge(属本文验证级别的 model-self/投票级)、不支持离线回放与 harness 组件消融。本文 dsh-benchmark 的差异化正在于:replay 零 token 回归、compiled 级可编译裁判、固定模型输出只改 harness 层的消融、以及程序化收答案——恰可回应 Clawvard 研究揭示的"执行短板"(执行正是 harness 层可系统改善的维度)。


3 理论基础:dsh 评测设施盘点与 Gap 分析

3.1 dsh 可复用的评测原料

对 dsh 仓库(v0.1.0-rc.5)的一手研读表明,评测闭环的底层原料已完整

设施 接口 评测用途
Python SDK DeepSeekHarness.run()RunResult{final_response, finish_reason, events} 程序化驱动真实 agent
SessionEvent 日志 session/event 广播;assistant/messageusage 完整轨迹与 token 计量数据源
llm-replay fixture=session JSONL,按 (turn,step) 重建模型流,零 API key 离线回放回归的核心
acp-snapshot normalizer 时间清零、cwd token 化、prompt/schema 脱敏 环境稳定化与轨迹可比性
headless 模式 dsh --profile headless "任务" 进程级隔离的批量执行

关键洞察:评测闭环是"消费者"——消费 SDK、事件流与 replay,不侵入 dsh 内核。这使评测插件的实现与 dsh 版本解耦。

3.2 四大研究 Gap(文献支撑)

Gap 描述 文献支撑
G1 现有评测依赖实时 LLM 推理,回归/消融 token 成本高昂 AgentBench7、SWE-bench8
G2 无法隔离"模型变更 vs harness 变更"的指标波动 Harness-Bench1、EFC11、AHE3
G3 重最终结果、轻过程诊断;轨迹级指标缺失 Transcript Analysis9、EFC11
G4 多 Agent 评测汇总链路有损;裁判可信度不可知 EvoMap18、Protocol Validity6

3.3 理论支撑

  1. 事件溯源与可重放性:会话日志是唯一真源,“模型可见即已记录”——回放回归的理论基础。
  2. 可逆副作用与插件化:harness 组件可替换、可撤销——"只改 harness 层"消融的架构前提。
  3. 验证外置:生成者不能兼任裁判;验证梯度 compiled > external > vote > model-self。
  4. 确定性第一纪律:能用确定性程序做的调度与汇总,就别交给 LLM18
  5. Replay 边界理论:静态回放的局限2——本文 replay 模式的适用边界声明。

4 系统设计:内置评测闭环架构

4.1 设计原则

  1. 复用不重造:llm-replay(离线回放)、Python SDK(驱动)、SessionEvent 日志(轨迹)、acp-snapshot normalizer(稳定化)全部复用;只新建"编排层"(用例/执行/断言/指标/基线/报告)。
  2. 不侵入内核:全部能力为独立 CLI + SDK;不修改 dsh packages/
  3. 确定性优先:HTTP 录制回放 + 环境指纹 + 固定种子,消除网络/环境噪声(回应 G2)。
  4. 可信度显式:每条用例输出验证级别(compiled/external-verifier/vote/model-self),不混淆裁判类型(回应 G3/G4)。
  5. 回放边界严格:replay 只允许替换 harness 层组件,禁止篡改模型输出;违规配置直接报错(回应 Replay Gap)。
  6. 程序化收答案:多 agent 评测默认"结果写盘 → 程序收集拼接",杜绝协调模型重读汇总(回应 G4)。
  7. fail-closed 安全:评测会话继承 dsh 沙箱与权限策略;不能绕过安全规则。

4.2 总体架构

dsh-benchmark 的架构如图 1 所示,分为八个模块:

在这里插入图片描述

图 1:接口层(CLI/SDK)→ 用例管理层 → 执行引擎(real-llm/replay 双模式)→ 确定性层 + 断言验证层 → 指标管道 + 基线回归 → 报告输出 + 容错安全。底层复用 dsh 设施,不侵入内核。

模块 职责 对应 Gap
接口层(CLI/SDK) dsh-benchmark 命令、runBenchmark() SDK、CI 退出码
用例管理层 YAML 加载/校验/过滤/模板复用/唯一性
执行引擎 real-llm(SDK/headless)+ replay(llm-replay 离线)双模式 G1
确定性层 HTTP live/record/mock + 环境指纹 + 种子 G2
断言与验证 13 种断言器 + 四级验证 + 程序化收答案 G3/G4
指标管道 单 agent/多 agent 指标 + 失败分类 G3
基线回归 baseline save/diff + 环境指纹校验 G1/G2
报告输出/容错 JSON/Markdown 报告 + 重试/断点/flaky/沙箱

4.3 用例模型

用例以 YAML 声明(BenchmarkCase),核心字段:id(唯一)、descriptionmode(real-llm/replay)、tagstimeoutSecworkspaceTemplatepromptassertsverificationprogrammaticCollectreplay。静态校验在加载期完成(缺失字段、非法类型、未知断言/验证级别、replay 缺轨迹均提前报错),避免运行期失败。

4.4 双模式执行引擎

real-llm 模式:经 Python SDK(DeepSeekHarness)或 headless 子进程驱动真实 agent;每条用例独立 session_id + 独立隔离 workspace(从模板快照重置);并发调度(maxConcurrency)与超时熔断(timeoutSec)。产出 final_response/finish_reason/events 结构化结果。

replay 模式(图 2):复用 llm-replay 概念,从录制 session JSONL 离线重跑,零 token 消耗。这是对 G1(回归成本高)的核心回应,也是对 Replay Gap 质疑的正交设计。


5 核心创新点 N1:零 token 离线回放回归

5.1 与 Replay Gap 的正交设计

Replay Gap2 指出"回放轨迹 + 替换模型输出"的静态评测可能评错世界。dsh-benchmark 的设计与之正交(图 2):固定模型输出(从录制轨迹重建)、只允许替换 harness 层组件,观察 harness 变更对执行的影响。这在数学上等价于"在固定输入分布下做 harness 组件的消融实验",避免了 Replay Gap 批评的轨迹偏离问题。
在这里插入图片描述

图 2:左为 Replay Gap 批评的做法(替换模型输出导致轨迹偏离);右为本文做法(固定模型输出、只改 harness 层);底部为 replay 执行流程与边界红线。

5.2 实现:从 session JSONL 派生执行视图

parseSessionLog() 解析 dsh 持久化的 SessionEvent 日志(容忍撕裂尾部、校验 seq 连续性);deriveViewFromEvents() 按事件类型提取:

  • assistant/message → finalResponse 与 token 用量(usage 字段)
  • tool/call + tool/result → 工具调用记录(含 isError/content)
  • step/start/step/end → 步骤数
  • turn/end → finishReason

5.3 边界红线

forbidModelOutputChange 在解析层恒置 true,任何"篡改模型输出"的配置都被拒绝(PRS D2-105)。用途明确声明为回归/消融,不用于跨模型对比。


6 核心创新点 N2/N3:确定性评测与分级验证

6.1 确定性评测(N2)

HTTP 录制/回放installHttpRecorder)实现三模式:live(透传真实网络)、record(录制请求-响应到 JSON cassette)、mock(拦截网络返回录制响应,未录制请求直接失败)。cassette 匹配采用规范化 URL + 规范化 body(JSON 键排序),对应 opencode http-recorder 的 canonicalizeJson 思想。

环境指纹采集collectEnvFingerprint):dsh 版本、插件列表、模型配置、随机种子、时间戳 → 写入 run-meta.json,哈希后用于基线兼容性校验(版本差异过大时警告对比有效性下降)。这使"模型变更 vs harness 变更"的归因成为可能(回应 G2)。

确定性必要性的工业证据:Anthropic 量化了 agentic coding eval 中的基础设施噪声(硬件/并行度/环境配置)可使结果波动数个百分点13;Arena 在固定模型条件下评测 agent 框架,展示了隔离框架变量的范式14。dsh-benchmark 的 HTTP 录制回放 + 环境指纹正是对这两类噪声的工程回应——评测结果应可复现、可归因,而非随环境漂移。

6.2 分级验证体系(N3)

基于"验证外置"原则(生成者不能兼任裁判),每条用例的验证结果携带 verification_level 标签(图 3):

级别 可信度 判定方式
compiled ★★★★★ 外部可执行程序(Lean/sqllogictest),退出码+stdout
external-verifier ★★★★ 独立工具/agent 核验,不依赖主 agent 输出
vote ★★★ 多份独立输出投票,记录分歧度
model-self ★★ 主 agent 自评,显式标记最低可信度

6.3 程序化收答案

collectProgrammaticResults() 从指定目录收集子 agent 的 JSON 结果(杜绝协调模型重读汇总);handoffLossRate() 计算交接丢失率,对标 Evomap 55.5% 保留率基线。这是对 G4 的直接回应。

在这里插入图片描述
图 3:左为四级验证(compiled > external-verifier > vote > model-self);右为程序化收答案(子 agent 结果写盘 → 确定性程序收集,禁止模型重读汇总)。


7 实现:dsh-benchmark 插件

7.1 模块结构

benchmark-plugin/
├── package.json / tsconfig.json / vitest.config.ts
├── bin/dsh-benchmark.js      # CLI 入口(构建产物优先,开发模式走 tsx)
├── src/
│   ├── index.ts              # 编排:加载→过滤→执行→验证→指标→基线→报告
│   ├── cli.ts / dev-cli.ts   # 命令行解析与入口
│   ├── cases.ts              # 用例 YAML 加载/校验/过滤
│   ├── mini-yaml.ts          # 零依赖 YAML 子集解析器
│   ├── runner.ts             # 执行引擎(并发/超时/隔离/失败分类)
│   ├── replay.ts             # 离线回放(session JSONL → 执行视图)
│   ├── determinism.ts        # HTTP 录制回放 + 环境指纹
│   ├── asserts.ts            # 13 种断言器
│   ├── verify.ts             # 分级验证 + 程序化收答案
│   ├── metrics.ts            # 指标汇总
│   ├── baseline.ts           # 基线保存/diff
│   ├── report.ts             # JSON/Markdown 报告
│   └── fault.ts              # 容错(重试/断点/flaky)
└── tests/                    # 74 项测试

7.2 关键技术决策

  1. 零运行时依赖:mini-yaml 自实现 YAML 子集(支持评测用例所需语法),避免外部依赖与供应链风险。
  2. 执行器适配器模式:runner 通过 ExecutorAdapter 接口与真实执行解耦,测试用 FakeExecutor 注入,保证两种模式可测性一致。
  3. 迷你 YAML 解析器 Bug 修复:实现中发现并修复了 ElementTree 真值判断陷阱(bool(element)==Falselen(element)==0),启示评测工具自身的健壮性同样需要测试覆盖。

7.3 CLI 与退出码

dsh-benchmark run | replay | baseline-save | baseline-list | baseline-rm | list-cases

退出码:0 全过 / 1 回归或断言失败 / 2 配置错误 / 3 执行崩溃 / 4 flaky(CI 友好)。


8 评估

8.1 实验设置

  • 测试规模:74 项自动化测试(cases 9、mini-yaml 8、asserts 9、replay 5、determinism 5、verify 5、metrics-baseline 7、runner 7、fault 7、integration 5+ e2e)。
  • 运行环境:Node.js v24、本地 HTTP server(确定性测试不依赖外网)。
  • 示例用例examples/cases/(smoke 冒烟 + replay 回放回归),examples/sessions/(录制轨迹)。

8.2 有效性实验 1:零 token 回放回归

设置:录制 greet 会话轨迹 → 用 replay 模式离线重跑 → 断言通过(100%)。结果:replay 模式下 token 消耗为 0(不调用真实 LLM),指标从录制轨迹派生(input 120 / output 60 / 1 step / 1 tool call),报告正确产出。

回归检测:构造"broken"轨迹(模型回复不含工具调用)→ 断言失败 → assert_fail 分类 → 基线 diff 标记。验证了"录制一次、反复分析、harness 变更可检测"的回放方法论(对应 How Many Tasks10 的回放分析思路)。

8.3 有效性实验 2:确定性验证

设置:本地 HTTP server + record 模式录制 → mock 模式回放。结果

  • mock 模式返回录制响应,不访问网络(确定性达成);
  • 未录制请求 fail-closed 报错(防止意外网络访问);
  • 环境指纹哈希确定性(相同输入相同输出)。

8.4 有效性实验 3:程序化收答案与交接丢失率

设置collectProgrammaticResults() 收集目录 JSON 结果;handoffLossRate() 计算丢失率。结果:正确收集排序结果;交接丢失率计算对标 Evomap 基线(373→207 丢 166,保留率 55.5%)。

8.5 有效性实验 4:基线回归

设置:baseline-save v1 → 修改执行行为 → run --baseline v1。结果:pass→fail 正确标记为回归(summary.regressions == 1)、fail→pass 标记为提升;CLI 退出码 1 触发。

8.6 局限

  1. real-llm 模式依赖 headless:工具调用记录从 stdout 启发式提取(完整实现应从 session/event 解析)。
  2. replay 只读分析为主:当前聚焦轨迹回放分析;"harness 补丁重跑"提供配置骨架(完整重跑需接入 llm-replay 插件)。
  3. HTTP 回放替换全局 fetch:适用于评测子进程;生产环境需注意 dispose 恢复。
  4. LLM 采样随机性:real-llm 模式无法完全消除;replay 模式隔离了该变量(这正是其价值)。

9 讨论

9.1 与 AHE / Harness-R1 / Self-Harness 的关系

本文评测闭环是 harness 自动演化工作的评估支柱:AHE3 的闭环需要"编辑 harness → 重跑 → 结果反馈",本文 replay 模式(固定模型输出、只改 harness 层)恰好提供确定性反馈;Harness-R14 的"失败轨迹 → 修复运行时"训练需要 hold-out 评测集防过拟合,本文基线 + 环境指纹设计支撑该约束。Self-Harness24 进一步展示了 harness 自我改进的可行性——其"评估→改进"循环同样依赖可度量的评测反馈,本文 dsh-benchmark 可作为其在 dsh 生态中的评估底座。Terminal-Bench 215 则提供了评测基准与 harness 消融组合的实测参照(AHE 的 84.7% pass@1 即在真实 CLI 任务上验证)。

9.2 评测可信度与过拟合

  • 基准作弊防御:分级验证 + 拒绝结构化 UNKNOWN_TOOL 结果(吸收 acp-snapshot 的守卫)。
  • 过拟合警告:Harness 演化容易在单基准上过拟合425,本文基线 diff 支持跨运行对比,环境指纹帮助识别"不同环境下的无意义对比"。

9.3 工程权衡

  • 确定性 vs 真实度:replay 牺牲"真实 LLM 行为"换取"零成本 + 可复现";两者互补(replay 做回归/消融,real-llm 做最终验收)。
  • 零依赖 vs 功能完整:mini-yaml 子集牺牲部分 YAML 语法换取无供应链依赖;对评测用例足够。

10 结论与展望

本文针对 DeepSeek Harness 的评测能力空白,设计并实现了 dsh-benchmark 内置评测闭环。三大创新点——零 token 离线回放回归、确定性评测、分级验证体系——分别回应了现有评测生态的四大缺陷(依赖实时 LLM、变量难隔离、重结果轻轨迹、多 Agent 汇总有损)。74 项自动化测试与端到端示例验证了其可用性。评测闭环不仅填补了 dsh 的评测空白,也为 harness 自动演化(AHE/Harness-R1)提供了可度量的评估支柱。

展望

  1. 与方向 8(多 Agent)联动:完整的多 Agent 编排评测(递归 planner、冲突治理的自动化验证)。
  2. 与方向 13(Harness 演化)联动:评测闭环作为"Trajectory + Evaluator + Harness Editor"自我优化闭环的 Evaluator。
  3. 完整 llm-replay 集成:接入 @deepseek-ai/dsh-llm-replay 实现真正的"harness 补丁重跑"。
  4. 轨迹级指标深化:吸收 EFC11 的有效反馈计算,度量"有用反馈 vs 冗余交互"。

参考文献


  1. Y. Yao, X. Tan, et al. Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows. 2026. arXiv:2605.27922. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  2. A. Gonuguntla. The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World. 2026. arXiv:2608.08239. ↩︎ ↩︎ ↩︎ ↩︎

  3. Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses. 2026. arXiv:2604.25850. ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  4. Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories. 2026. arXiv:2608.02276. ↩︎ ↩︎ ↩︎ ↩︎

  5. K. Chen, et al. AgentCompass: A Unified Evaluation Infrastructure for Agent Capabilities. 2026. arXiv:2607.13705. ↩︎ ↩︎

  6. Do Agent Benchmarks Measure Capability? Protocol Validity in the Age of Agentic AI. 2026. arXiv:2607.22368. ↩︎ ↩︎ ↩︎

  7. X. Liu, H. Yu, H. Zhang, et al. AgentBench: Evaluating LLMs as Agents. ICLR 2024. arXiv:2308.03688. ↩︎ ↩︎

  8. C. E. Jimenez, J. Yang, A. Wettig, et al. SWE-bench: Can Language Models Resolve Real-World GitHub Issues?. ICLR 2024. arXiv:2310.06770. ↩︎ ↩︎

  9. Automated Transcript Analysis for Detecting Flaws in Agentic Benchmarks. 2026. arXiv:2607.27518. ↩︎ ↩︎

  10. W.-J. Huang, et al. How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks. 2026. arXiv:2607.12338. ↩︎ ↩︎ ↩︎

  11. X. Zhang, D. Wang, et al. Scaling Laws for Agent Harnesses via Effective Feedback Compute. 2026. arXiv:2605.29682. ↩︎ ↩︎ ↩︎ ↩︎

  12. Towards Efficient Record and Replay: A Case Study in WeChat. 2023. arXiv:2308.06657. ↩︎

  13. Anthropic. Quantifying Infrastructure Noise in Agentic Coding Evals. 2026. https://www.anthropic.com/engineering/infrastructure-noise ↩︎ ↩︎

  14. Arena: Benchmarking AI Agent Frameworks Under Fixed-Model Conditions. ACM Conf. on AI and Agentic Systems, 2025. https://dl.acm.org/doi/10.1145/3786335.3813233 ↩︎ ↩︎

  15. Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces(Terminal-Bench 2). 2026. arXiv:2601.11868. ↩︎ ↩︎

  16. τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains. 2024. arXiv:2406.12045. ↩︎

  17. G. Mialon, R. Fourrier, et al. GAIA: A Benchmark for General AI Assistants. 2023. arXiv:2311.12983. ↩︎

  18. Behind EvoMap: Characterizing a Self-Evolving Agent-to-Agent Collaboration Network. 2026. arXiv:2605.25815. ↩︎ ↩︎ ↩︎

  19. Reinforcement Learning for LLM-based Multi-Agent Systems through Orchestration Traces. 2026. arXiv:2605.02801. ↩︎

  20. Agents Catching Agents: Shortcut Cascades and Benchmark Gaming in Clinical Multi-Agent Systems. 2026. arXiv:2608.03744. ↩︎

  21. ClawSchool. 龙虾学校智力测试(ClawSchool IQ Test)——AI Agent Skill,经 clawdbot install teamolab/clawschool 分发,调用 clawschool.teamolab.com 测试 API(行业实践,非学术文献)。 ↩︎

  22. Clawvard. We Tested 45,000 AI Agents — the bottleneck isn’t intelligence, it’s execution. 2026-04. https://clawvard.school/blog/agent-bottleneck-2026(行业研究报告)。 ↩︎

  23. Claw Campus(龙虾大学). 考试中心:IQ/EQ/SQ 三支柱评测与 L1-L5 执业资格认证. 2026. https://www.clawcampus.cn(行业实践平台)。 ↩︎

  24. H. Zhang, et al. Self-Harness: Harnesses That Improve Themselves. 2026. arXiv:2606.09498. ↩︎

  25. Rethinking the Evaluation of Harness Evolution for Agents. 2026. arXiv:2607.12227. ↩︎

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐