← 文章

2026.08.18

DeepSeek Harness的另一种价值

DeepSeek Harness最近发布,又引来一通热议。很多人把DPH当成了一个个人使用的agent,这可能误解了它的定位和作用。

对于有经验的开发者而言,利用DPH框架更容易构建一个专业agent系统。

然而对于小白用户而言,想要驾驭好它非常不容易。

DeepSeek Harness (DPH)的本质是一个面向 Agent 工程的“实验基础设施”,而不是一个面向普通用户的 Agent 产品。

它真正擅长的事情,不是替用户完成一个具体任务,而是帮助开发者系统性地回答几个工程问题:

  • 这个模型到底行不行?

  • 这套 Prompt 有没有变好?

  • 换一个工具以后成功率有没有提升?

  • Agent 在什么场景下失败?

  • 失败是模型问题、提示词问题、工具问题,还是上下文和运行时问题?

这套框架是deepseek内部用来做模型评估的agent框架。

模型的训练团队可以用它来去收集训练数据,分析失败,做模型能力评估等工作。

DPH天然适合做 Eval Agent。你可以把一批评估eval cases 放进去,用不同模型、不同 system prompt、不同工具集、不同参数反复跑,再采集完整 trajectory,包括模型输入输出、tool call、tool result、token、latency、错误、最终结果等。

这样它实际上运行流程的是:

评估集Eval Set → Agent Runtime → 轨迹数据Trace/Data Collection → 评估计算Judge → 指标分析Metrics → 比较Compare

这里评估的不只是“模型”。以往benchmark 往往在问GPT-5.6 和 DeepSeek 哪个模型更好?

Harness 更适合问:

对我的 Sales Agent,在这 300 个真实任务上,Model A + Prompt V7 + Search Tool V3,和 Model B + Prompt V9 + Search Tool V4,哪一套 Agent configuration 更好?

这个差异很关键。因为 Agent 最终表现近似于:

Agent Quality = Model × Prompt × Context × Tools × Runtime × Policy

Harness 的价值就在这里,它把这些变量变成可以组合、运行、记录、评估和比较的实验对象。

这个定位跟DPH底层的技术框架有关系。它采用Cordis 开源框架作为基础。

Cordis 更偏向解决“如何动态拼装 Agent Runtime”,Harness 则更像解决“如何运行这些组合并产生实验数据”。两者组合起来,就很容易形成一个 Agent 评估实验平台:

Eval Case

动态装配

Model + Prompt + Tools + Services + Policy

运行 Agent

采集完整 Trace

Judge / Grader

Metrics

实验对比

新的 Prompt / Tool / Agent Version

这也是为什么它对普通终端用户未必有那么大的意义。

普通用户的目标通常是:“帮我订酒店”“帮我写报告”“帮我分析客户”。他们希望看到的是 Task → Result,最好中间复杂性全部隐藏。

而 模型开发者和Harness 开发者关注的是另一套东西:

“为什么失败?”

“这一版是不是比上一版更好?”

“Claude 换 DeepSeek 后退化在哪里?”

“这个 MCP 工具到底贡献了多少?”

“Prompt 改这一句话,成功率变化多少?”

“这个失败 case 能不能加入 regression set?”

普通用户消费的是 Agent 的能力,而 Agent 开发者消费的是 Agent 的可观测性、可实验性和可评估性。

所以,我理解DeepSeek Harness 定义:它不是 Agent Builder,而是 Agent Experiment Harness。

它最有价值的用户并不是“想做一个 AI 助手的人”,而是已经在持续迭代 Agent,并开始面临 eval、regression、trace、dataset、model comparison、prompt optimization、tool evaluation 这些问题的开发者。

再往前一步,它真正有潜力的地方其实不是 Eval UI,而是成为 Agent 的“数据生产线”。

因为一旦 Harness 能持续采集高质量 trajectory,那么这些数据后面不仅可以做 eval,还可以反过来做 failure mining、hard case mining、prompt optimization、tool optimization,甚至为模型后训练准备 SFT / preference / RL 数据。

DeepSeek Harness 是给 Agent 开发者用的实验台和数据采集基础设施。用于搭建 Eval Agent,系统评估 Model、Prompt、Tool 和 Runtime,并把 Agent 的真实运行轨迹沉淀成可以持续迭代的数据资产。

这比“一个 Agent 框架”更接近它真正的价值。


原文链接:https://mp.weixin.qq.com/s/pL1v7Plwjfglv_YgYVu8Sw

来源:XT

本文所属主题:产品管理强化学习 枢纽 →

相关文章