2026.08.18
DeepSeek Harness的另一种价值

DeepSeek Harness最近发布,又引来一通热议。很多人把DPH当成了一个个人使用的agent,这可能误解了它的定位和作用。
对于有经验的开发者而言,利用DPH框架更容易构建一个专业agent系统。
然而对于小白用户而言,想要驾驭好它非常不容易。
DeepSeek Harness (DPH)的本质是一个面向 Agent 工程的“实验基础设施”,而不是一个面向普通用户的 Agent 产品。
它真正擅长的事情,不是替用户完成一个具体任务,而是帮助开发者系统性地回答几个工程问题:
-
这个模型到底行不行?
-
这套 Prompt 有没有变好?
-
换一个工具以后成功率有没有提升?
-
Agent 在什么场景下失败?
-
失败是模型问题、提示词问题、工具问题,还是上下文和运行时问题?
这套框架是deepseek内部用来做模型评估的agent框架。
模型的训练团队可以用它来去收集训练数据,分析失败,做模型能力评估等工作。
DPH天然适合做 Eval Agent。你可以把一批评估eval cases 放进去,用不同模型、不同 system prompt、不同工具集、不同参数反复跑,再采集完整 trajectory,包括模型输入输出、tool call、tool result、token、latency、错误、最终结果等。
这样它实际上运行流程的是:
评估集Eval Set → Agent Runtime → 轨迹数据Trace/Data Collection → 评估计算Judge → 指标分析Metrics → 比较Compare
这里评估的不只是“模型”。以往benchmark 往往在问GPT-5.6 和 DeepSeek 哪个模型更好?
Harness 更适合问:
对我的 Sales Agent,在这 300 个真实任务上,Model A + Prompt V7 + Search Tool V3,和 Model B + Prompt V9 + Search Tool V4,哪一套 Agent configuration 更好?
这个差异很关键。因为 Agent 最终表现近似于:
Agent Quality = Model × Prompt × Context × Tools × Runtime × Policy
Harness 的价值就在这里,它把这些变量变成可以组合、运行、记录、评估和比较的实验对象。
这个定位跟DPH底层的技术框架有关系。它采用Cordis 开源框架作为基础。
Cordis 更偏向解决“如何动态拼装 Agent Runtime”,Harness 则更像解决“如何运行这些组合并产生实验数据”。两者组合起来,就很容易形成一个 Agent 评估实验平台:
Eval Case
↓
动态装配
Model + Prompt + Tools + Services + Policy
↓
运行 Agent
↓
采集完整 Trace
↓
Judge / Grader
↓
Metrics
↓
实验对比
↓
新的 Prompt / Tool / Agent Version
这也是为什么它对普通终端用户未必有那么大的意义。
普通用户的目标通常是:“帮我订酒店”“帮我写报告”“帮我分析客户”。他们希望看到的是 Task → Result,最好中间复杂性全部隐藏。
而 模型开发者和Harness 开发者关注的是另一套东西:
“为什么失败?”
“这一版是不是比上一版更好?”
“Claude 换 DeepSeek 后退化在哪里?”
“这个 MCP 工具到底贡献了多少?”
“Prompt 改这一句话,成功率变化多少?”
“这个失败 case 能不能加入 regression set?”
普通用户消费的是 Agent 的能力,而 Agent 开发者消费的是 Agent 的可观测性、可实验性和可评估性。
所以,我理解DeepSeek Harness 定义:它不是 Agent Builder,而是 Agent Experiment Harness。
它最有价值的用户并不是“想做一个 AI 助手的人”,而是已经在持续迭代 Agent,并开始面临 eval、regression、trace、dataset、model comparison、prompt optimization、tool evaluation 这些问题的开发者。
再往前一步,它真正有潜力的地方其实不是 Eval UI,而是成为 Agent 的“数据生产线”。
因为一旦 Harness 能持续采集高质量 trajectory,那么这些数据后面不仅可以做 eval,还可以反过来做 failure mining、hard case mining、prompt optimization、tool optimization,甚至为模型后训练准备 SFT / preference / RL 数据。
DeepSeek Harness 是给 Agent 开发者用的实验台和数据采集基础设施。用于搭建 Eval Agent,系统评估 Model、Prompt、Tool 和 Runtime,并把 Agent 的真实运行轨迹沉淀成可以持续迭代的数据资产。
这比“一个 Agent 框架”更接近它真正的价值。
原文链接:https://mp.weixin.qq.com/s/pL1v7Plwjfglv_YgYVu8Sw
来源:XT
相关文章
- Adnan Khan:别把“假设”交给AI“假设”是产品设计的基础。假设跑偏了,AI只能帮倒忙。要把假设和价值判断责任担在人的身上,这是与AI协作的前提。 这篇博客《Don't le…
- OKR/KPI,像一味中药,正在过期发霉很多悄然发生的改变,并不遵循按部就班的剧本,甚至并无规律可言。 很多领域,“目标”已经失效。 我们在进入一个充满不确定性的世界时,不时地顺应…
- 产品设计和开发中,AI替代不了人的那部分AI 生成的视频,10 秒钟惊艳, 1 小时长片的管线一团乱。 AI 生成的app,看起来样子光鲜, 其实交互细节的问题也是很多。 AI让做…
- 最新!山姆·奥特曼的三个观察:通用人工智能将成为推动人类意志力的最大助力......美国时间今天凌晨,OpenAI联合创始人兼首席执行官SamAltman在其个人博客,发布了一篇文章《Three Observations》,…