← 文章

2026.02.23

“SOTA”还有意义么?

SOTA,state of the art,代表当前顶尖水平。

在 AI、机器学习、LLM、Agent 等领域,SOTA 几乎是每天都会出现的词,意思就是“在这个任务/基准/领域里,目前已知的最好成绩/模型/方法”

LLM / Agent领域最热闹的事就是各种刷榜晒成绩单。 大模型厂商都在 LMArena厮杀, 每家都在人类最后的考试上争取亮眼表现。

Agent领域WebArena、AgentBench、GAIA、ToolBench考场也好不热闹。 ……谁刷到SOTA谁就出名, 论文好发,融资好谈,招聘也香。

过去一年大厂刷SOTA,还能抓抓眼球

今年,对于大部分AI创业者做这个SOTA 实在是没!意!义!了!

为什么? 因为公开赛场的SOTA和能不能产生用户价值没啥直接关系(尽管bench管理者都说有用) 它跟帮用户开源节流,脱节的一塌糊涂。

其一,现在榜单已经被“训练”烂了 ,

某个benchboard最火,也最容易成为被糟践的,一旦成为公认靶子,数据污染、提示词泄漏、评测漏洞利用就层出不穷。

LLM模型能做好人类最后一道数学题,

不代表能写好代码,不代表能撰写好ppt, 不代表能做好市场调研,

不代表能操控好电动窗帘, 很多模型一刷榜就高分,一用就跑火车。 公开榜单追求“通用性”,

这些考场它测的不是用户真正关心的东西

真实场景永远是垂直的、私有的、高价值的。 公司的审批流程、CRM数据查询 、

金融合规检查、医疗报告 、

工厂排程、供应链异常处理 ,

这些东西公开数据集很难覆盖到。

真正决定Agent上限的,

不是模型,,也不是prompt, 而是你自己建的eval框架和评估集。 公开的Bench是给投资人和外行人看热闹的。 内部的Eval才是锤炼自己的产品的硬核考场。

有三点认知:

第一,Agent、Eval、Model彻底解耦。 Agent只管怎么尽可能满足Eval, Eval只管规则能不能真实反映用户价值, Model只是可替换的黑盒。 过度耦合上面三者死得快。

第二,Eval框架的水平≈Agent的真实天花板。 你用HTTP 200当成功率,能测出99%通过; 但是用严格的rubric+LLM Judge,

可能掉到70%; 再换成用户真实满意度+长期ROI闭环,

可能只有30%。 数字越接近真相,说明你的Eval越牛。

第三,泛化目标驱动不了Agent进化,只有场景才能。 定一个“通用Agent搞定一切”的目标, 最后只会做出一堆浅尝辄止的任务集。 反而是先死磕1–2个高用户价值的场景, 把Eval做深、把Failure Mode卡死、 把Rubric写透,

Agent才会真的往有价值的方向进化。

现在市面上两条路, 一条路,继续卷公开Bench成绩但,

用于发论文、刷存在感、讲故事给投资人 另一条路,先找准能产生真金白银的场景, 自建深度评估集,死磕到能让用户笑出声, 前者热闹,看起来很强,实际没法用。 后者难,但能发展。

做法并不复杂。 先锁定最痛、最值钱的1–2个场景。 从真实用户日志、工单、

到客服对话里采样任务, 人工标注gold路径和拒绝条件。 定制多维度rubric,

不同场景权重完全不一样, 收集用户说不满意但Eval过了的案例, 反哺回Eval集继续迭代, 这个闭环跑得越快,

Agent就越贴近能落地的形态。

公开Bench的SOTA是面子, 基于场景的Eval才是里子。 它的本质是对用户价值的深度洞察。

把里子做扎实,短期没那么shinning, 这是长期边际效益最大的功夫。 这是让fails驱动价值的方法论。

是AI产品设计的精要所在,仅此而已。


原文链接:https://mp.weixin.qq.com/s/sdJ36OzNG-eqWUZDgeqt9g

来源:XT

本文所属主题:产品管理AI 工程 枢纽 →

相关文章