2026.02.23
“SOTA”还有意义么?

SOTA,state of the art,代表当前顶尖水平。
在 AI、机器学习、LLM、Agent 等领域,SOTA 几乎是每天都会出现的词,意思就是“在这个任务/基准/领域里,目前已知的最好成绩/模型/方法”
LLM / Agent领域最热闹的事就是各种刷榜晒成绩单。 大模型厂商都在 LMArena厮杀, 每家都在人类最后的考试上争取亮眼表现。
Agent领域WebArena、AgentBench、GAIA、ToolBench考场也好不热闹。 ……谁刷到SOTA谁就出名, 论文好发,融资好谈,招聘也香。
过去一年大厂刷SOTA,还能抓抓眼球
今年,对于大部分AI创业者做这个SOTA 实在是没!意!义!了!
为什么? 因为公开赛场的SOTA和能不能产生用户价值没啥直接关系(尽管bench管理者都说有用) 它跟帮用户开源节流,脱节的一塌糊涂。
其一,现在榜单已经被“训练”烂了 ,
某个benchboard最火,也最容易成为被糟践的,一旦成为公认靶子,数据污染、提示词泄漏、评测漏洞利用就层出不穷。
LLM模型能做好人类最后一道数学题,
不代表能写好代码,不代表能撰写好ppt, 不代表能做好市场调研,
不代表能操控好电动窗帘, 很多模型一刷榜就高分,一用就跑火车。 公开榜单追求“通用性”,
这些考场它测的不是用户真正关心的东西
真实场景永远是垂直的、私有的、高价值的。 公司的审批流程、CRM数据查询 、
金融合规检查、医疗报告 、
工厂排程、供应链异常处理 ,
这些东西公开数据集很难覆盖到。
真正决定Agent上限的,
不是模型,,也不是prompt, 而是你自己建的eval框架和评估集。 公开的Bench是给投资人和外行人看热闹的。 内部的Eval才是锤炼自己的产品的硬核考场。
有三点认知:
第一,Agent、Eval、Model彻底解耦。 Agent只管怎么尽可能满足Eval, Eval只管规则能不能真实反映用户价值, Model只是可替换的黑盒。 过度耦合上面三者死得快。
第二,Eval框架的水平≈Agent的真实天花板。 你用HTTP 200当成功率,能测出99%通过; 但是用严格的rubric+LLM Judge,
可能掉到70%; 再换成用户真实满意度+长期ROI闭环,
可能只有30%。 数字越接近真相,说明你的Eval越牛。
第三,泛化目标驱动不了Agent进化,只有场景才能。 定一个“通用Agent搞定一切”的目标, 最后只会做出一堆浅尝辄止的任务集。 反而是先死磕1–2个高用户价值的场景, 把Eval做深、把Failure Mode卡死、 把Rubric写透,
Agent才会真的往有价值的方向进化。
现在市面上两条路, 一条路,继续卷公开Bench成绩但,
用于发论文、刷存在感、讲故事给投资人 另一条路,先找准能产生真金白银的场景, 自建深度评估集,死磕到能让用户笑出声, 前者热闹,看起来很强,实际没法用。 后者难,但能发展。
做法并不复杂。 先锁定最痛、最值钱的1–2个场景。 从真实用户日志、工单、
到客服对话里采样任务, 人工标注gold路径和拒绝条件。 定制多维度rubric,
不同场景权重完全不一样, 收集用户说不满意但Eval过了的案例, 反哺回Eval集继续迭代, 这个闭环跑得越快,
Agent就越贴近能落地的形态。
公开Bench的SOTA是面子, 基于场景的Eval才是里子。 它的本质是对用户价值的深度洞察。
把里子做扎实,短期没那么shinning, 这是长期边际效益最大的功夫。 这是让fails驱动价值的方法论。
是AI产品设计的精要所在,仅此而已。
原文链接:https://mp.weixin.qq.com/s/sdJ36OzNG-eqWUZDgeqt9g
来源:XT
相关文章
- AI Agent震撼来袭,它与传统软件产品到底有哪些不同?2025年,是AI Agent启动的一年。未来十年,软件产品经理工作会分化成两类:一类是做Agent的,一类是其他。 何为AI Agent…
- 这个时候,需要多点儿想象力。改变的秘诀在于,把你全部的能量灌注于新事物的构建,而不是与旧事物的缠斗。 —苏格拉底 3月6日凌晨,一款新AI Agent产品“Manus”…
- Adnan Khan:别把“假设”交给AI“假设”是产品设计的基础。假设跑偏了,AI只能帮倒忙。要把假设和价值判断责任担在人的身上,这是与AI协作的前提。 这篇博客《Don't le…
- 为啥Clawdbot看起来有些AGI的样子了?它的核心技术机制拆解如下:Clawdbot 的核心机制其实挺清晰的,它是一个本地优先、自托管的代理控制平面(agent control plane)。 Gateway…