2026.03.27
智能体思考、环境、可观测性,从林俊旸长文中学到的。
目录
最近读到 Qwen 团队林俊旸(Junyang Lin)的一篇长文,从 o1、R1 讲到 agentic thinking,核心判断是:AI 正在经历一次范式转移,从"推理思考"走向"智能体思考"。受这篇文章启发,写下本篇心得。

推理思考:漂亮但封闭的独白
2024 年是推理模型的元年。OpenAI 的 o1 证明了"思考"可以成为一种专门训练的核心能力,DeepSeek 的 R1 证明了这条路可以被复现和规模化。
推理思考的核心范式是给模型更多的"思考时间",让它在回答之前进行更长的内部推导。
数学、代码、逻辑这些有确定性答案的领域成了主战场,这些场景能提供足够强的奖励信号——"对就是对,错就是错"。
推理思考有一个本质局限:它是封闭的。
不管思维链多长,模型从头到尾都在自己脑子里转,不跟外部世界交互。
输入一道题,输出一段文字,整个过程是一条线性路径。这就像一个学生闭卷考试——可以想很久,但不能查资料、不能做实验、不能问同学。
林俊旸在文中坦承了 Qwen3 在混合思考模式上的失败。
试图让一个模型同时擅长"快速简洁地回答"和"深度思考地推理",结果两种行为的数据分布冲突,合并后两边都平庸,最终不得不拆回独立版本。
这种坦诚在大厂技术领导的公开发言中很少见。
推理思考的天花板不在于"想得不够久",而在于"只靠想"这件事本身有极限。
智能体思考:打开那扇通向真实世界的门
林俊旸在文中给出的判断是:下一步是智能体思考(agentic thinking)
为了行动而思考,
在与环境交互的过程中持续更新计划。
推理模型的行为空间其实很窄:
读题→想→写答案。
而Agent 的行为空间则是一棵不断分叉的树。
面对同一个任务,它在每一步都面临大量选择
-
是继续思考,还是去调用一个工具?
-
调哪个工具?传什么参数?
-
拿到结果后是深入追查,还是换一条路?
-
失败了是重试、改策略、还是绕过去?
如果任务是"查一下某个开源项目的安全漏洞"
推理模型只能基于训练时见过的知识,输出一段它"认为"可能存在的分析。
Agent 则可以搜索 CVE 数据库、
去 GitHub 翻 issue、
clone 代码跑扫描工具、
交叉验证多个来源。
Agent每一步都在和真实世界交互,每一步的结果都在改变下一步的决策。
智能体思考,
就是让模型通过行动来推理。
这里面最关键的五个能力是:
-
决定何时停止思考并行动、
-
选择调用哪个工具以什么顺序、
-
整合来自环境的嘈杂或不完整的观察、
-
在失败后修订计划、
-
在多轮交互中保持连贯性。
这里每一条都不是靠"想得更久"能解决的!
环境本身成关键的研究产物。
在推理 RL 时代,环境只是一个"判卷器"。
出一道数学题,模型输出答案,环境判对错。
环境是静态的、简单的、可以被当作基础设施的背景板。
Agent 时代,情况完全不同了。
以前训练模型像培养学生做卷子,只需要出好题。
现在训练 Agent 像培养一个人在真实社会中工作,你得搭建一个逼真的实习环境。
这个环境的建设难度和重要性,不亚于培养学生本身。
Agent 需要在一个能交互、能反馈、能出错的世界里学习和工作。
你得给它搭建工具服务器、
代码执行沙箱、模拟浏览器、
搜索引擎、API 层、记忆系统……
这些东西加在一起,就是"环境"。
这个环境的质量,它有多稳定、多真实、覆盖多少场景、反馈信号有多丰富、能不能防止模型作弊~直接决定了训练出来的 Agent 有多强。
DeepSeek V3.2 的技术报告披露他们合成了 1827 个交互环境、85000+ 条复杂指令来训练 Agent。
造环境的能力本身成了核心竞争力。
可观测性:知道 Agent 做得好不好?
Agent 的行为空间那么大,决策链条那么长,如果你观测不到它在每一步做了什么、为什么失败、哪里在作弊,你就没法构造有效的奖励信号,训练就无法收敛。
可观测性(observability),它不是事后审计,而是闭环的核心组成部分。
我最近分析一些开源Agent系统源码时,发现它们的缺陷都在难于观测。根据黑箱理论,无法观测的系统,也是无法优化的系统。你控制系统的前提源于你的观测手段和能力。
环境 + 可观测 = Agent 演进的引擎,让模型的决策和决策带来的后果形成闭环。
缺了环境,Agent 无处行动;
缺了观测,行动的结果无法回流为改进的依据。
agent,就是环境,设计agent,就是设计环境。好的agent,就是提供好的可观测能力的环境。
原文链接:https://mp.weixin.qq.com/s/dHsFmLBCrEXNBwTGrqYBxw
来源:设计创新阅读思考
相关文章
- 为啥Clawdbot看起来有些AGI的样子了?它的核心技术机制拆解如下:Clawdbot 的核心机制其实挺清晰的,它是一个本地优先、自托管的代理控制平面(agent control plane)。 Gateway…
- AI Agent产品经理的关键技能AI Agent设计,旨在通过感知环境,并利用LLM规划调用工具,采取行动实现特定目标。 Agent的核心在于其推理、逻辑以及访问外部信息的…
- MCP:可以从四个方面理解。在过去,AI Agent只能依赖预训练的数据,缺乏与实时外部资源(如文件、数据库、工具等)互动的能力。 MCP的定义一套通用规则,让AI智能…
- 速览:AI Agent智能体软件的10种分类,以及典型代表。AI Agent 智能体软件的分类维度多样,实际开发中,需要结合多个角度进行设计。将智能体分类,目的是更好地理解 Agent 的能力边界与适…