← 文章

2026.03.27

智能体思考、环境、可观测性,从林俊旸长文中学到的。

目录

最近读到 Qwen 团队林俊旸(Junyang Lin)的一篇长文,从 o1、R1 讲到 agentic thinking,核心判断是:AI 正在经历一次范式转移,从"推理思考"走向"智能体思考"。受这篇文章启发,写下本篇心得。

推理思考:漂亮但封闭的独白

2024 年是推理模型的元年。OpenAI 的 o1 证明了"思考"可以成为一种专门训练的核心能力,DeepSeek 的 R1 证明了这条路可以被复现和规模化。

推理思考的核心范式是给模型更多的"思考时间",让它在回答之前进行更长的内部推导。

数学、代码、逻辑这些有确定性答案的领域成了主战场,这些场景能提供足够强的奖励信号——"对就是对,错就是错"。

推理思考有一个本质局限:它是封闭的

不管思维链多长,模型从头到尾都在自己脑子里转,不跟外部世界交互。

输入一道题,输出一段文字,整个过程是一条线性路径。这就像一个学生闭卷考试——可以想很久,但不能查资料、不能做实验、不能问同学。

林俊旸在文中坦承了 Qwen3 在混合思考模式上的失败。

试图让一个模型同时擅长"快速简洁地回答"和"深度思考地推理",结果两种行为的数据分布冲突,合并后两边都平庸,最终不得不拆回独立版本。

这种坦诚在大厂技术领导的公开发言中很少见。

推理思考的天花板不在于"想得不够久",而在于"只靠想"这件事本身有极限。

智能体思考:打开那扇通向真实世界的门

林俊旸在文中给出的判断是:下一步是智能体思考(agentic thinking)

为了行动而思考,

在与环境交互的过程中持续更新计划

推理模型的行为空间其实很窄:

读题→想→写答案。

而Agent 的行为空间则是一棵不断分叉的树。

面对同一个任务,它在每一步都面临大量选择

  • 是继续思考,还是去调用一个工具?

  • 调哪个工具?传什么参数?

  • 拿到结果后是深入追查,还是换一条路?

  • 失败了是重试、改策略、还是绕过去?

如果任务是"查一下某个开源项目的安全漏洞"

推理模型只能基于训练时见过的知识,输出一段它"认为"可能存在的分析。

Agent 则可以搜索 CVE 数据库、

去 GitHub 翻 issue、

clone 代码跑扫描工具、

交叉验证多个来源。

Agent每一步都在和真实世界交互,每一步的结果都在改变下一步的决策。

智能体思考,

就是让模型通过行动来推理。

这里面最关键的五个能力是:

  1. 决定何时停止思考并行动、

  2. 选择调用哪个工具以什么顺序、

  3. 整合来自环境的嘈杂或不完整的观察、

  4. 在失败后修订计划、

  5. 在多轮交互中保持连贯性。

这里每一条都不是靠"想得更久"能解决的!

环境本身成关键的研究产物。

在推理 RL 时代,环境只是一个"判卷器"。

出一道数学题,模型输出答案,环境判对错。

环境是静态的、简单的、可以被当作基础设施的背景板。

Agent 时代,情况完全不同了。

以前训练模型像培养学生做卷子,只需要出好题。

现在训练 Agent 像培养一个人在真实社会中工作,你得搭建一个逼真的实习环境。

这个环境的建设难度和重要性,不亚于培养学生本身。

Agent 需要在一个能交互、能反馈、能出错的世界里学习和工作。

你得给它搭建工具服务器、

代码执行沙箱、模拟浏览器、

搜索引擎、API 层、记忆系统……

这些东西加在一起,就是"环境"。

这个环境的质量,它有多稳定、多真实、覆盖多少场景、反馈信号有多丰富、能不能防止模型作弊~直接决定了训练出来的 Agent 有多强。

DeepSeek V3.2 的技术报告披露他们合成了 1827 个交互环境、85000+ 条复杂指令来训练 Agent。

造环境的能力本身成了核心竞争力。

可观测性:知道 Agent 做得好不好?

Agent 的行为空间那么大,决策链条那么长,如果你观测不到它在每一步做了什么、为什么失败、哪里在作弊,你就没法构造有效的奖励信号,训练就无法收敛。

可观测性(observability),它不是事后审计,而是闭环的核心组成部分。

我最近分析一些开源Agent系统源码时,发现它们的缺陷都在难于观测。根据黑箱理论,无法观测的系统,也是无法优化的系统。你控制系统的前提源于你的观测手段和能力。

环境 + 可观测 = Agent 演进的引擎,让模型的决策和决策带来的后果形成闭环

缺了环境,Agent 无处行动;

缺了观测,行动的结果无法回流为改进的依据。

agent,就是环境,设计agent,就是设计环境。好的agent,就是提供好的可观测能力的环境。


原文链接:https://mp.weixin.qq.com/s/dHsFmLBCrEXNBwTGrqYBxw

来源:设计创新阅读思考

本文所属主题:AI 工程战略 枢纽 →

相关文章