2025.10.01
Richard Sutton眼中的大模型AI:这是条死胡同
目录

本文基于Sutton(2024年图灵奖得主、强化学习奠基人Richard Sutton)与Dwarkesh Patel的访谈。在这个访谈中,这位RL先驱毫不掩饰地说LLM是个死胡同。
在AI发展历程中,理论分歧与技术路径的碰撞从来就没停过。在这个访谈中,Sutton金句连连,对于AI发展范式带给我们非常不同的角度。
智能的本质:
是模仿?还是探索?
Sutton对LLMs的批判,始于对智能本质的根本性追问。
在他看来,当前以LLMs为代表的生成式AI陷入了对"模仿"的路径依赖,而智能应根植于"探索"与"体验"。这种分歧体现在三个核心维度:目标导向性、世界模型的本质、学习方式的根本差异。
从目标导向性来看,Sutton引用John McCarthy的定义——智能是实现目标能力的计算部分,强调目标对于智能的决定性意义。
在他眼中,LLMs所谓的"目标"(如next token prediction)并非实质性目标,"预测下一个token不会改变世界,模型只是被动接收输入并进行匹配,不存在对外部环境的主动影响"。
缺失目标,会直接导致LLMs缺乏评估行为优劣的内在标准,而强化学习系统通过奖励信号(reward)明确了"正确行为"的定义,使持续学习具备了可验证的基础。
关于世界模型的争议更为尖锐。LLMs的支持者认为,模型通过海量文本训练已形成了稳健的世界模型,这是其在复杂任务中表现优异的基础。
Sutton对此提出根本性质疑:"LLMs预测的是人类会说什么,而非世界会发生什么。"
他区分了两种预测能力——对人类行为的模仿性预测,与对物理世界的因果性预测,指出前者本质上是对已有人类知识的统计复用,而后者才是与环境交互的基础。
这种差异解释了为何LLMs在数学推理等封闭领域表现出色(如获得国际数学奥林匹克金牌),却在需要动态适应环境的开放任务中力不从心——因为前者可通过符号运算规划完成,后者则需要基于实时反馈的世界模型更新。
学习方式,凸显了两种范式的鸿沟。Sutton强调,LLMs的训练数据是"永远不会在其正常生命周期中出现的信息”,LLM离线训练模式与生物智能的学习过程存在本质区别。
人类与动物的学习是"行动-感知-奖励"的持续循环,知识通过与环境的实时交互不断迭代;而LLMs则依赖静态的文本语料库,其"学习"本质上是对人类已有知识的压缩与复现。
这种差异导致LLMs缺乏真正的创造力——它们无法通过试错发现新的解决方案,只能在训练数据的分布范围内进行组合与重构。
bitter lesson
苦涩的教训
Sutton 2019年的经典论文《The Bitter Lesson》为理解AI路径提供了框架。
这篇论文指出:AI发展的历史反复证明,依赖人类知识的方法终将被基于计算规模与经验学习的方法超越。在LLMs时代,这一教训呈现出更为复杂的面向。
Sutton承认LLMs在某种程度上体现了bitter lesson的部分特征——它们确实通过大规模计算实现了能力的飞跃,展现出惊人的规模效应。
但他强调,LLMs同时也承载了过多的人类知识,这种双重性使其难以成为通用智能的终极路径。"当前LLMs的成功,部分源于其对人类知识的高效利用,这让人产生路径依赖。但历史终将证明,能够从直接经验中学习的系统将具备更强的扩展性。"
从早期的专家系统,到统计学习方法,AI领域多次上演类似剧情:基于人类知识编码的系统在短期内表现出色,但最终被不依赖特定领域知识、仅通过数据与计算规模提升性能的方法超越。
Sutton认为,LLMs正处于类似的历史节点——它们在文本理解与生成领域的成功,掩盖了其在持续学习与环境适应方面的结构性缺陷。
更具前瞻性的是,Sutton指出LLMs的数据来源存在根本性局限——互联网文本的规模终究有限,而经验学习系统可通过与世界的直接交互获得无限的"数据"。
当LLMs达到语料库的天花板时,能够从实时经验中学习的系统将展现出压倒性优势。
这种优势不仅体现在数据量上,更体现在数据质量——直接经验包含的因果信息、实时反馈,是间接文本描述无法替代的。
经验学习四个关键要素
Sutton所倡导的"经验学习范式"(experiential paradigm)。这将智能视为有机体与环境持续交互的产物,其核心是"感知-行动-奖励"的闭环循环。在这一框架下,Sutton提出了由四个关键组件构成的智能体
这四个组件的协同运作,使经验学习系统具备了LLMs所缺乏的核心能力:持续学习。
策略(Policy) 作为智能体的行为发生器,负责在特定情境下选择合适的行动。
与LLMs基于文本概率分布的决策不同,RL中的策略直接映射环境状态与最优行动,其核心是"做什么"而非"说什么"。
这种差异使RL策略能够直接影响环境,而非仅仅生成符合统计规律的输出。
价值函数(Value Function) 通过时序差分学习(TD learning)构建,是连接短期行为与长期目标的关键。
它预测当前状态下未来奖励的累积值,使智能体能够评估不同行动方案的长远影响。
正如Sutton所解释:"在国际象棋中,吃子的价值并非来自动作本身,而是来自它对最终获胜概率的提升——价值函数将这种长期影响转化为即时反馈。"
感知组件(Perception) 负责构建环境的状态表征(state representation),决定智能体"如何看待世界"。
这一过程不仅涉及原始感官数据的处理,更包括对关键特征的提取与抽象。与LLMs固定的token embedding不同,RL的状态表征会随着与环境的交互不断优化,以更好地捕捉任务相关的信息。
世界转移模型(Transition Model) 构成智能体对环境的因果理解,预测特定行动将导致的状态变化。
这一模型并非预先编程的物理规则,而是通过经验归纳形成的"世界物理学"——从简单的物体运动到复杂的社会互动,都可通过这一模型进行预测。
Sutton特别强调:"这一模型的学习不依赖奖励信号,而是来自'行动-结果'的直接观察,使其能够捕捉环境中丰富的因果结构。"
在它看来,人类入职后的快速适应、动物对新环境的探索,本质上都是这一机制的体现——通过实时交互不断更新世界模型与策略,而非依赖预训练的静态知识。
这种能力对于处理"大世界假设"(big world hypothesis)下的复杂环境至关重要,因为现实世界的细节丰富性使其无法被预先完全建模。
模仿学习的边界
许多研究者将儿童学习语言,掌握技能视为模仿学习的案例,主张LLMs的模仿路径具有生物学合理性。Sutton与主流观点存在显著分歧。
他首先质疑模仿在婴儿早期发展中的作用:"出生后前六个月的婴儿,其手部运动、眼神追踪等基础能力并非通过模仿习得——这些行为没有明确的模仿对象或目标,但却是后续学习的基础。"
在他看来,试错学习(trial-and-error)而非模仿,构成了动物学习的核心机制。
心理学研究支持这一观点——动物学习的基础是经典条件反射与操作性条件反射,两者均依赖直接经验而非示范学习。
对于人类文化传承中的"模仿"现象,Sutton给出了不同解释:"文化中的技能传递确实存在模仿成分,但这只是建立在基础试错学习之上的表层现象。"
他承认代际间的技能传递包含模仿环节,但强调这种模仿始终嵌套在实时反馈的学习循环中——学习者通过实际捕猎中的成功与失败不断调整动作,而非机械复制长辈的行为。
这种观点将模仿重新定位为经验学习的辅助手段,而非独立的学习范式。
Sutton也提到,监督学习(supervised learning)在自然界中几乎不存在。"动物不会收到'正确行为'的示范,它们只能观察行为的后果。"
这种自然学习与LLMs训练的根本区别,解释了为何纯粹的模仿系统难以应对环境变化——没有试错与反馈,就无法形成对行为后果的深层理解。即便是人类的学校教育,在他看来也并非典型的学习模式,"不应将这种特殊情况作为构建通用智能理论的基础"。
未来智能的演进方向
当被问及经验学习范式的具体实现路径时,Sutton勾勒出一幅与当前LLMs发展截然不同的图景。
这一图景是打破"训练-部署"的二元划分,构建能够终身学习的智能体。
在这样的系统中,知识的共享与累积将呈现新的形态。与LLMs通过统一预训练然后微调的模式不同,经验学习系统可通过"知识迁移"实现跨实例的学习成果共享。
"一个智能体在特定环境中习得的世界模型,可作为其他智能体的初始状态,大幅加速学习过程。"
Sutton解释道:"价值函数的本质是对未来奖励的预测,每一个中间步骤的价值都来自其对最终目标的贡献度。"
这种机制使智能体能够在奖励信号稀缺的环境中保持学习动力,不断积累指向长远目标的知识。
Sutton并未完全否定LLMs的价值,而是将其定位为特定领域的工具。"LLMs在处理文本数据方面的能力值得肯定,但不应将其视为通用智能的基础。"
他预见的未来是,经验学习系统将逐步接管需要持续适应与环境交互的任务,而LLMs则作为专业模块在自然语言处理等领域发挥作用。
结论:
在大语言模型主导话语权的当下,这位RL先驱的警示提醒我们:智能的本质不在于对既有知识的模仿与复现,而在于从直接经验中学习、适应与创造的能力。
这场对话超越了技术细节的比较,触及了哲学问题——我们究竟希望构建怎样的智能系统?是能够完美复现人类知识的"模仿者",还是能够独立探索世界的"学习者"?
历史或许会证明,当前LLMs的辉煌,正如当年的专家系统,终将成为RL的垫脚石。
正如bitter lesson中所揭示的,那些看似笨拙却具有强大扩展性的方法,往往会在长期竞争中胜出。
这场访谈本身很有价值,让我们从全新的角度理解AI的局限性和可能性。
访谈链接和原文:
原文链接:https://mp.weixin.qq.com/s/tihzTlNfmHh_XSFgN9lq1Q
来源:XT
相关文章
- RL强化学习的底层假设任何一个学科,都有前提假设,RL 也不例外。在RL的方法论中,如果选一个最基本的假设,我会选:行动会改变状态,并产生长期后果。 这个假设比“…
- 直接探询本质,跨领域学习的捷径学习的目的, 不是在已知区域中重复, 而是为了在未知区当中找到方向。 我问AI:“中国足球的本质是什么?”, 它如此作答: 我问AI:“波普…
- 好的教育,会让人们仰望星空!这两天跟一些朋友聊天,讨论AI对于这个时代教育学习的深刻影响。是以为记。 ——————— AI来临,每个人的教育资源变得触手可及、丰富多彩。…
- 吴恩达,关于AI职业发展的10个朴素且重要的观点https://cloud.tencent.com/developer/article/2523692?policyId=1004&webv…