← 文章

2026.06.02

RL强化学习的底层假设

任何一个学科,都有前提假设,RL 也不例外。在RL的方法论中,如果选一个最基本的假设,我会选:行动会改变状态,并产生长期后果。

这个假设比“奖励”还更底层。奖励只是对后果的评价方式;而“行动导致后果”才是强化学习区别于其他学习范式的根本。

RL强化学习的方法,最基本的假设不是“状态可观测”,也不是“马尔可夫性”,甚至不是“奖励函数”。

它第一性的假设应该是:世界可以被理解为一个“行动会改变未来,并且未来会给出反馈”的动态系统。

“行动改变未来”

我想,这是强化学习最根本的世界观。脱离这样基础的场景和信念,是不适合使用RL的方法的。

这也就是说,强化学习首先假设,智能体不是在静态世界里做分类、预测、判断,而是在一个会被自己行动改变的环境中生存。

它每做一个动作,环境状态就可能发生变化;状态变化之后,又会产生新的机会、新的限制、新的奖励和新的风险。

如果没有这个假设,就没有强化学习。

与之相对应的,监督学习可以只关心“输入对应什么输出”;统计预测可以只关心“根据已有数据预测结果”;优化问题可以只关心“在固定约束下找到最优解”。

但强化学习关心的是:“有没有一个会被行动改变的未来?”

强化学习的那些基本概念,譬如状态、动作、奖励、策略、价值函数、探索利用、马尔可夫性、可观测性,都是在这个根假设之上展开出来的。

这个假设一旦成立,后面的东西就自然长出来了。

行动会改变世界,所以有用状态转移来描述的必要性。

行动有好坏,所以可以需要奖励来评估。

好坏不只在当下,所以需要长期回报。

长期回报可以递归,所以需要价值函数。

不知道哪个动作最好,所以需要探索。

一次动作不够,所以策略变得重要。

状态可能看不全,所以需要记忆……

强化学习这套思想体现了在动态环境中,行动者如何通过反馈,学会选择那些能带来长期价值的行动策略。

这里面最不可再分的核心,就是“行动者”和“长期后果”之间的关系。

除了“行动会改变未来”以外,还有其他几个基本假设,这些都是学习和使用强化学习的前提。

反馈假设

这个假设是说,未来的变化可以以某种方式反馈给智能体。

这个反馈可以是奖励、惩罚、成功、失败、存活、利润、用户满意度、任务完成度。

没有反馈,智能体无法知道什么行动更好。

可学习假设

行动、状态变化和反馈之间存在可学习的规律。

它不一定完全确定,可以有噪声,可以有概率,但不能是纯随机的。

如果世界完全不可学习,强化学习也没有意义。

状态化假设

这个动态系统可以被投影成某种“状态”。

否则经验复杂,无法建模,无法递归,无法计算长期价值。

智能体能不能直接看到足够完整的状态。如果能,就是标准 MDP;如果不能,就是部分马尔可夫POMDP、belief state、记忆机制、历史建模。

“状态可观测”很重要,但它不是根本假设。它更像是一个强建模条件。

在理想模型里,你有状态,然后学习策略。

在现实世界里,你常常先要从混乱观测里构造状态,再学习策略。

能否对状态进行建模,才是前置条件。

马尔可夫性

如果状态定义得足够好,那么未来只依赖当前状态和当前动作,而不需要完整历史。

这个假设非常重要,但它不是最根本的,或者说这是一种数学的表示方法,它是为了让问题可计算、可递归。

(这个是我的RL学习笔记。我数学基础不好,只能用一些跨行的方式来理解那些晦涩的数学表达式背后的真实含义,譬如探寻它的本质、现象、可视化的动画、比喻隐喻等等。

然而,好奇心驱使,我可能会把RL这个利用数学来进行表达推理的方法,学成了美术、学成了产品设计、学成了哲学。 我觉得作为控制理论的一个分支,RL价值不只是用于倒立摆、机器人等控制领域,在组织管理、产品创新、教育、投资决策、自我发展等方面,有很好的借鉴意义。

这是我对世界采取的行动,用我擅长的方法,希望这种笨拙和执拗带来不错的奖励,至少状态一天比一天好😎)


原文链接:https://mp.weixin.qq.com/s/ZmYH2z1xstdyverl1DxpEQ

来源:XT

本文所属主题:提问与沟通AI 工程 枢纽 →

相关文章