← 文章

2026.07.24

我做了一个不要求先学数学的强化学习网站

目录

强化学习很容易被教成一排缩写:MDP、Q-learning、DQN、PPO、RLHF。每个词都能查到解释,但它们之间究竟是什么关系,一个智能体到底怎样从反馈里学会行动,常常还是模糊的。

我做了一个强化学习网站:RL Study。它不从公式和代码开始,而是先让人进入一个具体情境,做出选择,观察结果,再给刚刚经历过的结构贴上强化学习的名字。

先看懂反馈,再认识算法

第一课的问题是:一个新手只得到最终试吃分数,怎样越做越会做番茄炒蛋?

你先决定火力、汤汁和调味,完成一轮后得到反馈。随后,一个虚拟厨师重复尝试,根据每轮总分调整下一次更愿意做出的选择。这个过程里没有人逐步告诉它标准答案,它只能记住做过什么、结果如何,再改变未来的行动倾向。

到了这里,智能体、环境、状态、动作、奖励和策略就不再是六个孤立的名词,而是刚刚发生过的一条因果链。

第二课换成训练虚拟小狗。不同奖励规则会产生完全不同的行为:奖励“捡起玩具”,它可能反复捡起又放下;奖励“放进篮子”,它可能把同一件玩具拿出再放回去刷分;只有评价最终房间状态,奖励才更接近我们真正想要的结果。

这也是强化学习里很重要的一层:奖励不是目标本身,只是目标的代理。智能体会认真优化你写下的分数,却不会自动理解你没有写进去的意图。

一条从生活直觉走到经典算法的路线

RL Study 现在包含 9 个学习阶段、27 个课程主题:

  1. 反馈与试错
  2. RL 世界的基本零件
  3. 探索与利用
  4. 奖励、回报与价值
  5. 从经验中更新判断
  6. 经典算法家族
  7. 从表格到神经网络
  8. 策略梯度、Actor-Critic 与 PPO
  9. 机器人与 LLM

生活故事不是为了绕开理论,而是为了给理论找到落脚点。

选择新餐厅用来理解探索与利用;早起还是继续睡,用来区分即时奖励和长期回报;看完整部电影再评分,对应蒙特卡洛方法;边追剧边调整期待,对应时序差分;悬崖边的两位旅行者,用来比较 SARSA 与 Q-learning;演员和教练,则对应 Actor-Critic。

走到后面,DQN 的经验回放与目标网络、PPO 的小步更新、机器人的 Sim-to-real,以及语言模型里的偏好数据和奖励模型,都会重新接回前面建立的反馈循环。

每一课都做四件事

课程的基本节奏固定为四步:

  1. 先做预测,暴露自己当前的直觉。
  2. 只改变一个条件,观察结果怎样变化。
  3. 拆开背后的因果结构,再引入术语和必要的数学表达。
  4. 换一个场景检查,确认理解能不能迁移。

我不想把“看懂页面”误当成“学会概念”。所以每一课都会要求学习者重新判断、比较或解释。真正需要带走的,不是一句背熟的定义,而是遇到新问题时能够问出:谁在行动?它看见什么?它能做什么?什么反馈会改变以后怎么做?

数学在需要的时候出现

强化学习最终离不开数学,也离不开代码。但对初学者来说,一开始就把全部符号摆出来,常常只会增加工作记忆负担,还没有回答“这个量为什么存在”。

RL Study 的处理方式是:先建立关系,再给出表达。公式会在它能让概念更精确时出现,并且可以收起;代码实现不是入门阶段的掌握标准。数学陌生没有关系,愿意理解就够了。

这个网站适合想理解强化学习,却一直被术语、公式和算法名字挡在门外的人。也适合已经接触过 DQN、PPO 或 RLHF,想重新补上一张完整概念地图的人。

进入 RL Study,从第一课开始

本文所属主题:AI 工程强化学习 枢纽 →

相关文章