2026.07.24
我做了一个不要求先学数学的强化学习网站
目录
强化学习很容易被教成一排缩写:MDP、Q-learning、DQN、PPO、RLHF。每个词都能查到解释,但它们之间究竟是什么关系,一个智能体到底怎样从反馈里学会行动,常常还是模糊的。
我做了一个强化学习网站:RL Study。它不从公式和代码开始,而是先让人进入一个具体情境,做出选择,观察结果,再给刚刚经历过的结构贴上强化学习的名字。
先看懂反馈,再认识算法
第一课的问题是:一个新手只得到最终试吃分数,怎样越做越会做番茄炒蛋?
你先决定火力、汤汁和调味,完成一轮后得到反馈。随后,一个虚拟厨师重复尝试,根据每轮总分调整下一次更愿意做出的选择。这个过程里没有人逐步告诉它标准答案,它只能记住做过什么、结果如何,再改变未来的行动倾向。
到了这里,智能体、环境、状态、动作、奖励和策略就不再是六个孤立的名词,而是刚刚发生过的一条因果链。
第二课换成训练虚拟小狗。不同奖励规则会产生完全不同的行为:奖励“捡起玩具”,它可能反复捡起又放下;奖励“放进篮子”,它可能把同一件玩具拿出再放回去刷分;只有评价最终房间状态,奖励才更接近我们真正想要的结果。
这也是强化学习里很重要的一层:奖励不是目标本身,只是目标的代理。智能体会认真优化你写下的分数,却不会自动理解你没有写进去的意图。
一条从生活直觉走到经典算法的路线
RL Study 现在包含 9 个学习阶段、27 个课程主题:
- 反馈与试错
- RL 世界的基本零件
- 探索与利用
- 奖励、回报与价值
- 从经验中更新判断
- 经典算法家族
- 从表格到神经网络
- 策略梯度、Actor-Critic 与 PPO
- 机器人与 LLM
生活故事不是为了绕开理论,而是为了给理论找到落脚点。
选择新餐厅用来理解探索与利用;早起还是继续睡,用来区分即时奖励和长期回报;看完整部电影再评分,对应蒙特卡洛方法;边追剧边调整期待,对应时序差分;悬崖边的两位旅行者,用来比较 SARSA 与 Q-learning;演员和教练,则对应 Actor-Critic。
走到后面,DQN 的经验回放与目标网络、PPO 的小步更新、机器人的 Sim-to-real,以及语言模型里的偏好数据和奖励模型,都会重新接回前面建立的反馈循环。
每一课都做四件事
课程的基本节奏固定为四步:
- 先做预测,暴露自己当前的直觉。
- 只改变一个条件,观察结果怎样变化。
- 拆开背后的因果结构,再引入术语和必要的数学表达。
- 换一个场景检查,确认理解能不能迁移。
我不想把“看懂页面”误当成“学会概念”。所以每一课都会要求学习者重新判断、比较或解释。真正需要带走的,不是一句背熟的定义,而是遇到新问题时能够问出:谁在行动?它看见什么?它能做什么?什么反馈会改变以后怎么做?
数学在需要的时候出现
强化学习最终离不开数学,也离不开代码。但对初学者来说,一开始就把全部符号摆出来,常常只会增加工作记忆负担,还没有回答“这个量为什么存在”。
RL Study 的处理方式是:先建立关系,再给出表达。公式会在它能让概念更精确时出现,并且可以收起;代码实现不是入门阶段的掌握标准。数学陌生没有关系,愿意理解就够了。
这个网站适合想理解强化学习,却一直被术语、公式和算法名字挡在门外的人。也适合已经接触过 DQN、PPO 或 RLHF,想重新补上一张完整概念地图的人。
相关文章
- Richard Sutton眼中的大模型AI:这是条死胡同本文基于Sutton(2024年图灵奖得主、强化学习奠基人Richard Sutton)与Dwarkesh Patel的访谈。在这个访谈中,…
- RL强化学习的底层假设任何一个学科,都有前提假设,RL 也不例外。在RL的方法论中,如果选一个最基本的假设,我会选:行动会改变状态,并产生长期后果。 这个假设比“…
- 直接探询本质,跨领域学习的捷径学习的目的, 不是在已知区域中重复, 而是为了在未知区当中找到方向。 我问AI:“中国足球的本质是什么?”, 它如此作答: 我问AI:“波普…
- 好的教育,会让人们仰望星空!这两天跟一些朋友聊天,讨论AI对于这个时代教育学习的深刻影响。是以为记。 ——————— AI来临,每个人的教育资源变得触手可及、丰富多彩。…