App · 已发布

RL Study

用生活故事、简单图形和互动实验直观理解强化学习;9 个阶段、27 课,从反馈试错走到 DQN、PPO、机器人与 RLHF。

学习 · RL · AI

从生活直觉开始理解强化学习

RL Study 是一套中文互动强化学习课程。它不从公式和代码起步,而是先让学习者进入具体情境,做出选择、观察结果,再给刚刚体验过的结构贴上强化学习的名字。

课程按 9 个阶段组织,共 27 个主题:

  • 反馈与试错
  • 智能体、环境、状态、动作、奖励与回合
  • 探索与利用
  • 奖励、回报与价值
  • 蒙特卡洛、时序差分与学习率
  • SARSA、Q-learning、On-policy 与 Off-policy
  • 函数逼近、DQN、经验回放与目标网络
  • 策略梯度、Actor-Critic 与 PPO
  • 机器人、Sim-to-real、LLM 与 RLHF

每一课的学习方式

每一课都围绕一个生活问题展开:

  1. 先做预测,暴露当前直觉。
  2. 只改变一个条件,观察结果变化。
  3. 拆开因果结构,再引入术语和必要的数学。
  4. 换一个场景检查理解能否迁移。

课程不要求先补完高等数学,也不把写代码当作入门阶段的掌握标准。数学会在真正有助于精确理解时出现,并且可以随时收起。

进入 RL Study 互动课程

转发给可能用得上的人