App · 已发布
RL Study
用生活故事、简单图形和互动实验直观理解强化学习;9 个阶段、27 课,从反馈试错走到 DQN、PPO、机器人与 RLHF。
学习 · RL · AI
从生活直觉开始理解强化学习
RL Study 是一套中文互动强化学习课程。它不从公式和代码起步,而是先让学习者进入具体情境,做出选择、观察结果,再给刚刚体验过的结构贴上强化学习的名字。
课程按 9 个阶段组织,共 27 个主题:
- 反馈与试错
- 智能体、环境、状态、动作、奖励与回合
- 探索与利用
- 奖励、回报与价值
- 蒙特卡洛、时序差分与学习率
- SARSA、Q-learning、On-policy 与 Off-policy
- 函数逼近、DQN、经验回放与目标网络
- 策略梯度、Actor-Critic 与 PPO
- 机器人、Sim-to-real、LLM 与 RLHF
每一课的学习方式
每一课都围绕一个生活问题展开:
- 先做预测,暴露当前直觉。
- 只改变一个条件,观察结果变化。
- 拆开因果结构,再引入术语和必要的数学。
- 换一个场景检查理解能否迁移。
课程不要求先补完高等数学,也不把写代码当作入门阶段的掌握标准。数学会在真正有助于精确理解时出现,并且可以随时收起。
转发给可能用得上的人