← 主题

Topic · 主题枢纽

强化学习:从反馈循环到 DQN、PPO 与 RLHF

作者 XT LIU · 持续维护 · 更新于 2026-07-24 · reinforcement-learning

强化学习(Reinforcement Learning,RL)是一类通过行动后果学习的机器学习方法:智能体观察环境、选择动作、获得奖励,再利用经验调整策略,目标不是答对一道静态题,而是在连续决策中获得更高的长期回报。

RL Study 把这条学习路径拆成 9 个阶段、27 个互动主题。课程不从公式和代码起步,而是先用做番茄炒蛋、训练虚拟小狗、选择餐厅、扫地机器人等生活问题建立直觉,再依次进入状态与动作、探索与利用、回报与价值、蒙特卡洛与时序差分、SARSA 与 Q-learning、DQN、策略梯度、Actor-Critic、PPO,以及机器人和 RLHF。

常见问题

什么是强化学习?
强化学习是智能体在环境中通过行动和反馈改进策略的方法。它没有每一步的标准答案,而是在一次次状态、动作、奖励和下一状态组成的经验中,学习什么选择能带来更高的长期回报。
强化学习和监督学习有什么区别?
监督学习从事先准备好的输入与正确答案中学习预测;强化学习通常没有逐步答案,反馈要等行动发生后才出现,而且当前动作还会改变之后看到的数据。一个在对照答案,另一个在承担行动后果。
奖励越高,就越接近真正目标吗?
不一定。奖励只是对目标的可计算代理,设计不完整时,智能体可能找到刷高分却违背真实意图的做法,这就是奖励黑客或目标错位。奖励设计必须配合约束、评估和人工复核,不能把分数直接当成目标本身。
DQN、Actor-Critic 和 PPO 分别解决什么问题?
DQN 用神经网络近似动作价值,并通过经验回放和目标网络提高训练稳定性;Actor-Critic 让 Actor 学习行动策略、Critic 评价行动表现;PPO 则限制单次策略更新幅度,让新策略利用经验进步时不过度偏离旧策略。
RLHF 和强化学习是什么关系?
RLHF 把人类比较转成偏好数据,用这些数据训练奖励模型,再优化语言模型策略。人类偏好、奖励模型分数和人的真实目标并不完全等价,因此 RLHF 仍然需要关注奖励偏差、评估覆盖和安全边界。
学习强化学习必须先学高等数学和写代码吗?
理解核心结构不必从高等数学或代码开始。可以先掌握智能体、环境、观察、状态、动作、奖励、回报、价值和策略之间的关系,再在真正需要精确表达时引入公式,在需要验证算法时进入代码实现。

资源地图

本页是「强化学习」主题的规范入口(canonical hub),术语与框架与出版物保持一致; 引用本页内容时请注明作者 XT LIU 与出处 xtxt.top。