📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 18 分钟
🎯 一句话
这份教程补的是整个学习库里最大的一个洞: 站里其他几个板块,17 处提到 RLHF、PPO、强化学习, 但没有一处告诉你强化学习本身是什么。
🕳️ 它填的是哪个洞
这些地方都默认你已经懂强化学习了:
全景导论 04
训练三阶段讲 RLHF
「PPO 在优化什么」
全景导论 12
对齐讲奖励模型
「奖励是怎么变成梯度的」
推荐算法 13
用 Thompson Sampling 做探索
「探索利用为什么是个两难」
智能体工程
Agent 自己决定下一步
「序贯决策的框架」
⬇
这一层就是本教程要补的
- MDP 建模
- 价值函数
- 贝尔曼方程
- 动态规划
- 蒙特卡洛 / 时序差分
- Q-learning
- 探索与利用
- DQN
- 策略梯度
- Actor-Critic
- PPO
- RLHF / DPO
🧠 强化学习和监督学习,根本区别在哪
操作步骤
监督学习:给你一堆 (输入, 正确答案)
学一个从输入到答案的映射
⭐ 有人告诉你每一步的对错
强化学习:给你一个【环境】,你做动作,它给你【奖励】
学一个「在什么情况下该做什么」的策略
⭐ 没人告诉你每一步对错,只在最后给个分数
三个由此产生的独有难点(整份教程都在处理它们):
| 难点 | 具体是什么 | 在哪章解决 |
|---|---|---|
| 延迟奖励 | 下棋走了 80 步才知道输赢,哪一步是关键? | 03 价值函数 |
| 探索 vs 利用 | 去没试过的餐厅(可能更好)还是去熟悉的? | 07 探索与利用 ⭐ |
| 数据是自己造的 | 你的策略决定你看到什么数据,策略一变,数据分布就变 | 09 策略梯度、11 PPO |
🔑 第三点是强化学习最难的地方,也是它和监督学习最本质的区别: 监督学习的数据集是固定的; 强化学习里,你一改模型,数据就跟着变 —— 这就是为什么它训练起来那么不稳定。
⚠️ 三条阅读规则
① 公式全部可以跳过
每个公式下面都有 💡人话翻译。推导放在 <details markdown="1"> 折叠块里,不点开完全不影响读下一章。
② 前六章是「一个东西的六种算法」,别当六个新概念
关键信息
02-03 章:把问题写成数学(MDP + 价值函数)
剩下的全是【怎么求出那个价值函数】
04 动态规划 :知道环境规则时怎么算
05 MC / TD :不知道规则、只能试的时候怎么估
06 Q-learning :怎么从「估价值」变成「学策略」
08 DQN :状态太多存不下时,用神经网络近似
⭐ 看懂这条线,前八章就不是八个算法,是同一个问题的八次升级。
③ 从第 9 章开始换了一条路
信息关系
前八章:先估价值,再由价值推出策略→【基于价值】
9-11章:直接优化策略本身,不经过价值→【基于策略】⭐
为什么要换:动作是连续的时候(比如「方向盘转 13.7 度」),
基于价值的方法要对所有动作取 max —— 根本算不了
🗺️ 教程结构(16 章 + 附录)
坐标系
- 00 怎么用 01 在解什么问题
语言
- 02 MDP ⭐ 03 价值函数与贝尔曼方程 ⭐
表格法
- 04 动态规划 05 蒙特卡洛与时序差分
- 06 Q-learning 与 SARSA ⭐ 07 探索与利用 ⭐
函数近似
- 08 DQN ⭐ 09 策略梯度 ⭐ 10 Actor-Critic
- 11 PPO ⭐
落到大模型
- 12 RLHF 全流程 ⭐ 13 DPO 与免 RL 对齐
- 14 RL 在推荐与智能体里
动手
- 15 实战与挑战项目
随时查
- 附录A 速查
三章是全教程的高光:
| 章节 | 为什么 |
|---|---|
| ⭐ 03 贝尔曼方程 | 整个强化学习就建立在这一个方程上。它之后的所有算法都是在解它 |
| ⭐ 11 PPO | 现在实际在用的那个。ChatGPT、Claude 的对齐都靠它 |
| ⭐ 12 RLHF | 把前 11 章全部串起来,你会看到每个零件落在哪 |
⏱️ 四种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 只想看懂 RLHF 在干嘛 | 01 → 02 → 03 → 09 → 11 → 12 | 3 小时 |
| 想补推荐里的探索利用 | 01 → 07 → 14 | 1 小时 |
| 想真正会用 RL | 01–11 顺读 + 15 动手 | 2 周 |
| 完整打牢 | 全部顺读 | 3 周 |
🧮 需要的基础
对照
✅ 需要:
· 概率:期望、条件概率 (数学原理教程有)
· 梯度下降是怎么回事 (ML基础第 9 章)
· 会用 PyTorch 写个小网络 (ML基础第 15 章)
❌ 不需要:
· 随机过程、测度论
· 最优控制理论
· 手推收敛性证明
🔗 它和其他几套的关系
关键信息
- 《机器学习与深度学习基础》 先有这个(本教程第8章起要用神经网络)
- 《强化学习基础》 你在这里
- → 《大模型全景导论》04/12 的 RLHF、对齐 ⭐ 主要去向
- → 《推荐算法》13 的探索利用、18 的强化学习
- → 《智能体工程教程》的序贯决策
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| ML基础 | ⭐ 唯一硬前置:至少知道什么是模型、什么是梯度下降,再来读这份 |
| 全景导论主线 4 · 它怎样从续写机变助手 | 你为什么会需要 RL —— 大模型的第三阶段「对齐」就是它 |
| 推荐算法 13 | 第 7 章探索利用最直接的应用场景:新物品该给多少流量 |
| 智能体 06 | 「序贯决策」在工程上长什么样 —— Agent 每一步都在做本教程说的那件事 |
✅ 检查点
- 强化学习和监督学习最根本的区别是什么?
- 由这个区别产生的三个独有难点是什么?
- 为什么说「数据是自己造的」是最难的一点?
- 前八章的那条主线是什么?
- 第 9 章开始为什么要换一条路?
- 只有一小时该读哪两章?
👀 答案
- 监督学习有 (输入, 正确答案) 对,每步都有人告诉你对错;强化学习只有环境给的奖励,没人告诉你每一步该做什么。
- ①延迟奖励(走了 80 步才知输赢,哪步关键?)②探索 vs 利用(试新的还是用熟的)③数据是自己造的(策略决定你看到什么数据)。
- 因为监督学习的数据集固定,而强化学习里你一改模型、数据分布就跟着变——这是训练不稳定的根源。
- 02-03 把问题写成数学(MDP + 价值函数),04-08 全都是"怎么求出那个价值函数"的不同办法:知道规则用动态规划、不知道就试(MC/TD)、状态太多就用神经网络近似(DQN)。
- 因为动作连续时(如"方向盘转 13.7 度"),基于价值的方法需要对所有动作取 max,根本算不了。所以改成直接优化策略。
- 01 和 03。01 给你问题,03 给你解法的骨架(贝尔曼方程),中间的都是细节。
🛑 开始
⚡ 走神救援
先记住这几件事
- 强化学习从行动与奖励中学习,策略会改变之后收集到的数据。
- 先理解 MDP 和价值函数,再比较动态规划、采样估计与函数近似。
- 后半程直接优化策略,最后把这些概念连接到对齐和智能体任务。