📑 本页目录(点开跳转)
00 · 怎么用这份教程
⏱ 18 分钟
🎯 一句话
这份教程补的是整个学习库里最大的一个洞: 站里其他几个板块,17 处提到 RLHF、PPO、强化学习, 但没有一处告诉你强化学习本身是什么。
🕳️ 它填的是哪个洞
这些地方都默认你已经懂强化学习了:
- MDP 建模
- 价值函数
- 贝尔曼方程
- 动态规划
- 蒙特卡洛 / 时序差分
- Q-learning
- 探索与利用
- DQN
- 策略梯度
- Actor-Critic
- PPO
- RLHF / DPO
🧠 强化学习和监督学习,根本区别在哪
监督学习:给你一堆 (输入, 正确答案)
→ 学一个从输入到答案的映射
⭐ 有人告诉你每一步的对错
强化学习:给你一个【环境】,你做动作,它给你【奖励】
→ 学一个「在什么情况下该做什么」的策略
⭐ 没人告诉你每一步对错,只在最后给个分数
三个由此产生的独有难点(整份教程都在处理它们):
| 难点 | 具体是什么 | 在哪章解决 |
|---|---|---|
| 延迟奖励 | 下棋走了 80 步才知道输赢,哪一步是关键? | 03 价值函数 |
| 探索 vs 利用 | 去没试过的餐厅(可能更好)还是去熟悉的? | 07 探索与利用 ⭐ |
| 数据是自己造的 | 你的策略决定你看到什么数据,策略一变,数据分布就变 | 09 策略梯度、11 PPO |
🔑 第三点是强化学习最难的地方,也是它和监督学习最本质的区别: 监督学习的数据集是固定的; 强化学习里,你一改模型,数据就跟着变 —— 这就是为什么它训练起来那么不稳定。
⚠️ 三条阅读规则
① 公式全部可以跳过
每个公式下面都有 💡人话翻译。推导放在 <details markdown="1"> 折叠块里,不点开完全不影响读下一章。
② 前六章是「一个东西的六种算法」,别当六个新概念
02-03 章:把问题写成数学(MDP + 价值函数)
↓ 剩下的全是【怎么求出那个价值函数】
04 动态规划 :知道环境规则时怎么算
05 MC / TD :不知道规则、只能试的时候怎么估
06 Q-learning :怎么从「估价值」变成「学策略」
08 DQN :状态太多存不下时,用神经网络近似
⭐ 看懂这条线,前八章就不是八个算法,是同一个问题的八次升级。
③ 从第 9 章开始换了一条路
前八章:先估价值,再由价值推出策略 → 【基于价值】
9-11章:直接优化策略本身,不经过价值 → 【基于策略】⭐
为什么要换:动作是连续的时候(比如「方向盘转 13.7 度」),
基于价值的方法要对所有动作取 max —— 根本算不了
🗺️ 教程结构(16 章 + 附录)
【坐标系】 00 怎么用 01 在解什么问题
【语言】 02 MDP ⭐ 03 价值函数与贝尔曼方程 ⭐
【表格法】 04 动态规划 05 蒙特卡洛与时序差分
06 Q-learning 与 SARSA ⭐ 07 探索与利用 ⭐
【函数近似】 08 DQN ⭐ 09 策略梯度 ⭐ 10 Actor-Critic
11 PPO ⭐⭐
【落到大模型】12 RLHF 全流程 ⭐⭐ 13 DPO 与免 RL 对齐
14 RL 在推荐与智能体里
【动手】 15 实战与挑战项目
【随时查】 附录A 速查
三章是全教程的高光:
| 章节 | 为什么 |
|---|---|
| ⭐ 03 贝尔曼方程 | 整个强化学习就建立在这一个方程上。它之后的所有算法都是在解它 |
| ⭐ 11 PPO | 现在实际在用的那个。ChatGPT、Claude 的对齐都靠它 |
| ⭐ 12 RLHF | 把前 11 章全部串起来,你会看到每个零件落在哪 |
⏱️ 四种读法
| 你的情况 | 路线 | 时间 |
|---|---|---|
| 只想看懂 RLHF 在干嘛 | 01 → 02 → 03 → 09 → 11 → 12 | 3 小时 |
| 想补推荐里的探索利用 | 01 → 07 → 14 | 1.5 小时 |
| 想真正会用 RL | 01–11 顺读 + 15 动手 | 2 周 |
| 完整打牢 | 全部顺读 | 3 周 |
🧮 需要的基础
✅ 需要:
· 概率:期望、条件概率 (数学原理教程有)
· 梯度下降是怎么回事 (ML基础第 9 章)
· 会用 PyTorch 写个小网络 (ML基础第 15 章)
❌ 不需要:
· 随机过程、测度论
· 最优控制理论
· 手推收敛性证明
🔗 它和其他几套的关系
《机器学习与深度学习基础》 ← 先有这个(本教程第8章起要用神经网络)
│
▼
《强化学习基础》 ← 你在这里
│
├──→ 《大模型全景导论》04/12 的 RLHF、对齐 ⭐ 主要去向
├──→ 《推荐算法》13 的探索利用、18 的强化学习
└──→ 《智能体工程教程》的序贯决策
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| ML基础 | ⭐ 唯一硬前置:至少知道什么是模型、什么是梯度下降,再来读这份 |
| 全景导论 04 | 你为什么会需要 RL —— 大模型的第三阶段「对齐」就是它 |
| 推荐算法 13 | 第 7 章探索利用最直接的应用场景:新物品该给多少流量 |
| 智能体 06 | 「序贯决策」在工程上长什么样 —— Agent 每一步都在做本教程说的那件事 |
✅ 检查点
- 强化学习和监督学习最根本的区别是什么?
- 由这个区别产生的三个独有难点是什么?
- 为什么说「数据是自己造的」是最难的一点?
- 前八章的那条主线是什么?
- 第 9 章开始为什么要换一条路?
- 只有一小时该读哪两章?
👀 答案
- 监督学习有 (输入, 正确答案) 对,每步都有人告诉你对错;强化学习只有环境给的奖励,没人告诉你每一步该做什么。
- ①延迟奖励(走了 80 步才知输赢,哪步关键?)②探索 vs 利用(试新的还是用熟的)③数据是自己造的(策略决定你看到什么数据)。
- 因为监督学习的数据集固定,而强化学习里你一改模型、数据分布就跟着变——这是训练不稳定的根源。
- 02-03 把问题写成数学(MDP + 价值函数),04-08 全都是"怎么求出那个价值函数"的不同办法:知道规则用动态规划、不知道就试(MC/TD)、状态太多就用神经网络近似(DQN)。
- 因为动作连续时(如"方向盘转 13.7 度"),基于价值的方法需要对所有动作取 max,根本算不了。所以改成直接优化策略。
- 01 和 03。01 给你问题,03 给你解法的骨架(贝尔曼方程),中间的都是细节。
🛑 开始
⚡ 走神救援
这份教程补的是全站最大的一个洞:站里其他板块 17 处提到 RLHF、PPO、强化学习,却没有一处告诉你强化学习本身是什么。⭐根本区别:监督学习给你(输入, 正确答案),有人告诉你每一步的对错;强化学习给你一个环境,你做动作、它给奖励,没人告诉你每步对错,只在最后给个分数。三个独有难点:①延迟奖励(走了 80 步才知输赢,哪步是关键?)②探索与利用 ③⭐数据是自己造的——策略一变数据分布就跟着变,这是它训练那么不稳定的根源。分工:ML 基础教你怎么训模型,这套教你只有奖励、没有标准答案时怎么学,出口是全景导论的 RLHF 与对齐。前置:✅期望与条件概率、✅梯度下降、✅会用 PyTorch 写个小网络;❌不需要随机过程、测度论、最优控制、收敛性证明。⭐最该记住的主线:02-03 把问题写成数学(MDP + 价值函数),04-08 全都是"怎么求出那个价值函数"的不同办法——知道规则用动态规划、只能试就用蒙特卡洛与时序差分、状态太多就用神经网络近似(DQN),看懂这条线,前八章就不是八个算法,是同一个问题的八次升级;⚠️第 9 章起换了一条路:前八章基于价值,9-11 章基于策略——因为动作连续时("方向盘转 13.7 度")要对所有动作取 max,根本算不了。三个高光:⭐03 贝尔曼方程(整个强化学习就建立在这一个方程上)、11 PPO、12 RLHF。四种读法:只想看懂 RLHF 走 01→02→03→09→11→12(三小时);补探索利用走 01→07→14;真正会用就顺读到 11 再动手。⭐只有一小时就读 01 和 03——01 给你问题,03 给你解法的骨架。