🏠 总目录📚 本教程 00 · 怎么用这份教程
📑 本页目录(点开跳转)

00 · 怎么用这份教程

18 分钟


🎯 一句话

这份教程补的是整个学习库里最大的一个洞: 站里其他几个板块,17 处提到 RLHF、PPO、强化学习, 但没有一处告诉你强化学习本身是什么


🕳️ 它填的是哪个洞

这些地方都默认你已经懂强化学习了:

全景导论 04
训练三阶段讲 RLHF
「PPO 在优化什么」
全景导论 12
对齐讲奖励模型
「奖励是怎么变成梯度的」
推荐算法 13
用 Thompson Sampling 做探索
「探索利用为什么是个两难」
智能体工程
Agent 自己决定下一步
「序贯决策的框架」
这一层就是本教程要补的
  • MDP 建模
  • 价值函数
  • 贝尔曼方程
  • 动态规划
  • 蒙特卡洛 / 时序差分
  • Q-learning
  • 探索与利用
  • DQN
  • 策略梯度
  • Actor-Critic
  • PPO
  • RLHF / DPO

🧠 强化学习和监督学习,根本区别在哪

   监督学习:给你一堆 (输入, 正确答案)
             → 学一个从输入到答案的映射
             ⭐ 有人告诉你每一步的对错

   强化学习:给你一个【环境】,你做动作,它给你【奖励】
             → 学一个「在什么情况下该做什么」的策略
             ⭐ 没人告诉你每一步对错,只在最后给个分数

三个由此产生的独有难点(整份教程都在处理它们):

难点 具体是什么 在哪章解决
延迟奖励 下棋走了 80 步才知道输赢,哪一步是关键? 03 价值函数
探索 vs 利用 去没试过的餐厅(可能更好)还是去熟悉的? 07 探索与利用
数据是自己造的 你的策略决定你看到什么数据,策略一变,数据分布就变 09 策略梯度11 PPO

🔑 第三点是强化学习最难的地方,也是它和监督学习最本质的区别: 监督学习的数据集是固定的; 强化学习里,你一改模型,数据就跟着变 —— 这就是为什么它训练起来那么不稳定。


⚠️ 三条阅读规则

① 公式全部可以跳过

每个公式下面都有 💡人话翻译。推导放在 <details markdown="1"> 折叠块里,不点开完全不影响读下一章

② 前六章是「一个东西的六种算法」,别当六个新概念

   02-03 章:把问题写成数学(MDP + 价值函数)
              ↓ 剩下的全是【怎么求出那个价值函数】
   04 动态规划   :知道环境规则时怎么算
   05 MC / TD    :不知道规则、只能试的时候怎么估
   06 Q-learning :怎么从「估价值」变成「学策略」
   08 DQN        :状态太多存不下时,用神经网络近似

看懂这条线,前八章就不是八个算法,是同一个问题的八次升级。

③ 从第 9 章开始换了一条路

   前八章:先估价值,再由价值推出策略      → 【基于价值】
   9-11章:直接优化策略本身,不经过价值    → 【基于策略】⭐

   为什么要换:动作是连续的时候(比如「方向盘转 13.7 度」),
              基于价值的方法要对所有动作取 max —— 根本算不了

🗺️ 教程结构(16 章 + 附录)

  【坐标系】   00 怎么用   01 在解什么问题
  【语言】     02 MDP ⭐   03 价值函数与贝尔曼方程 ⭐
  【表格法】   04 动态规划   05 蒙特卡洛与时序差分
              06 Q-learning 与 SARSA ⭐   07 探索与利用 ⭐
  【函数近似】 08 DQN ⭐   09 策略梯度 ⭐   10 Actor-Critic
              11 PPO ⭐⭐
  【落到大模型】12 RLHF 全流程 ⭐⭐   13 DPO 与免 RL 对齐
              14 RL 在推荐与智能体里
  【动手】     15 实战与挑战项目
  【随时查】   附录A 速查

三章是全教程的高光

章节 为什么
03 贝尔曼方程 整个强化学习就建立在这一个方程上。它之后的所有算法都是在解它
11 PPO 现在实际在用的那个。ChatGPT、Claude 的对齐都靠它
12 RLHF 把前 11 章全部串起来,你会看到每个零件落在哪

⏱️ 四种读法

你的情况 路线 时间
只想看懂 RLHF 在干嘛 01 → 02 → 03 → 09 → 11 → 12 3 小时
想补推荐里的探索利用 01 → 07 → 14 1.5 小时
想真正会用 RL 01–11 顺读 + 15 动手 2 周
完整打牢 全部顺读 3 周

💡 如果只有一小时:读 010301 给你问题,03 给你解法的骨架,中间的都是细节。


🧮 需要的基础

   ✅ 需要:
   · 概率:期望、条件概率            (数学原理教程有)
   · 梯度下降是怎么回事              (ML基础第 9 章)
   · 会用 PyTorch 写个小网络         (ML基础第 15 章)

   ❌ 不需要:
   · 随机过程、测度论
   · 最优控制理论
   · 手推收敛性证明

🔗 它和其他几套的关系

   《机器学习与深度学习基础》 ← 先有这个(本教程第8章起要用神经网络)
              │
              ▼
   《强化学习基础》 ← 你在这里
              │
              ├──→ 《大模型全景导论》04/12 的 RLHF、对齐   ⭐ 主要去向
              ├──→ 《推荐算法》13 的探索利用、18 的强化学习
              └──→ 《智能体工程教程》的序贯决策

🔗 这一章连到哪里

去哪 为什么
ML基础 ⭐ 唯一硬前置:至少知道什么是模型、什么是梯度下降,再来读这份
全景导论 04 你为什么会需要 RL —— 大模型的第三阶段「对齐」就是它
推荐算法 13 第 7 章探索利用最直接的应用场景:新物品该给多少流量
智能体 06 「序贯决策」在工程上长什么样 —— Agent 每一步都在做本教程说的那件事

✅ 检查点

  1. 强化学习和监督学习最根本的区别是什么?
  2. 由这个区别产生的三个独有难点是什么?
  3. 为什么说「数据是自己造的」是最难的一点?
  4. 前八章的那条主线是什么?
  5. 第 9 章开始为什么要换一条路?
  6. 只有一小时该读哪两章?
👀 答案
  1. 监督学习有 (输入, 正确答案) 对,每步都有人告诉你对错;强化学习只有环境给的奖励,没人告诉你每一步该做什么。
  2. 延迟奖励(走了 80 步才知输赢,哪步关键?)②探索 vs 利用(试新的还是用熟的)③数据是自己造的(策略决定你看到什么数据)。
  3. 因为监督学习的数据集固定,而强化学习里你一改模型、数据分布就跟着变——这是训练不稳定的根源。
  4. 02-03 把问题写成数学(MDP + 价值函数),04-08 全都是"怎么求出那个价值函数"的不同办法:知道规则用动态规划、不知道就试(MC/TD)、状态太多就用神经网络近似(DQN)。
  5. 因为动作连续时(如"方向盘转 13.7 度"),基于价值的方法需要对所有动作取 max,根本算不了。所以改成直接优化策略
  6. 01 和 03。01 给你问题,03 给你解法的骨架(贝尔曼方程),中间的都是细节。

🛑 开始

走神救援

这份教程补的是全站最大的一个洞:站里其他板块 17 处提到 RLHF、PPO、强化学习,却没有一处告诉你强化学习本身是什么。⭐根本区别:监督学习给你(输入, 正确答案),有人告诉你每一步的对错;强化学习给你一个环境,你做动作、它给奖励,没人告诉你每步对错,只在最后给个分数三个独有难点:①延迟奖励(走了 80 步才知输赢,哪步是关键?)②探索与利用 ③⭐数据是自己造的——策略一变数据分布就跟着变,这是它训练那么不稳定的根源分工:ML 基础教你怎么训模型,这套教你只有奖励、没有标准答案时怎么学,出口是全景导论的 RLHF 与对齐。前置:✅期望与条件概率、✅梯度下降、✅会用 PyTorch 写个小网络;❌不需要随机过程、测度论、最优控制、收敛性证明。⭐最该记住的主线02-03 把问题写成数学(MDP + 价值函数),04-08 全都是"怎么求出那个价值函数"的不同办法——知道规则用动态规划、只能试就用蒙特卡洛与时序差分、状态太多就用神经网络近似(DQN),看懂这条线,前八章就不是八个算法,是同一个问题的八次升级;⚠️第 9 章起换了一条路:前八章基于价值,9-11 章基于策略——因为动作连续时("方向盘转 13.7 度")要对所有动作取 max,根本算不了三个高光:⭐03 贝尔曼方程(整个强化学习就建立在这一个方程上)、11 PPO、12 RLHF四种读法:只想看懂 RLHF 走 01→02→03→09→11→12(三小时);补探索利用走 01→07→14;真正会用就顺读到 11 再动手。⭐只有一小时就读 01 和 03——01 给你问题,03 给你解法的骨架。

👉 01-强化学习在解什么问题.md

打卡记录保存在你的浏览器里,首页能看到总进度