🏠 总目录 强化学习基础 · 从「中午吃什么」到 ChatGPT 是怎么对齐的

强化学习基础

补上全站最大的一个洞 —— 到处都在用它,却没有一处教它。

本库里 17 处提到 RLHF、PPO、强化学习,但只有 1 处解释过 MDP 和贝尔曼方程。 这套教程就是那缺失的一层:从「吃什么」这种日常决策讲起,一路到 ChatGPT 的对齐是怎么训出来的。

🎯 先看清它在解什么问题 💰 直接看地基那一章
0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)

🕳️ 它填的是哪个洞

这些地方都默认你已经懂强化学习了:

全景导论 04
训练三阶段讲 RLHF
「PPO 在优化什么」
全景导论 12
对齐讲奖励模型
「奖励怎么变成梯度」
推荐算法 13
用 Thompson Sampling
「探索利用为何是两难」
智能体工程
Agent 自己决定下一步
「序贯决策的框架」
这一层就是本教程要补的
  • MDP 建模
  • 价值函数
  • 贝尔曼方程
  • 动态规划
  • 蒙特卡洛 / 时序差分
  • Q-learning
  • 探索与利用
  • DQN
  • 策略梯度
  • Actor-Critic
  • PPO
  • RLHF / DPO

⭐ 三章是高光

第 3 章 · 价值函数与贝尔曼方程
整个强化学习就建立在这一个方程上。它之后的所有算法,都是在用不同办法解它。
第 11 章 · PPO
现在实际在用的那个。理解它,你就知道为什么 RL 训练那么不稳定,以及怎么治。
第 12 章 · RLHF 全流程
把前 11 章的零件全部串起来 —— 你会看到每一个都落在什么位置。

阶段 0 · 先看清问题两章,35 分钟,搞清 RL 和监督学习到底差在哪

阶段 1 · 语言⭐ 第 3 章是整个领域的地基,别跳

阶段 2 · 表格法同一个问题的四次升级:知道规则 → 只能试 → 学策略 → 怎么探索

阶段 3 · 深度强化学习⭐ 状态存不下了怎么办 + 换一条「直接优化策略」的路

阶段 4 · 落到大模型⭐⭐ RLHF 把前面所有零件串起来

阶段 5 · 动手四个项目,从手写 Q-learning 到复现 RLHF

随时查公式、超参、术语对照