强化学习基础
补上全站最大的一个洞 —— 到处都在用它,却没有一处教它。
本库里 17 处提到 RLHF、PPO、强化学习,但只有 1 处解释过 MDP 和贝尔曼方程。 这套教程就是那缺失的一层:从「吃什么」这种日常决策讲起,一路到 ChatGPT 的对齐是怎么训出来的。
🎯 先看清它在解什么问题 💰 直接看地基那一章0%
你的进度(在每章末尾点「打卡」,保存在本浏览器里)
🕳️ 它填的是哪个洞
这些地方都默认你已经懂强化学习了:
全景导论 04
训练三阶段讲 RLHF
「PPO 在优化什么」
全景导论 12
对齐讲奖励模型
「奖励怎么变成梯度」
推荐算法 13
用 Thompson Sampling
「探索利用为何是两难」
智能体工程
Agent 自己决定下一步
「序贯决策的框架」
⬇
这一层就是本教程要补的
- MDP 建模
- 价值函数
- 贝尔曼方程
- 动态规划
- 蒙特卡洛 / 时序差分
- Q-learning
- 探索与利用
- DQN
- 策略梯度
- Actor-Critic
- PPO
- RLHF / DPO
⭐ 三章是高光
第 3 章 · 价值函数与贝尔曼方程
整个强化学习就建立在这一个方程上。它之后的所有算法,都是在用不同办法解它。
整个强化学习就建立在这一个方程上。它之后的所有算法,都是在用不同办法解它。
第 11 章 · PPO
现在实际在用的那个。理解它,你就知道为什么 RL 训练那么不稳定,以及怎么治。
现在实际在用的那个。理解它,你就知道为什么 RL 训练那么不稳定,以及怎么治。
第 12 章 · RLHF 全流程
把前 11 章的零件全部串起来 —— 你会看到每一个都落在什么位置。
把前 11 章的零件全部串起来 —— 你会看到每一个都落在什么位置。