📑 本页目录(点开跳转)
01 · 强化学习在解什么问题
⏱ 20 分钟 | ⭐ 先把问题看清,再谈算法
🎯 一句话
强化学习解决的是序贯决策问题: 你要做一连串决定,每个决定影响后面的局面,而好坏要很久以后才知道。
🍽️ 一个你每天都在做的强化学习问题
问题:中午吃什么
· 你有 20 家常去的店(动作)
· 每次吃完有个体验分(奖励)
· 你不知道没试过的店好不好吃(环境未知)
· 今天吃了川菜,明天可能就不想再吃(状态会变)
· 你想让【这一年】吃得最爽,不是这一顿 ⭐
→ 该去熟悉的 8 分店,还是试试没去过的?
这里已经有了强化学习的全部要素。再看一个正经的:
问题:训练一个语言模型说人话
· 状态 = 已经生成的那些 token
· 动作 = 下一个 token 选什么
· 奖励 = 人类(或奖励模型)对【整段回答】打的分 ⭐ 延迟
· 目标 = 让整段回答的得分最高,不是每个 token 局部最优
→ 这就是 RLHF。第 12 章会完整拆开
🆚 一、和监督学习的三个根本区别
| 监督学习 | 强化学习 | |
|---|---|---|
| 反馈 | 每个样本都有正确答案 | 只有奖励分数,不告诉你正确动作是什么 ⭐ |
| 反馈时机 | 立刻 | 可能延迟很久(下完整盘棋才知道输赢) |
| 数据来源 | 给定的固定数据集 | 你的策略决定你看到什么数据 ⭐⭐ |
💡 把第一点说透:「奖励」和「标签」差在哪
监督学习的标签:「这张图是猫」
→ 直接告诉你答案
强化学习的奖励:「你刚才那步棋,最后输了」
→ 只告诉你【结果不好】
→ 不告诉你【该走哪一步】 ⭐
→ 也不告诉你【是哪一步的错】 ⭐⭐
🔑 这叫「信用分配问题」(credit assignment): 一局棋 80 步,最后输了 —— 是第 12 步的失误,还是第 60 步? 整个强化学习理论的核心,就是在解决这件事(第 3 章的价值函数就是答案)。
💡 把第三点说透:为什么「数据自己造」这么要命
监督学习:
数据集固定 → 你换个模型,数据还是那些
→ 训练是【稳定】的:同样的数据,梯度方向大致一致
强化学习:
策略 π 决定你去哪些状态 → 你更新了 π,看到的状态就变了
→ 相当于【每走一步,训练集就被换掉一次】 💀
后果:
· 训练极不稳定,可能突然崩掉
· 「刚才学到的东西」可能因为分布变了而失效
· 超参数敏感得多
⭐ 第 11 章 PPO 存在的全部理由,就是解决这个问题: 限制策略每次更新的幅度,别让数据分布变得太快。
🧩 二、强化学习的五个零件
↻ 这是一个闭环:最后一格的 s 和 r 又回到第一格的智能体,如此反复。
| 零件 | 记号 | 是什么 | 吃饭例子 | RLHF 例子 |
|---|---|---|---|---|
| 状态 | s | 现在的局面 | 今天星期几、昨天吃了啥 | 已生成的 token |
| 动作 | a | 你能做什么 | 选哪家店 | 下一个 token |
| 奖励 | r | 环境给的即时分数 | 这顿好不好吃 | 奖励模型打分 |
| 策略 | π | 你的决策规则 ⭐ | 「周一吃面,其他随机」 | 语言模型本身 ⭐ |
| 回合 | episode | 一次完整的过程 | 这一年 | 一段完整回答 |
🔑 最重要的是「策略 π」—— 它就是你要学的那个东西。 π(a|s) = 在状态 s 下选动作 a 的概率。 ⭐ 在 RLHF 里,语言模型本身就是策略 —— 这个对应关系记住,第 12 章会一直用。
⚖️ 三、探索与利用:一个无法回避的两难
利用(Exploit):选目前已知最好的
探索(Explore):试试没试过的,可能更好
⚠️ 只利用 → 永远发现不了更好的(陷在局部最优)
⚠️ 只探索 → 一直在试错,从不享受成果
一个具体的数字例子:
两家店:
A 店:试过 10 次,平均 7 分
B 店:试过 1 次,得了 6 分
❓ 明天去哪?
→ 只看均值:去 A(7 > 6)
→ 但 B 只试了 1 次,那个 6 分可能是偶然
B 的真实水平可能是 8 分!⭐
⭐ 关键洞察:不确定性本身就是探索的理由
试得少的选项,值得多给几次机会
🔗 这正是推荐算法第 13 章里 Thompson Sampling 在做的事 —— 那一章告诉你怎么用, 第 7 章告诉你为什么它是对的。
🎯 四、目标:最大化「累积奖励」,不是即时奖励
❌ 贪心:每步都选即时奖励最大的
✅ 强化学习:最大化【整个回合的累积奖励】
经典反例(迷宫):
眼前有个 +1 的糖果,但捡了会掉进坑(-100)
→ 贪心会去捡;正确策略是绕开
折扣因子 γ(后面每章都会见到):
$$G_t = r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} + \cdots$$
💡 人话:未来的奖励要打折 —— 现在的 1 分比 10 步之后的 1 分值钱。
| γ 取值 | 效果 | 什么时候用 |
|---|---|---|
| γ = 0 | 只看眼前一步(纯贪心) | 几乎不用 |
| γ = 0.9 | 大约看未来 10 步 | 常用默认 |
| γ = 0.99 | 大约看未来 100 步 | 长期任务 ⭐ |
| γ = 1 | 完全不打折 | 只能用在有限回合,否则和会发散 |
💡 一个记忆诀窍:有效视野 ≈ 1/(1−γ)。 γ=0.99 → 1/0.01 = 100 步。调 γ 时心里要有这个数。
🗺️ 五、什么问题适合用强化学习
| ✅ 适合 | ❌ 不适合 |
|---|---|
| 决策有先后依赖(这步影响下步) | 每个样本独立同分布 |
| 有明确的奖励信号 | 说不清什么叫"做得好" ⭐ |
| 能大量试错(有模拟器 / 数据便宜) | 试错代价极高且无法模拟 |
| 关心长期累积收益 | 只关心单次预测准不准 |
⚠️ 最容易被忽略的是第二条: 强化学习的效果上限,等于你的奖励函数设计得多好。 奖励设计错了,模型会忠实地去优化那个错的东西 —— 这叫「奖励黑客」(reward hacking)。
真实案例:训练赛艇 AI 拿高分,它发现在原地转圈刷道具分比完成比赛得分更高 → 它学会了原地转圈。它没错,是奖励函数错了。
🔗 全景导论第 12 章讲的对齐问题,根子就在这。
🔗 六、和站内其他章的关系
| 相关的地方 | 这里的位置 |
|---|---|
| 推荐算法 13 Thompson Sampling | 探索利用的一个具体解法(第 7 章讲原理) |
| 全景导论 04 RLHF | 本教程第 12 章会完整拆开 |
| 全景导论 12 对齐 | 奖励函数设计问题的延伸 |
| 智能体工程的 Agent 循环 | 序贯决策的工程版本 |
| ML基础第 9 章梯度下降 | 第 9 章策略梯度要用 |
✅ 检查点
- 强化学习和监督学习在「反馈」上的区别是什么?
- 什么是信用分配问题?为什么它是核心难点?
- 为什么说「数据是自己造的」导致训练不稳定?哪一章在解决它?
- 五个零件分别是什么?在 RLHF 里策略对应什么?
- 用那个两家店的例子说明:为什么不确定性本身是探索的理由?
- γ = 0.99 大约对应看多远?公式是什么?
- 什么是奖励黑客?举个例子。
👀 答案
- 监督学习每个样本都有正确答案;强化学习只有奖励分数,不告诉你正确动作是什么,而且可能延迟很久才给。
- 一局棋 80 步最后输了,不知道是哪一步的错。它是核心难点因为奖励延迟,必须把最终结果合理地分摊到中间每一步上。第 3 章的价值函数就是答案。
- 因为策略决定你去哪些状态,策略一更新,看到的数据分布就变 —— 相当于每走一步训练集就被换掉一次。第 11 章 PPO 就是为了解决它(限制每次更新幅度)。
- 状态 s、动作 a、奖励 r、策略 π、回合 episode。RLHF 里语言模型本身就是策略。
- A 试过 10 次均值 7 分,B 只试过 1 次得 6 分。B 的样本太少,那个 6 分可能是偶然,真实水平可能是 8 分。试得少 = 不确定性大 = 值得多给机会。
- 约 100 步。有效视野 ≈ 1/(1−γ) = 1/0.01 = 100。
- 模型忠实地优化了你写错的奖励函数。例子:训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分高,于是学会了原地转圈。
🛑 可以停在这里
⚡ 走神救援
RL 解决序贯决策:做一连串决定,每个影响后面的局面,好坏很久以后才知道。"中午吃什么"就有全部要素(⭐目标是这一年吃得最爽、不是这一顿);RLHF 也是(状态=已生成的 token、动作=下一个 token、奖励=对整段回答打的分⭐延迟)。和监督学习三个根本区别:①只有奖励分数、不是正确答案——它只说"你那步棋最后输了",既不告诉你该走哪步,也不告诉你是哪步的错;②反馈可能延迟很久;③⭐⭐数据是自己造的——策略决定你去哪些状态,💀相当于每走一步训练集就被换掉一次,训练因此极不稳定,⭐第 11 章 PPO 存在的全部理由就是限制每次更新的幅度。⭐信用分配问题:一局棋 80 步输了,是第 12 步还是第 60 步的失误?整个强化学习理论的核心就是在解决这件事,价值函数就是答案。五个零件:状态、动作、奖励、⭐策略 π——就是你要学的那个东西(RLHF 里语言模型本身就是策略)、回合。探索与利用:⚠️只利用就陷在局部最优,只探索就从不享受成果。⭐关键洞察:不确定性本身就是探索的理由——A 店试过 10 次平均 7 分、B 店只试过 1 次得 6 分,看均值该去 A,但 B 那 6 分可能是偶然,真实水平也许是 8 分。目标是累积奖励不是即时奖励(眼前 +1 的糖果,捡了会掉进 −100 的坑)。折扣因子 γ:⭐有效视野 ≈ 1/(1−γ),γ=0.99 约看 100 步,⚠️γ=1 只能用在有限回合,否则会发散。⚠️效果上限等于你的奖励函数设计得多好——💀训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分更高,于是学会了原地转圈。它没错,是奖励函数错了,这叫奖励黑客。
下一节 👉 02-MDP.md ⭐