📑 本页目录(点开跳转)
01 · 强化学习在解什么问题
⏱ 20 分钟 | ⭐ 先把问题看清,再谈算法
🎯 一句话
强化学习解决的是序贯决策问题: 你要做一连串决定,每个决定影响后面的局面,而好坏要很久以后才知道。
🍽️ 一个你每天都在做的强化学习问题
操作步骤
这里已经有了强化学习的全部要素。再看一个正经的:
算一算
问题:训练一个语言模型说人话
· 状态 = 已经生成的那些 token
· 动作 = 下一个 token 选什么
· 奖励 = 人类(或奖励模型)对【整段回答】打的分 ⭐ 延迟
· 目标 = 让整段回答的得分最高,不是每个 token 局部最优
→ 这就是 RLHF。第 12 章会完整拆开
🆚 一、和监督学习的三个根本区别
| 监督学习 | 强化学习 | |
|---|---|---|
| 反馈 | 每个样本都有正确答案 | 只有奖励分数,不告诉你正确动作是什么 ⭐ |
| 反馈时机 | 立刻 | 可能延迟很久(下完整盘棋才知道输赢) |
| 数据来源 | 给定的固定数据集 | 你的策略决定你看到什么数据 ⭐ |
💡 把第一点说透:「奖励」和「标签」差在哪
操作步骤
🔑 这叫「信用分配问题」(credit assignment): 一局棋 80 步,最后输了 —— 是第 12 步的失误,还是第 60 步? 整个强化学习理论的核心,就是在解决这件事(第 3 章的价值函数就是答案)。
💡 把第三点说透:为什么「数据自己造」这么要命
因果链
⭐ 第 11 章 PPO 存在的全部理由,就是解决这个问题: 限制策略每次更新的幅度,别让数据分布变得太快。
🧩 二、强化学习的五个零件
↻ 这是一个闭环:最后一格的 s 和 r 又回到第一格的智能体,如此反复。
| 零件 | 记号 | 是什么 | 吃饭例子 | RLHF 例子 |
|---|---|---|---|---|
| 状态 | s | 现在的局面 | 今天星期几、昨天吃了啥 | 已生成的 token |
| 动作 | a | 你能做什么 | 选哪家店 | 下一个 token |
| 奖励 | r | 环境给的即时分数 | 这顿好不好吃 | 奖励模型打分 |
| 策略 | π | 你的决策规则 ⭐ | 「周一吃面,其他随机」 | 语言模型本身 ⭐ |
| 回合 | episode | 一次完整的过程 | 这一年 | 一段完整回答 |
🔑 最重要的是「策略 π」—— 它就是你要学的那个东西。 π(a|s) = 在状态 s 下选动作 a 的概率。 ⭐ 在 RLHF 里,语言模型本身就是策略 —— 这个对应关系记住,第 12 章会一直用。
⚖️ 三、探索与利用:一个无法回避的两难
信息关系
一个具体的数字例子:
结果对照
🔗 这正是推荐算法第 13 章里 Thompson Sampling 在做的事 —— 那一章告诉你怎么用, 第 7 章告诉你为什么它是对的。
🎯 四、目标:最大化「累积奖励」,不是即时奖励
结果对照
折扣因子 γ(后面每章都会见到):
$$G_t = r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} + \cdots$$
💡 人话:未来的奖励要打折 —— 现在的 1 分比 10 步之后的 1 分值钱。
| γ 取值 | 效果 | 什么时候用 |
|---|---|---|
| γ = 0 | 只看眼前一步(纯贪心) | 几乎不用 |
| γ = 0.9 | 大约看未来 10 步 | 常用默认 |
| γ = 0.99 | 大约看未来 100 步 | 长期任务 ⭐ |
| γ = 1 | 完全不打折 | 只能用在有限回合,否则和会发散 |
💡 一个记忆诀窍:有效视野 ≈ 1/(1−γ)。 γ=0.99 → 1/0.01 = 100 步。调 γ 时心里要有这个数。
🗺️ 五、什么问题适合用强化学习
| ✅ 适合 | ❌ 不适合 |
|---|---|
| 决策有先后依赖(这步影响下步) | 每个样本独立同分布 |
| 有明确的奖励信号 | 说不清什么叫"做得好" ⭐ |
| 能大量试错(有模拟器 / 数据便宜) | 试错代价极高且无法模拟 |
| 关心长期累积收益 | 只关心单次预测准不准 |
⚠️ 最容易被忽略的是第二条: 强化学习的效果上限,等于你的奖励函数设计得多好。 奖励设计错了,模型会忠实地去优化那个错的东西 —— 这叫「奖励黑客」(reward hacking)。
真实案例:训练赛艇 AI 拿高分,它发现在原地转圈刷道具分比完成比赛得分更高 → 它学会了原地转圈。它没错,是奖励函数错了。
🔗 全景导论第 12 章讲的对齐问题,根子就在这。
🔗 六、和站内其他章的关系
| 相关的地方 | 这里的位置 |
|---|---|
| 推荐算法 13 Thompson Sampling | 探索利用的一个具体解法(第 7 章讲原理) |
| 全景导论主线 4 · 它怎样从续写机变助手 RLHF | 本教程第 12 章会完整拆开 |
| 全景导论 12 对齐 | 奖励函数设计问题的延伸 |
| 智能体工程的 Agent 循环 | 序贯决策的工程版本 |
| ML基础第 9 章梯度下降 | 第 9 章策略梯度要用 |
✅ 检查点
- 强化学习和监督学习在「反馈」上的区别是什么?
- 什么是信用分配问题?为什么它是核心难点?
- 为什么说「数据是自己造的」导致训练不稳定?哪一章在解决它?
- 五个零件分别是什么?在 RLHF 里策略对应什么?
- 用那个两家店的例子说明:为什么不确定性本身是探索的理由?
- γ = 0.99 大约对应看多远?公式是什么?
- 什么是奖励黑客?举个例子。
👀 答案
- 监督学习每个样本都有正确答案;强化学习只有奖励分数,不告诉你正确动作是什么,而且可能延迟很久才给。
- 一局棋 80 步最后输了,不知道是哪一步的错。它是核心难点因为奖励延迟,必须把最终结果合理地分摊到中间每一步上。第 3 章的价值函数就是答案。
- 因为策略决定你去哪些状态,策略一更新,看到的数据分布就变 —— 相当于每走一步训练集就被换掉一次。第 11 章 PPO 就是为了解决它(限制每次更新幅度)。
- 状态 s、动作 a、奖励 r、策略 π、回合 episode。RLHF 里语言模型本身就是策略。
- A 试过 10 次均值 7 分,B 只试过 1 次得 6 分。B 的样本太少,那个 6 分可能是偶然,真实水平可能是 8 分。试得少 = 不确定性大 = 值得多给机会。
- 约 100 步。有效视野 ≈ 1/(1−γ) = 1/0.01 = 100。
- 模型忠实地优化了你写错的奖励函数。例子:训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分高,于是学会了原地转圈。
🛑 可以停在这里
⚡ 走神救援
先记住这几件事
- 策略决定怎样行动,目标通常是累计回报而非眼前奖励。
- 奖励可能延迟,探索又影响未来数据;不能照搬固定训练集的直觉。
- 先检查奖励是否代表真实目标,否则模型可能学会钻评分规则的空子。
下一节 👉 02-MDP.md ⭐