🏠 总目录📚 本教程 01 · 在解什么问题 ← →
📑 本页目录(点开跳转)

01 · 强化学习在解什么问题

⏱ 20 分钟 | ⭐ 先把问题看清,再谈算法


🎯 一句话

强化学习解决的是序贯决策问题: 你要做一连串决定,每个决定影响后面的局面,而好坏要很久以后才知道。


🍽️ 一个你每天都在做的强化学习问题

操作步骤

问题:中午吃什么
· 你有 20 家常去的店(动作)
· 每次吃完有个体验分(奖励)
· 你不知道没试过的店好不好吃(环境未知)
· 今天吃了川菜,明天可能就不想再吃(状态会变)
· 你想让【这一年】吃得最爽,不是这一顿 ⭐
该去熟悉的 8 分店,还是试试没去过的?

这里已经有了强化学习的全部要素。再看一个正经的:

算一算

问题:训练一个语言模型说人话

· 状态 = 已经生成的那些 token

· 动作 = 下一个 token 选什么

· 奖励 = 人类(或奖励模型)对【整段回答】打的分 ⭐ 延迟

· 目标 = 让整段回答的得分最高,不是每个 token 局部最优

→ 这就是 RLHF。第 12 章会完整拆开


🆚 一、和监督学习的三个根本区别

监督学习 强化学习
反馈 每个样本都有正确答案 只有奖励分数,不告诉你正确动作是什么 ⭐
反馈时机 立刻 可能延迟很久(下完整盘棋才知道输赢)
数据来源 给定的固定数据集 你的策略决定你看到什么数据 ⭐

💡 把第一点说透:「奖励」和「标签」差在哪

操作步骤

监督学习的标签:「这张图是猫」
直接告诉你答案
强化学习的奖励:「你刚才那步棋,最后输了」
只告诉你【结果不好】
不告诉你【该走哪一步】 ⭐
也不告诉你【是哪一步的错】 ⭐

🔑 这叫「信用分配问题」(credit assignment): 一局棋 80 步,最后输了 —— 是第 12 步的失误,还是第 60 步? 整个强化学习理论的核心,就是在解决这件事(第 3 章的价值函数就是答案)。

💡 把第三点说透:为什么「数据自己造」这么要命

因果链

监督学习:
数据集固定→你换个模型,数据还是那些
训练是【稳定】的:同样的数据,梯度方向大致一致
强化学习:
策略 π 决定你去哪些状态→你更新了 π,看到的状态就变了
相当于【每走一步,训练集就被换掉一次】 💀
后果:
· 训练极不稳定,可能突然崩掉
· 「刚才学到的东西」可能因为分布变了而失效
· 超参数敏感得多

⭐ 第 11 章 PPO 存在的全部理由,就是解决这个问题: 限制策略每次更新的幅度,别让数据分布变得太快。


🧩 二、强化学习的五个零件

智能体 Agent按策略 π 决定做什么
→
动作 a作用到环境上
→
环境 Environment局面改变,并给出反馈
→
状态 s、奖励 r回传给智能体,进入下一轮

↻ 这是一个闭环:最后一格的 s 和 r 又回到第一格的智能体,如此反复。

零件 记号 是什么 吃饭例子 RLHF 例子
状态 s 现在的局面 今天星期几、昨天吃了啥 已生成的 token
动作 a 你能做什么 选哪家店 下一个 token
奖励 r 环境给的即时分数 这顿好不好吃 奖励模型打分
策略 π 你的决策规则 ⭐ 「周一吃面,其他随机」 语言模型本身 ⭐
回合 episode 一次完整的过程 这一年 一段完整回答

🔑 最重要的是「策略 π」—— 它就是你要学的那个东西。 π(a|s) = 在状态 s 下选动作 a 的概率。 ⭐ 在 RLHF 里,语言模型本身就是策略 —— 这个对应关系记住,第 12 章会一直用。


⚖️ 三、探索与利用:一个无法回避的两难

信息关系

利用(Exploit):选目前已知最好的
探索(Explore):试试没试过的,可能更好
⚠️ 只利用→永远发现不了更好的(陷在局部最优)
⚠️ 只探索→一直在试错,从不享受成果

一个具体的数字例子:

结果对照

两家店:
A 店:试过 10 次,平均 7 分
B 店:试过 1 次,得了 6 分
❓ 明天去哪?
只看均值:去 A(7 > 6)
但 B 只试了 1 次,那个 6 分可能是偶然
B 的真实水平可能是 8 分!⭐
⭐ 关键洞察:不确定性本身就是探索的理由
试得少的选项,值得多给几次机会

🔗 这正是推荐算法第 13 章里 Thompson Sampling 在做的事 —— 那一章告诉你怎么用, 第 7 章告诉你为什么它是对的。


🎯 四、目标:最大化「累积奖励」,不是即时奖励

结果对照

❌ 贪心:每步都选即时奖励最大的
✅ 强化学习:最大化【整个回合的累积奖励】
经典反例(迷宫):
眼前有个 +1 的糖果,但捡了会掉进坑(-100)
贪心会去捡;正确策略是绕开

折扣因子 γ(后面每章都会见到):

$$G_t = r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} + \cdots$$

💡 人话:未来的奖励要打折 —— 现在的 1 分比 10 步之后的 1 分值钱。

γ 取值 效果 什么时候用
γ = 0 只看眼前一步(纯贪心) 几乎不用
γ = 0.9 大约看未来 10 步 常用默认
γ = 0.99 大约看未来 100 步 长期任务 ⭐
γ = 1 完全不打折 只能用在有限回合,否则和会发散

💡 一个记忆诀窍:有效视野 ≈ 1/(1−γ)。 γ=0.99 → 1/0.01 = 100 步。调 γ 时心里要有这个数。


🗺️ 五、什么问题适合用强化学习

✅ 适合 ❌ 不适合
决策有先后依赖(这步影响下步) 每个样本独立同分布
有明确的奖励信号 说不清什么叫"做得好" ⭐
能大量试错(有模拟器 / 数据便宜) 试错代价极高且无法模拟
关心长期累积收益 只关心单次预测准不准

⚠️ 最容易被忽略的是第二条: 强化学习的效果上限,等于你的奖励函数设计得多好。 奖励设计错了,模型会忠实地去优化那个错的东西 —— 这叫「奖励黑客」(reward hacking)。

真实案例:训练赛艇 AI 拿高分,它发现在原地转圈刷道具分比完成比赛得分更高 → 它学会了原地转圈。它没错,是奖励函数错了。

🔗 全景导论第 12 章讲的对齐问题,根子就在这。


🔗 六、和站内其他章的关系

相关的地方 这里的位置
推荐算法 13 Thompson Sampling 探索利用的一个具体解法(第 7 章讲原理)
全景导论主线 4 · 它怎样从续写机变助手 RLHF 本教程第 12 章会完整拆开
全景导论 12 对齐 奖励函数设计问题的延伸
智能体工程的 Agent 循环 序贯决策的工程版本
ML基础第 9 章梯度下降 第 9 章策略梯度要用

✅ 检查点

  1. 强化学习和监督学习在「反馈」上的区别是什么?
  2. 什么是信用分配问题?为什么它是核心难点?
  3. 为什么说「数据是自己造的」导致训练不稳定?哪一章在解决它?
  4. 五个零件分别是什么?在 RLHF 里策略对应什么?
  5. 用那个两家店的例子说明:为什么不确定性本身是探索的理由?
  6. γ = 0.99 大约对应看多远?公式是什么?
  7. 什么是奖励黑客?举个例子。
👀 答案
  1. 监督学习每个样本都有正确答案;强化学习只有奖励分数,不告诉你正确动作是什么,而且可能延迟很久才给。
  2. 一局棋 80 步最后输了,不知道是哪一步的错。它是核心难点因为奖励延迟,必须把最终结果合理地分摊到中间每一步上。第 3 章的价值函数就是答案。
  3. 因为策略决定你去哪些状态,策略一更新,看到的数据分布就变 —— 相当于每走一步训练集就被换掉一次。第 11 章 PPO 就是为了解决它(限制每次更新幅度)。
  4. 状态 s、动作 a、奖励 r、策略 π、回合 episode。RLHF 里语言模型本身就是策略。
  5. A 试过 10 次均值 7 分,B 只试过 1 次得 6 分。B 的样本太少,那个 6 分可能是偶然,真实水平可能是 8 分。试得少 = 不确定性大 = 值得多给机会。
  6. 约 100 步。有效视野 ≈ 1/(1−γ) = 1/0.01 = 100。
  7. 模型忠实地优化了你写错的奖励函数。例子:训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分高,于是学会了原地转圈。

🛑 可以停在这里

⚡ 走神救援

先记住这几件事

下一节 👉 02-MDP.md ⭐

打卡记录保存在你的浏览器里,首页能看到总进度