🏠 总目录📚 本教程 01 · 在解什么问题
📑 本页目录(点开跳转)

01 · 强化学习在解什么问题

20 分钟 | ⭐ 先把问题看清,再谈算法


🎯 一句话

强化学习解决的是序贯决策问题: 你要做一连串决定,每个决定影响后面的局面,而好坏要很久以后才知道。


🍽️ 一个你每天都在做的强化学习问题

   问题:中午吃什么

   · 你有 20 家常去的店(动作)
   · 每次吃完有个体验分(奖励)
   · 你不知道没试过的店好不好吃(环境未知)
   · 今天吃了川菜,明天可能就不想再吃(状态会变)
   · 你想让【这一年】吃得最爽,不是这一顿   ⭐

   → 该去熟悉的 8 分店,还是试试没去过的?

这里已经有了强化学习的全部要素。再看一个正经的

   问题:训练一个语言模型说人话

   · 状态 = 已经生成的那些 token
   · 动作 = 下一个 token 选什么
   · 奖励 = 人类(或奖励模型)对【整段回答】打的分   ⭐ 延迟
   · 目标 = 让整段回答的得分最高,不是每个 token 局部最优

   → 这就是 RLHF。第 12 章会完整拆开

🆚 一、和监督学习的三个根本区别

监督学习 强化学习
反馈 每个样本都有正确答案 只有奖励分数,不告诉你正确动作是什么 ⭐
反馈时机 立刻 可能延迟很久(下完整盘棋才知道输赢)
数据来源 给定的固定数据集 你的策略决定你看到什么数据 ⭐⭐

💡 把第一点说透:「奖励」和「标签」差在哪

   监督学习的标签:「这张图是猫」
                   → 直接告诉你答案

   强化学习的奖励:「你刚才那步棋,最后输了」
                   → 只告诉你【结果不好】
                   → 不告诉你【该走哪一步】      ⭐
                   → 也不告诉你【是哪一步的错】  ⭐⭐

🔑 这叫「信用分配问题」(credit assignment): 一局棋 80 步,最后输了 —— 是第 12 步的失误,还是第 60 步? 整个强化学习理论的核心,就是在解决这件事(第 3 章的价值函数就是答案)。

💡 把第三点说透:为什么「数据自己造」这么要命

   监督学习:
   数据集固定 → 你换个模型,数据还是那些
   → 训练是【稳定】的:同样的数据,梯度方向大致一致

   强化学习:
   策略 π 决定你去哪些状态 → 你更新了 π,看到的状态就变了
   → 相当于【每走一步,训练集就被换掉一次】  💀

   后果:
   · 训练极不稳定,可能突然崩掉
   · 「刚才学到的东西」可能因为分布变了而失效
   · 超参数敏感得多

第 11 章 PPO 存在的全部理由,就是解决这个问题限制策略每次更新的幅度,别让数据分布变得太快。


🧩 二、强化学习的五个零件

智能体 Agent按策略 π 决定做什么
动作 a作用到环境上
环境 Environment局面改变,并给出反馈
状态 s、奖励 r回传给智能体,进入下一轮

↻ 这是一个闭环:最后一格的 s 和 r 又回到第一格的智能体,如此反复。

零件 记号 是什么 吃饭例子 RLHF 例子
状态 s 现在的局面 今天星期几、昨天吃了啥 已生成的 token
动作 a 你能做什么 选哪家店 下一个 token
奖励 r 环境给的即时分数 这顿好不好吃 奖励模型打分
策略 π 你的决策规则 「周一吃面,其他随机」 语言模型本身 ⭐
回合 episode 一次完整的过程 这一年 一段完整回答

🔑 最重要的是「策略 π」—— 它就是你要学的那个东西。 π(a|s) = 在状态 s 下选动作 a 的概率。 ⭐ 在 RLHF 里,语言模型本身就是策略 —— 这个对应关系记住,第 12 章会一直用。


⚖️ 三、探索与利用:一个无法回避的两难

   利用(Exploit):选目前已知最好的
   探索(Explore):试试没试过的,可能更好

   ⚠️ 只利用 → 永远发现不了更好的(陷在局部最优)
   ⚠️ 只探索 → 一直在试错,从不享受成果

一个具体的数字例子

   两家店:
   A 店:试过 10 次,平均 7 分
   B 店:试过 1 次,得了 6 分

   ❓ 明天去哪?

   → 只看均值:去 A(7 > 6)
   → 但 B 只试了 1 次,那个 6 分可能是偶然
      B 的真实水平可能是 8 分!⭐

   ⭐ 关键洞察:不确定性本身就是探索的理由
      试得少的选项,值得多给几次机会

🔗 这正是推荐算法第 13 章里 Thompson Sampling 在做的事 —— 那一章告诉你怎么用, 第 7 章告诉你为什么它是对的。


🎯 四、目标:最大化「累积奖励」,不是即时奖励

   ❌ 贪心:每步都选即时奖励最大的
   ✅ 强化学习:最大化【整个回合的累积奖励】

   经典反例(迷宫):
   眼前有个 +1 的糖果,但捡了会掉进坑(-100)
   → 贪心会去捡;正确策略是绕开

折扣因子 γ(后面每章都会见到):

$$G_t = r_{t+1} + \gamma r_{t+2} + \gamma^2 r_{t+3} + \cdots$$

💡 人话未来的奖励要打折 —— 现在的 1 分比 10 步之后的 1 分值钱。

γ 取值 效果 什么时候用
γ = 0 只看眼前一步(纯贪心) 几乎不用
γ = 0.9 大约看未来 10 步 常用默认
γ = 0.99 大约看未来 100 步 长期任务 ⭐
γ = 1 完全不打折 只能用在有限回合,否则和会发散

💡 一个记忆诀窍有效视野 ≈ 1/(1−γ)。 γ=0.99 → 1/0.01 = 100 步。调 γ 时心里要有这个数。


🗺️ 五、什么问题适合用强化学习

✅ 适合 ❌ 不适合
决策有先后依赖(这步影响下步) 每个样本独立同分布
明确的奖励信号 说不清什么叫"做得好" ⭐
大量试错(有模拟器 / 数据便宜) 试错代价极高且无法模拟
关心长期累积收益 只关心单次预测准不准

⚠️ 最容易被忽略的是第二条强化学习的效果上限,等于你的奖励函数设计得多好。 奖励设计错了,模型会忠实地去优化那个错的东西 —— 这叫「奖励黑客」(reward hacking)。

真实案例:训练赛艇 AI 拿高分,它发现在原地转圈刷道具分比完成比赛得分更高 → 它学会了原地转圈。它没错,是奖励函数错了。

🔗 全景导论第 12 章讲的对齐问题,根子就在这。


🔗 六、和站内其他章的关系

相关的地方 这里的位置
推荐算法 13 Thompson Sampling 探索利用的一个具体解法(第 7 章讲原理)
全景导论 04 RLHF 本教程第 12 章会完整拆开
全景导论 12 对齐 奖励函数设计问题的延伸
智能体工程的 Agent 循环 序贯决策的工程版本
ML基础第 9 章梯度下降 第 9 章策略梯度要用

✅ 检查点

  1. 强化学习和监督学习在「反馈」上的区别是什么?
  2. 什么是信用分配问题?为什么它是核心难点?
  3. 为什么说「数据是自己造的」导致训练不稳定?哪一章在解决它?
  4. 五个零件分别是什么?在 RLHF 里策略对应什么?
  5. 用那个两家店的例子说明:为什么不确定性本身是探索的理由?
  6. γ = 0.99 大约对应看多远?公式是什么?
  7. 什么是奖励黑客?举个例子。
👀 答案
  1. 监督学习每个样本都有正确答案;强化学习只有奖励分数,不告诉你正确动作是什么,而且可能延迟很久才给。
  2. 一局棋 80 步最后输了,不知道是哪一步的错。它是核心难点因为奖励延迟,必须把最终结果合理地分摊到中间每一步上。第 3 章的价值函数就是答案。
  3. 因为策略决定你去哪些状态,策略一更新,看到的数据分布就变 —— 相当于每走一步训练集就被换掉一次。第 11 章 PPO 就是为了解决它(限制每次更新幅度)。
  4. 状态 s、动作 a、奖励 r、策略 π、回合 episode。RLHF 里语言模型本身就是策略
  5. A 试过 10 次均值 7 分,B 只试过 1 次得 6 分。B 的样本太少,那个 6 分可能是偶然,真实水平可能是 8 分。试得少 = 不确定性大 = 值得多给机会。
  6. 约 100 步。有效视野 ≈ 1/(1−γ) = 1/0.01 = 100。
  7. 模型忠实地优化了你写错的奖励函数。例子:训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分高,于是学会了原地转圈。

🛑 可以停在这里

走神救援

RL 解决序贯决策做一连串决定,每个影响后面的局面,好坏很久以后才知道。"中午吃什么"就有全部要素(⭐目标是这一年吃得最爽、不是这一顿);RLHF 也是(状态=已生成的 token、动作=下一个 token、奖励=对整段回答打的分⭐延迟)。和监督学习三个根本区别:①只有奖励分数、不是正确答案——它只说"你那步棋最后输了",既不告诉你该走哪步,也不告诉你是哪步的错;②反馈可能延迟很久;③⭐⭐数据是自己造的——策略决定你去哪些状态,💀相当于每走一步训练集就被换掉一次,训练因此极不稳定,⭐第 11 章 PPO 存在的全部理由就是限制每次更新的幅度。⭐信用分配问题:一局棋 80 步输了,是第 12 步还是第 60 步的失误?整个强化学习理论的核心就是在解决这件事,价值函数就是答案。五个零件:状态、动作、奖励、⭐策略 π——就是你要学的那个东西RLHF 里语言模型本身就是策略)、回合。探索与利用:⚠️只利用就陷在局部最优,只探索就从不享受成果。⭐关键洞察:不确定性本身就是探索的理由——A 店试过 10 次平均 7 分、B 店只试过 1 次得 6 分,看均值该去 A,但 B 那 6 分可能是偶然,真实水平也许是 8 分目标是累积奖励不是即时奖励(眼前 +1 的糖果,捡了会掉进 −100 的坑)。折扣因子 γ:⭐有效视野 ≈ 1/(1−γ),γ=0.99 约看 100 步,⚠️γ=1 只能用在有限回合,否则会发散。⚠️效果上限等于你的奖励函数设计得多好——💀训练赛艇 AI,它发现原地转圈刷道具分比完成比赛得分更高,于是学会了原地转圈。它没错,是奖励函数错了,这叫奖励黑客

下一节 👉 02-MDP.md

打卡记录保存在你的浏览器里,首页能看到总进度