📑 本页目录(点开跳转)
01 · 第一天:三个游戏
⏱ 28 分钟 | ⭐ 不讲定义,先让你亲手撞上三堵墙
🎯 一句话
这一章一个公式都不推,只让你玩三个小游戏 —— 每一个都会在某个地方卡住,而那三个卡点就是后面 25 章要解决的三件事。
⭐ 现在完全不需要记住任何术语。你只要记住「咦,这里好像不太对劲」的那三个瞬间就够了。
🎲 游戏一:石头剪刀布,最优出法是什么?
规则你已经会了。问题只有一个:你应该怎么出?
先试着找一个答案
假设你决定「每次都出石头」。玩十把没问题吗?
对手第三把就发现了,之后每把出布。你从此一直输。
「那我出剪刀。」—— 对手改出石头。「那我出布。」—— 对手改出剪刀。
⭐⭐ 停在这里想一秒:你能不能找到一个固定的出法,让对手拿你没办法?
答案是不能。这张表里的每个动作都被另一个动作克制:
| 我 \ 对手 | 石头 | 剪刀 | 布 |
|---|---|---|---|
| 石头 | 0 | +1 | −1 |
| 剪刀 | −1 | 0 | +1 |
| 布 | +1 | −1 | 0 |
(数字是我的输赢:+1 赢、0 平、−1 输。)
⭐ 每一行都有一个 −1 —— 不管我固定出什么,对手总有一个动作让我输。
💥 第一堵墙
⭐⭐ 在有对手的世界里,「固定的最优选择」这个东西可能根本不存在。
这跟你熟悉的一切优化都不一样。训练模型时,损失函数不会因为你选了某个方向就偷偷变形; 掷骰子时,六个面的概率不会因为你押了 6 就改成 1/7。 ⚠️ 但对手会跟着你调整 —— 你的「最优」一旦被看穿,就不再最优了。
唯一的出路是掷骰子:各 1/3 随机出。这样对手无论怎么应对,期望都是 0,他没法针对你。
💡 注意这句话有多反常:为了不被利用,你必须让自己无法被预测 —— 甚至连你自己都不知道下一把出什么。「最优策略」在这里是一个概率分布,不是一个动作。
⭐ 更反常的还在后面(第 12 章):那个 1/3 不是为了让你自己舒服算出来的, 是为了让对手无所谓算出来的。 几乎所有人第一次都会算反。
这堵墙通向:09 正常形博弈 → 11 纳什均衡 → 12 混合策略 → 13 零和与极大极小
🍰 游戏二:两个室友,三样东西
你和室友合租,房东搬走时留下三样东西:一台冰箱、一个书桌、一把椅子。
你俩对它们的估值不一样(满分 100 分,各自心里的分):
| 冰箱 | 书桌 | 椅子 | 合计 | |
|---|---|---|---|---|
| 你 | 60 | 30 | 10 | 100 |
| 室友 | 40 | 50 | 10 | 100 |
怎么分才算公平? 先自己想 30 秒再往下看。
试一试「各拿自己最想要的」
你拿冰箱(60),室友拿书桌(50),椅子给谁?
假设椅子给你:你拿到 60+10 = 70,室友拿到 50。
现在检查一件事:⭐ 室友会不会觉得你那一份更好? 用他自己的尺子量你那份:冰箱 40 + 椅子 10 = 50。他自己手里也是 50。 打平,他不羡慕你。 ✅
再假设椅子给室友:你 60,室友 50+10 = 60。 用你的尺子量他那份:书桌 30 + 椅子 10 = 40 < 你的 60。你也不羡慕他。 ✅
⭐ 这个性质叫无嫉妒(envy-free):每个人用自己的尺子量,都觉得自己这份不比别人差。 注意它不要求两人分数相等 —— 上面第一种分法里 70 对 50,照样无嫉妒。
💥 第二堵墙:把物品换成一件
现在假设房东只留下一台冰箱,两个人都想要。
冰箱只能给一个人。拿到的人有 60,另一个人有 0。 没拿到的那个人用自己的尺子量:对方手里 40 > 自己的 0。他一定羡慕。
⭐⭐ 无论你怎么分,都做不到无嫉妒。 这不是分法不够聪明,是根本不存在。
💀 第二堵墙:你想要的那个"公平",在数学上可能压根不存在。
那怎么办?⭐ 现实的做法是退一步: 「去掉对方手里的某一件东西之后,我就不羡慕了」—— 上面那个例子里,把冰箱从对方手里拿掉,剩下空的,0 ≥ 0,成立。 这个放松版叫 EF1,它总是能做到(第 19 章、第 20 章)。
⭐ 这是整个板块反复出现的模式: 理想的性质做不到 → 找一个恰好能做到的最强放松版。 学会认这个模式,比记住 EF1 的定义有用得多。
这堵墙通向:19 怎么算公平 → 20 公平分配的算法 → 21 有钱与随机分配
🗳️ 游戏三:三个人投票,选出一个自相矛盾的结果
三个朋友选晚饭去哪:火锅(a)、日料(b)、烧烤(c)。各自的排序:
| 人 | 第一 | 第二 | 第三 |
|---|---|---|---|
| 甲 | a 火锅 | b 日料 | c 烧烤 |
| 乙 | b 日料 | c 烧烤 | a 火锅 |
| 丙 | c 烧烤 | a 火锅 | b 日料 |
三个人吵不出结果,于是决定两两 PK,少数服从多数。
🔨 手算:三场 PK
火锅 vs 日料:谁把 a 排在 b 前面?
| 人 | a 和 b 谁在前 |
|---|---|
| 甲 | a(第 1 vs 第 2)✓ |
| 乙 | b(第 3 vs 第 1)✗ |
| 丙 | a(第 2 vs 第 3)✓ |
2 : 1,火锅赢。 ⭐ a ≻ b
日料 vs 烧烤:甲 b(2 vs 3)✓、乙 b(1 vs 2)✓、丙 c(3 vs 1)✗ → 2 : 1,日料赢。 ⭐ b ≻ c
到这里很自然:火锅打赢日料、日料打赢烧烤,那火锅肯定打赢烧烤吧?
火锅 vs 烧烤:甲 a(1 vs 3)✓、乙 c(3 vs 2)✗、丙 c(2 vs 1)✗
1 : 2 —— 烧烤赢。 ⭐⭐ c ≻ a
💥 第三堵墙
$$a \succ b, \qquad b \succ c, \qquad \textbf{但 } c \succ a$$
⭐⭐ 成环了。 火锅打赢日料、日料打赢烧烤、烧烤打赢火锅 —— 没有一个选项能打赢所有对手。
⚠️ 请注意三个人各自的偏好都是完全正常的:甲乙丙的排序都是传递的(a≻b≻c 这种), 没有任何人不理性。
💀 第三堵墙:一群理性的人,聚合出来的集体偏好可以是不理性的。 「传递性」这个再基本不过的性质,在个体层面成立,在集体层面消失了。
这个环叫 Condorcet 悖论(第 25 章)。 它带来一个非常现实的后果:⭐ 议程可以决定结果。 如果主持人安排「先火锅 PK 日料,赢家再 PK 烧烤」,最后一定是烧烤赢; 换个顺序,赢家就换人。同一群人、同一份偏好,谁定 PK 顺序谁定结果。
⭐⭐ 而 第 26 章会把这件事推到最狠的地步(Arrow 定理): 这不是多数决这一个规则的毛病,而是任何聚合方式都躲不掉的 —— 除非让某一个人说了算。
这堵墙通向:24 投票规则 → 25 Condorcet 与锦标赛解 → 26 不可能定理
🗺️ 三堵墙对应的三块内容
| 你撞到的 | 问题的本质 | 去哪几章 |
|---|---|---|
| 🎲 固定的最优出法不存在 | 对手会针对你 —— 需要「均衡」这个概念 | 07–15 |
| 🍰 无嫉妒可能根本做不到 | 理想性质不存在 —— 需要找恰好能做到的放松版 | 16–23 |
| 🗳️ 集体偏好可以成环 | 好性质凑不齐 —— 需要知道该放弃哪一条 | 24–26 |
⭐ 还有一块没在游戏里出现:02–06 章的逻辑。 它讲的是怎么把「知识」写成机器能推理的形式(命题逻辑、一阶逻辑、分辨率)。 ⚠️ 那五章和上面三块是独立的 —— 想直接学博弈论,从第 7 章开始完全没问题, 不会有任何前置缺失。逻辑那部分适合这几种人:想搞懂 SAT 求解器、想做形式化验证、 或者想知道「知识图谱推理」底下是什么。
💡 一句话预告后面会反复出现的三种思路
| 思路 | 一句话 | 第一次出现 |
|---|---|---|
| 找不动点 | 「谁都不想改」的那个状态叫均衡 | 11 纳什均衡 |
| 改规则而不是劝人 | 坏结果是理性推出来的,教育没用,只能换游戏 | 16 机制设计 |
| 证明做不到 | ⭐ 花时间证明「不存在」,和找到一个算法同样有价值 | 19 怎么算公平、26 不可能定理 |
⭐⭐ 第三条是这门学问最不一样的地方。 在机器学习里,「效果不好」通常意味着「再调调」; 在这里,很多时候答案是「已经证明了,别调了,换个目标」 —— 而知道什么时候该停止寻找,本身就是很值钱的能力。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 07 · 偏好与效用 | ⭐ 想直接学博弈论就从这里开始,不需要读 02–06。它先把「理性」这个词说清楚 |
| 02 · 为什么需要逻辑 | 想先补逻辑地基(命题逻辑 → 一阶逻辑 → 自动推理)走这条 |
| 09 · 正常形博弈 | 游戏一那张表的正式名字,以及为什么「你的最优取决于别人」会让一切变难 |
| ../强化学习基础/02-MDP.html | ⭐ 对照着看很有用:那一套里环境有随机性但不会针对你,所以能算出唯一最优策略。游戏一撞的墙,正是这个前提失效之后的样子 |
| ../推荐算法/15b-广告-从推荐到竞价.html | 想先看这门学问能赚钱的样子:广告拍卖里怎么定价、怎么防止广告主骗你 |
✅ 检查点
- 石头剪刀布里,为什么不存在一个固定的最优出法?从收益表上怎么一眼看出来?
- 掷骰子(随机化)解决了什么问题?为什么说「你必须让自己无法被预测」?
- 两个室友分三样东西那个例子里,「无嫉妒」是怎么验证的?它要求两人分数相等吗?
- 只有一台冰箱时为什么做不到无嫉妒?EF1 是怎么放松的?
- 三人投票的三场 PK 结果分别是什么?环是怎么成的?
- 三个人里有谁不理性吗?那这个环说明了什么?
- 「议程可以决定结果」是什么意思?
- 这门学问和机器学习在「效果不好怎么办」上有什么根本不同?
👀 答案
- 因为每一行都有一个 −1 —— 不管你固定出什么,对手总有一个动作让你输(出石头就被布克、出剪刀就被石头克、出布就被剪刀克)。⭐⭐ 根本原因是对手会跟着你调整:你的「最优」一旦被看穿就不再最优。
- 解决被针对的问题。各 1/3 随机出,对手无论怎么应对期望都是 0,他没法利用你。💡 反常之处:为了不被利用,你必须让自己无法被预测 —— 「最优策略」在这里是一个概率分布而不是一个动作。⭐ 更反常的是那个 1/3 不是让自己舒服算出来的,是让对手无所谓算出来的(第 12 章)。
- ⭐ 每个人用自己的尺子量自己那份和别人那份。例子里椅子给你时:室友用他的尺子量你那份(冰箱 40 + 椅子 10 = 50),和他自己手里的书桌 50 打平,不羡慕 ✅;你用你的尺子量他那份(30)< 你的 70,也不羡慕 ✅。⚠️ 不要求分数相等 —— 70 对 50 照样是无嫉妒的。
- 冰箱只能给一个人,拿到的有 60、另一个有 0;没拿到的用自己尺子量对方(40)> 自己(0),必然羡慕。⭐⭐ 无论怎么分都做不到 —— 不是分法不够聪明,是根本不存在。 EF1 放松成「去掉对方手里的某一件东西之后我就不羡慕了」:把冰箱从对方手里拿掉,0 ≥ 0 成立。⭐ 它总是能做到。
- 火锅 vs 日料 2:1 火锅赢(甲丙支持 a);日料 vs 烧烤 2:1 日料赢(甲乙支持 b);火锅 vs 烧烤 1:2 烧烤赢(乙丙支持 c)。于是 $a\succ b$、$b\succ c$、但 $c\succ a$ —— ⭐⭐ 成环,没有一个选项能打赢所有对手。
- ⚠️ 没有任何人不理性 —— 甲乙丙各自的排序都是完全正常、传递的。⭐⭐ 所以这个环说明:一群理性的人聚合出来的集体偏好可以是不理性的;「传递性」在个体层面成立,在集体层面消失了。这叫 Condorcet 悖论。
- 因为环的存在,⭐ 谁定 PK 顺序谁定结果:安排「先火锅 PK 日料、赢家再 PK 烧烤」最后一定烧烤赢;换个顺序赢家就换人。同一群人、同一份偏好,结果由议程决定。
- 机器学习里「效果不好」通常意味着「再调调」;⭐⭐ 这里很多时候答案是「已经证明了做不到,别调了,换个目标」。花时间证明「不存在」和找到一个算法同样有价值 —— 知道什么时候停止寻找本身就是能力。
🛑 可以停在这里
⚡ 走神救援
这一章不推公式,只让你撞三堵墙。🎲 游戏一:石头剪刀布。固定出石头 → 对手三把内发现 → 之后一直出布 → 你一直输;改剪刀改布同理。⭐ 收益表上每一行都有一个 −1,所以不管你固定出什么,对手总有一招让你输。💥 第一堵墙:在有对手的世界里,「固定的最优选择」可能根本不存在 —— 这跟训练模型完全不同,损失函数不会因为你选了方向就变形,但对手会跟着你调整。出路是掷骰子(各 1/3),对手无论怎么应对期望都是 0。💡 反常之处:为了不被利用,你必须让自己无法被预测,「最优策略」是一个概率分布而不是一个动作;⭐ 更反常的是那个 1/3 是为了让对手无所谓算出来的,不是让自己舒服(几乎所有人第一次都算反)。🍰 游戏二:两室友分冰箱(你60/他40)、书桌(30/50)、椅子(10/10)。各拿最爱 + 椅子给你 → 你 70、他 50;⭐ 验无嫉妒要用各自的尺子:他量你那份 40+10=50,和自己手里 50 打平,不羡慕;你量他那份 30 < 70,也不羡慕。⚠️ 无嫉妒不要求分数相等(70 对 50 照样算)。但把物品换成只有一台冰箱:拿到的 60、另一个 0,没拿到的量对方 40 > 0,必然羡慕。💥 第二堵墙:你想要的那个"公平"可能在数学上根本不存在 —— 不是分法不够聪明。⭐ 出路是退一步:「去掉对方手里某一件之后我就不羡慕」= EF1,它总能做到。⭐⭐ 这是全板块反复出现的模式:理想性质做不到 → 找恰好能做到的最强放松版。 🗳️ 游戏三:三人选晚饭,甲 a≻b≻c、乙 b≻c≻a、丙 c≻a≻b,两两多数决:火锅 vs 日料 2:1 火锅赢、日料 vs 烧烤 2:1 日料赢、⭐⭐ 火锅 vs 烧烤 1:2 烧烤赢 —— $a\succ b,\ b\succ c$,但 $c\succ a$,成环。⚠️ 三个人各自的排序全都是传递的、没有任何人不理性。💀 第三堵墙:一群理性的人聚合出的集体偏好可以不理性,传递性在个体层面成立、在集体层面消失(Condorcet 悖论)。现实后果:⭐ 谁定 PK 顺序谁定结果。第 26 章的 Arrow 定理会把这件事推到最狠:不是多数决的毛病,是任何聚合方式都躲不掉,除非让一个人说了算。三堵墙分别通向 07–15(均衡)、16–23(机制与分配)、24–26(社会选择)。⭐ 02–06 的逻辑是独立的一块,想直接学博弈论从第 7 章开始完全没问题。⭐⭐ 最后记住这门学问最不一样的地方:机器学习里「效果不好」意味着再调调,这里很多时候答案是「已经证明做不到,换个目标」—— 知道什么时候停止寻找本身就是能力。
下一节 👉 02-为什么需要逻辑.md
🧭 只想学博弈论? 直接去 07-偏好与效用.md,不会缺任何前置。