🏠 总目录📚 本教程 01 · 第一天:三个游戏
📑 本页目录(点开跳转)

01 · 第一天:三个游戏

28 分钟 | ⭐ 不讲定义,先让你亲手撞上三堵墙


🎯 一句话

这一章一个公式都不推,只让你玩三个小游戏 —— 每一个都会在某个地方卡住,而那三个卡点就是后面 25 章要解决的三件事。

⭐ 现在完全不需要记住任何术语。你只要记住「咦,这里好像不太对劲」的那三个瞬间就够了。


🎲 游戏一:石头剪刀布,最优出法是什么?

规则你已经会了。问题只有一个:你应该怎么出?

先试着找一个答案

假设你决定「每次都出石头」。玩十把没问题吗?

对手第三把就发现了,之后每把出布。你从此一直输。

「那我出剪刀。」—— 对手改出石头。「那我出布。」—— 对手改出剪刀。

⭐⭐ 停在这里想一秒你能不能找到一个固定的出法,让对手拿你没办法?

答案是不能。这张表里的每个动作都被另一个动作克制:

我 \ 对手 石头 剪刀
石头 0 +1 −1
剪刀 −1 0 +1
+1 −1 0

(数字是我的输赢:+1 赢、0 平、−1 输。)

每一行都有一个 −1 —— 不管我固定出什么,对手总有一个动作让我输。

💥 第一堵墙

⭐⭐ 在有对手的世界里,「固定的最优选择」这个东西可能根本不存在。

这跟你熟悉的一切优化都不一样。训练模型时,损失函数不会因为你选了某个方向就偷偷变形; 掷骰子时,六个面的概率不会因为你押了 6 就改成 1/7。 ⚠️ 但对手会跟着你调整 —— 你的「最优」一旦被看穿,就不再最优了。

唯一的出路是掷骰子:各 1/3 随机出。这样对手无论怎么应对,期望都是 0,他没法针对你

💡 注意这句话有多反常:为了不被利用,你必须让自己无法被预测 —— 甚至连你自己都不知道下一把出什么。「最优策略」在这里是一个概率分布,不是一个动作。

⭐ 更反常的还在后面(第 12 章):那个 1/3 不是为了让你自己舒服算出来的, 是为了让对手无所谓算出来的。 几乎所有人第一次都会算反。

这堵墙通向09 正常形博弈11 纳什均衡12 混合策略13 零和与极大极小


🍰 游戏二:两个室友,三样东西

你和室友合租,房东搬走时留下三样东西:一台冰箱、一个书桌、一把椅子

你俩对它们的估值不一样(满分 100 分,各自心里的分):

冰箱 书桌 椅子 合计
60 30 10 100
室友 40 50 10 100

怎么分才算公平? 先自己想 30 秒再往下看。

试一试「各拿自己最想要的」

你拿冰箱(60),室友拿书桌(50),椅子给谁?

假设椅子给你:你拿到 60+10 = 70,室友拿到 50

现在检查一件事:⭐ 室友会不会觉得你那一份更好?他自己的尺子量你那份:冰箱 40 + 椅子 10 = 50。他自己手里也是 50打平,他不羡慕你。

再假设椅子给室友:你 60,室友 50+10 = 60。 用你的尺子量他那份:书桌 30 + 椅子 10 = 40 < 你的 60。你也不羡慕他。

⭐ 这个性质叫无嫉妒(envy-free)每个人用自己的尺子量,都觉得自己这份不比别人差。 注意它不要求两人分数相等 —— 上面第一种分法里 70 对 50,照样无嫉妒。

💥 第二堵墙:把物品换成一件

现在假设房东只留下一台冰箱,两个人都想要。

冰箱只能给一个人。拿到的人有 60,另一个人有 0。 没拿到的那个人用自己的尺子量:对方手里 40 > 自己的 0。他一定羡慕。

⭐⭐ 无论你怎么分,都做不到无嫉妒。 这不是分法不够聪明,是根本不存在

💀 第二堵墙你想要的那个"公平",在数学上可能压根不存在。

那怎么办?⭐ 现实的做法是退一步: 「去掉对方手里的某一件东西之后,我就不羡慕了」—— 上面那个例子里,把冰箱从对方手里拿掉,剩下空的,0 ≥ 0,成立。 这个放松版叫 EF1,它总是能做到第 19 章第 20 章)。

这是整个板块反复出现的模式理想的性质做不到 → 找一个恰好能做到的最强放松版。 学会认这个模式,比记住 EF1 的定义有用得多。

这堵墙通向19 怎么算公平20 公平分配的算法21 有钱与随机分配


🗳️ 游戏三:三个人投票,选出一个自相矛盾的结果

三个朋友选晚饭去哪:火锅(a)、日料(b)、烧烤(c)。各自的排序:

第一 第二 第三
a 火锅 b 日料 c 烧烤
b 日料 c 烧烤 a 火锅
c 烧烤 a 火锅 b 日料

三个人吵不出结果,于是决定两两 PK,少数服从多数

🔨 手算:三场 PK

火锅 vs 日料:谁把 a 排在 b 前面?

a 和 b 谁在前
a(第 1 vs 第 2)✓
b(第 3 vs 第 1)✗
a(第 2 vs 第 3)✓

2 : 1,火锅赢。a ≻ b

日料 vs 烧烤:甲 b(2 vs 3)✓、乙 b(1 vs 2)✓、丙 c(3 vs 1)✗ → 2 : 1,日料赢。b ≻ c

到这里很自然:火锅打赢日料、日料打赢烧烤,那火锅肯定打赢烧烤吧?

火锅 vs 烧烤:甲 a(1 vs 3)✓、乙 c(3 vs 2)✗、丙 c(2 vs 1)✗

1 : 2 —— 烧烤赢。 ⭐⭐ c ≻ a

💥 第三堵墙

$$a \succ b, \qquad b \succ c, \qquad \textbf{但 } c \succ a$$

⭐⭐ 成环了。 火锅打赢日料、日料打赢烧烤、烧烤打赢火锅 —— 没有一个选项能打赢所有对手。

⚠️ 请注意三个人各自的偏好都是完全正常的:甲乙丙的排序都是传递的(a≻b≻c 这种), 没有任何人不理性

💀 第三堵墙一群理性的人,聚合出来的集体偏好可以是不理性的。 「传递性」这个再基本不过的性质,在个体层面成立,在集体层面消失了

这个环叫 Condorcet 悖论第 25 章)。 它带来一个非常现实的后果:⭐ 议程可以决定结果。 如果主持人安排「先火锅 PK 日料,赢家再 PK 烧烤」,最后一定是烧烤赢; 换个顺序,赢家就换人。同一群人、同一份偏好,谁定 PK 顺序谁定结果。

⭐⭐ 而 第 26 章会把这件事推到最狠的地步(Arrow 定理): 这不是多数决这一个规则的毛病,而是任何聚合方式都躲不掉的 —— 除非让某一个人说了算。

这堵墙通向24 投票规则25 Condorcet 与锦标赛解26 不可能定理


🗺️ 三堵墙对应的三块内容

你撞到的 问题的本质 去哪几章
🎲 固定的最优出法不存在 对手会针对你 —— 需要「均衡」这个概念 07–15
🍰 无嫉妒可能根本做不到 理想性质不存在 —— 需要找恰好能做到的放松版 16–23
🗳️ 集体偏好可以成环 好性质凑不齐 —— 需要知道该放弃哪一条 24–26

⭐ 还有一块没在游戏里出现:02–06 章的逻辑。 它讲的是怎么把「知识」写成机器能推理的形式(命题逻辑、一阶逻辑、分辨率)。 ⚠️ 那五章和上面三块是独立的 —— 想直接学博弈论,第 7 章开始完全没问题, 不会有任何前置缺失。逻辑那部分适合这几种人:想搞懂 SAT 求解器、想做形式化验证、 或者想知道「知识图谱推理」底下是什么。


💡 一句话预告后面会反复出现的三种思路

思路 一句话 第一次出现
找不动点 「谁都不想改」的那个状态叫均衡 11 纳什均衡
改规则而不是劝人 坏结果是理性推出来的,教育没用,只能换游戏 16 机制设计
证明做不到 ⭐ 花时间证明「不存在」,和找到一个算法同样有价值 19 怎么算公平26 不可能定理

⭐⭐ 第三条是这门学问最不一样的地方。 在机器学习里,「效果不好」通常意味着「再调调」; 在这里,很多时候答案是「已经证明了,别调了,换个目标」 —— 而知道什么时候该停止寻找,本身就是很值钱的能力。


🔗 这一章连到哪里

去哪 为什么
07 · 偏好与效用 想直接学博弈论就从这里开始,不需要读 02–06。它先把「理性」这个词说清楚
02 · 为什么需要逻辑 想先补逻辑地基(命题逻辑 → 一阶逻辑 → 自动推理)走这条
09 · 正常形博弈 游戏一那张表的正式名字,以及为什么「你的最优取决于别人」会让一切变难
../强化学习基础/02-MDP.html ⭐ 对照着看很有用:那一套里环境有随机性但不会针对你,所以能算出唯一最优策略。游戏一撞的墙,正是这个前提失效之后的样子
../推荐算法/15b-广告-从推荐到竞价.html 想先看这门学问能赚钱的样子:广告拍卖里怎么定价、怎么防止广告主骗你

✅ 检查点

  1. 石头剪刀布里,为什么不存在一个固定的最优出法?从收益表上怎么一眼看出来?
  2. 掷骰子(随机化)解决了什么问题?为什么说「你必须让自己无法被预测」?
  3. 两个室友分三样东西那个例子里,「无嫉妒」是怎么验证的?它要求两人分数相等吗?
  4. 只有一台冰箱时为什么做不到无嫉妒?EF1 是怎么放松的?
  5. 三人投票的三场 PK 结果分别是什么?环是怎么成的?
  6. 三个人里有谁不理性吗?那这个环说明了什么?
  7. 「议程可以决定结果」是什么意思?
  8. 这门学问和机器学习在「效果不好怎么办」上有什么根本不同?
👀 答案
  1. 因为每一行都有一个 −1 —— 不管你固定出什么,对手总有一个动作让你输(出石头就被布克、出剪刀就被石头克、出布就被剪刀克)。⭐⭐ 根本原因是对手会跟着你调整:你的「最优」一旦被看穿就不再最优。
  2. 解决被针对的问题。各 1/3 随机出,对手无论怎么应对期望都是 0,他没法利用你。💡 反常之处:为了不被利用,你必须让自己无法被预测 —— 「最优策略」在这里是一个概率分布而不是一个动作。⭐ 更反常的是那个 1/3 不是让自己舒服算出来的,是让对手无所谓算出来的(第 12 章)。
  3. 每个人用自己的尺子量自己那份和别人那份。例子里椅子给你时:室友用他的尺子量你那份(冰箱 40 + 椅子 10 = 50),和他自己手里的书桌 50 打平,不羡慕 ✅;你用你的尺子量他那份(30)< 你的 70,也不羡慕 ✅。⚠️ 不要求分数相等 —— 70 对 50 照样是无嫉妒的。
  4. 冰箱只能给一个人,拿到的有 60、另一个有 0;没拿到的用自己尺子量对方(40)> 自己(0),必然羡慕。⭐⭐ 无论怎么分都做不到 —— 不是分法不够聪明,是根本不存在。 EF1 放松成「去掉对方手里的某一件东西之后我就不羡慕了」:把冰箱从对方手里拿掉,0 ≥ 0 成立。⭐ 它总是能做到
  5. 火锅 vs 日料 2:1 火锅赢(甲丙支持 a);日料 vs 烧烤 2:1 日料赢(甲乙支持 b);火锅 vs 烧烤 1:2 烧烤赢(乙丙支持 c)。于是 $a\succ b$、$b\succ c$、但 $c\succ a$ —— ⭐⭐ 成环,没有一个选项能打赢所有对手
  6. ⚠️ 没有任何人不理性 —— 甲乙丙各自的排序都是完全正常、传递的。⭐⭐ 所以这个环说明:一群理性的人聚合出来的集体偏好可以是不理性的;「传递性」在个体层面成立,在集体层面消失了。这叫 Condorcet 悖论。
  7. 因为环的存在,⭐ 谁定 PK 顺序谁定结果:安排「先火锅 PK 日料、赢家再 PK 烧烤」最后一定烧烤赢;换个顺序赢家就换人。同一群人、同一份偏好,结果由议程决定。
  8. 机器学习里「效果不好」通常意味着「再调调」;⭐⭐ 这里很多时候答案是「已经证明了做不到,别调了,换个目标」。花时间证明「不存在」和找到一个算法同样有价值 —— 知道什么时候停止寻找本身就是能力

🛑 可以停在这里

走神救援

这一章不推公式,只让你撞三堵墙。🎲 游戏一:石头剪刀布。固定出石头 → 对手三把内发现 → 之后一直出布 → 你一直输;改剪刀改布同理。⭐ 收益表上每一行都有一个 −1,所以不管你固定出什么,对手总有一招让你输。💥 第一堵墙:在有对手的世界里,「固定的最优选择」可能根本不存在 —— 这跟训练模型完全不同,损失函数不会因为你选了方向就变形,但对手会跟着你调整。出路是掷骰子(各 1/3),对手无论怎么应对期望都是 0。💡 反常之处:为了不被利用,你必须让自己无法被预测,「最优策略」是一个概率分布而不是一个动作;⭐ 更反常的是那个 1/3 是为了让对手无所谓算出来的,不是让自己舒服(几乎所有人第一次都算反)。🍰 游戏二:两室友分冰箱(你60/他40)、书桌(30/50)、椅子(10/10)。各拿最爱 + 椅子给你 → 你 70、他 50;⭐ 验无嫉妒用各自的尺子:他量你那份 40+10=50,和自己手里 50 打平,不羡慕;你量他那份 30 < 70,也不羡慕。⚠️ 无嫉妒不要求分数相等(70 对 50 照样算)。但把物品换成只有一台冰箱:拿到的 60、另一个 0,没拿到的量对方 40 > 0,必然羡慕。💥 第二堵墙:你想要的那个"公平"可能在数学上根本不存在 —— 不是分法不够聪明。⭐ 出路是退一步:「去掉对方手里某一件之后我就不羡慕」= EF1,它总能做到。⭐⭐ 这是全板块反复出现的模式:理想性质做不到 → 找恰好能做到的最强放松版。 🗳️ 游戏三:三人选晚饭,甲 a≻b≻c、乙 b≻c≻a、丙 c≻a≻b,两两多数决:火锅 vs 日料 2:1 火锅赢日料 vs 烧烤 2:1 日料赢、⭐⭐ 火锅 vs 烧烤 1:2 烧烤赢 —— $a\succ b,\ b\succ c$,但 $c\succ a$,成环。⚠️ 三个人各自的排序全都是传递的、没有任何人不理性。💀 第三堵墙:一群理性的人聚合出的集体偏好可以不理性,传递性在个体层面成立、在集体层面消失(Condorcet 悖论)。现实后果:⭐ 谁定 PK 顺序谁定结果。第 26 章的 Arrow 定理会把这件事推到最狠:不是多数决的毛病,是任何聚合方式都躲不掉,除非让一个人说了算。三堵墙分别通向 07–15(均衡)、16–23(机制与分配)、24–26(社会选择)。⭐ 02–06 的逻辑是独立的一块,想直接学博弈论从第 7 章开始完全没问题。⭐⭐ 最后记住这门学问最不一样的地方:机器学习里「效果不好」意味着再调调,这里很多时候答案是「已经证明做不到,换个目标」—— 知道什么时候停止寻找本身就是能力

下一节 👉 02-为什么需要逻辑.md

🧭 只想学博弈论? 直接去 07-偏好与效用.md,不会缺任何前置。

打卡记录保存在你的浏览器里,首页能看到总进度