📑 本页目录(点开跳转)
11 · 纳什均衡
⏱ 34 分钟 | ⭐⭐ 全板块的枢纽:一张所有人都不想反悔的策略表
🎯 一句话
纳什均衡是一张策略表:拿给每个人看,每个人都说「只要别人不改,我也不想改」。
注意这句里最容易被跳过的那半句 —— 只要别人不改。 纳什均衡只管一个人单独反悔这件事。它不保证结果好,不保证只有一个,也不保证你算得出来。 这一章先教你把它找出来(一个纯手算的圈法),再把它的三个毛病摊开讲 —— 毛病比定义更值钱。
🧩 一、先有最佳响应,才有均衡
把别人的策略先钉死,你在自己的所有策略里挑收益最高的那个(或那些),这就是最佳响应。
$$s_i \in B(s_{-i}) \iff u_i(s_i, s_{-i}) \ge u_i(t_i, s_{-i})\ \ \text{对所有}\ t_i \in S_i$$
记号 $s_{-i}$ 读作「除了 i 之外所有人的策略」。最佳响应可能不止一个(并列最高时全算)。
⭐ 两人博弈里有一条干净的对应:一个动作永远不可能是最佳响应,当且仅当它被支配。 所以被支配的动作可以先删掉再找均衡 —— 删掉的东西不可能是答案的一部分。
那能不能直接靠「轮流改成最佳响应」把博弈解开?
试一次就知道不行。罚球(教科书里叫 matching pennies):守门员猜对方向就扑到,猜错就丢球。
| 罚球者 \ 守门员 | 左 | 右 |
|---|---|---|
| 左 | −1, 1 | 1, −1 |
| 右 | 1, −1 | −1, 1 |
从「双方都选左」出发,让两个人轮流改成当下的最佳响应,每次都是拿 −1 的那个人想改:
(左, 左) → 罚球者改右 → (右, 左) → 守门员改右 → (右, 右) → 罚球者改左 → (左, 右) → 守门员改左 → 回到 (左, 左)
⚠️ 四步转回原地,无限循环。 这不是算法写坏了 —— 是这个博弈里 根本没有任何一格能让两个人同时满意。它告诉你两件事:① 需要一个「停下来」的概念(纳什均衡); ② 这概念若只允许纯动作,有些博弈一个解都没有(留到第 12 章解决)。
🎯 二、纳什均衡:没人想单边偏离
定义:策略组合 $s = (s_1, \dots, s_n)$ 是纳什均衡,如果
$$u_i(s_i, s_{-i}) \ge u_i(t_i, s_{-i})\quad \text{对所有玩家}\ i \in N\ \text{和所有}\ t_i \in S_i$$
换成人话:每个人打的都是对别人的最佳响应。所有人的最佳响应互相咬合上了,谁先松手谁吃亏。 如果每个人都以概率 1 打某一个动作,就叫纯策略纳什均衡。
⭐ 纳什均衡是整个博弈论里最主流的解概念。 后面的机制设计、拍卖、多智能体训练, 默认的「会发生什么」都是在算这个东西。所以它值得你花时间把定义嚼透。
⚠️ 三个高频误读
| 误读 | 实际上 |
|---|---|
| 「NE = 大家都拿到最好结果」 | ❌ 囚徒困境的 NE 是两人都变差的那格 |
| 「NE = 没人能变得更好」 | ❌ 是没人能靠自己一个人改变好。一群人一起改完全可能都变好 |
| 「每个博弈都有 NE,找找总能找到」 | ❌ 纯的可能一个都没有(罚球);混的一定有,但未必算得出来 |
拿囚徒困境验一下(本板块统一用这组收益):
| 甲 \ 乙 | 合作 | 叛变 |
|---|---|---|
| 合作 | 2, 2 | 0, 3 |
| 叛变 | 3, 0 | 1, 1 |
乙不管选什么,甲叛变都比合作多拿 1(3 > 2、1 > 0),乙同理。 所以 (叛变, 叛变) = (1, 1) 是唯一的纳什均衡 —— 而 (合作, 合作) 能让两个人都拿 2。 这个「均衡本身是坏结果」的例子,就是第五节三个毛病里的第二个。
✏️ 三、⭐ 手算套路:圈最佳响应,找纯策略 NE
这是这一章你最该带走的东西。考试和面试都是这么算的,纸笔就够。
五个步骤
- 写成收益矩阵,每格写「行玩家收益, 列玩家收益」,顺序固定别乱。
- 逐列看(手指按住一列):圈出这一列里第一个数最大的那格。 —— 「列玩家若打这一列,行玩家会选哪一行」。
- 逐行看(手指按住一行):圈出这一行里第二个数最大的那格。 —— 「行玩家若打这一行,列玩家会选哪一列」。
- 两个数都被圈的格子,就是纯策略纳什均衡。
- 一个双圈都没有 → 没有纯策略 NE,去第 12 章找混合的。
⭐ 为什么这个土办法是对的:圈一个数 = 「这是一个最佳响应」。 双圈 = 两个人互为最佳响应 —— 这正好逐字对上了 NE 的定义,一步都没多。
⚠️ 并列最大要全圈。漏圈并列值 = 漏掉整个均衡,这是手算最常见的错。
完整走一遍(3×3)
| 行 \ 列 | x | y | z |
|---|---|---|---|
| a | 3, 1 | 0, 4 | 2, 2 |
| b | 2, 3 | 1, 2 | 4, 1 |
| c | 1, 2 | 3, 5 | 2, 3 |
第 2 步,逐列圈行玩家(看每格第一个数):
| 按住哪一列 | 三行的行收益 | 谁最大 | 圈哪格 |
|---|---|---|---|
| x | a=3、b=2、c=1 | 3 | (a, x) |
| y | a=0、b=1、c=3 | 3 | (c, y) |
| z | a=2、b=4、c=2 | 4 | (b, z) |
第 3 步,逐行圈列玩家(看每格第二个数):
| 按住哪一行 | 三列的列收益 | 谁最大 | 圈哪格 |
|---|---|---|---|
| a | x=1、y=4、z=2 | 4 | (a, y) |
| b | x=3、y=2、z=1 | 3 | (b, x) |
| c | x=2、y=5、z=3 | 5 | (c, y) |
第 4 步,对一下: 行玩家圈了 (a,x)、(c,y)、(b,z);列玩家圈了 (a,y)、(b,x)、(c,y)。 只有 (c, y) 出现了两次 —— 它就是这个博弈唯一的纯策略纳什均衡,收益 (3, 5)。
⭐ 注意 (a, x) 那一格:行玩家在这里拿到全列最高的 3,看着很美,但列玩家一看自己只有 1, 换成 y 就有 4 —— 他会跑。单圈格子的意思永远是「有人还想改」。
🏛️ 四、存在性定理:一定有,但不告诉你在哪
定理(Nash, 1950):每一个有限的正常形博弈都存在纳什均衡。
「有限」指玩家有限、每人的动作有限。前提是允许混合策略(允许掷骰子,第 12 章的主题)。 罚球那个博弈没有纯 NE,但有一个混的:两边各 50% —— 定理保证这种东西永远找得到。
⚠️ 这个证明是非构造性的:它走 Brouwer 不动点定理 —— 把「所有人同时换成最佳响应」看成一个连续映射,连续映射在紧凸集上必有不动点, 而不动点正是没人想改的那个点。本教程不展开这个证明,看懂它不会改变你手算的方式。 但有一句必须带走:
⭐ 非构造 = 只证明了东西在那儿,没给出找它的办法。 这不是数学家偷懒,这正是下一节第三个毛病(算不出来)的根子。
| 定理说了 | 定理没说 |
|---|---|
| 混合 NE 一定存在 | 一定能算出来(下节:PPAD-完全) |
| 至少一个 | 只有一个(性别之争有三个) |
| 它是均衡 | 它是好结果(囚徒困境) |
顺带一条实用的:NE 只会在「熬过迭代删除支配」的动作上放概率, 所以手算前先把被支配的动作删干净,矩阵会小很多。
⭐ 推论(兑现第 10 章留给本章的那个证明): 如果 IESDS 能删到只剩一格,那一格就是唯一的纳什均衡。 两步就推完 —— ① Nash 定理保证 NE 至少有一个;② 上面那条保证它只能落在幸存集合里; 而幸存集合只剩一个点,那就只能是它。第 10 章那个删到 (M, C) = (3, 3) 的 3×3 例子正是如此。 ⚠️ 注意这条只对严格支配成立:弱支配的迭代删除会真的删掉纳什均衡,删剩一格也不能这么断言。
💥 五、⭐ NE 的三个毛病(比定义更值钱)
讲义专门花了一节讲这个。知道 NE 什么时候不好使,比会背定义有用得多。
① 可能有好几个 —— 协调问题
性别之争(Battle of the Sexes):两个人想一起出门,但一个偏爱拳击、一个偏爱芭蕾, 分头行动两人都是 0。
| 行 \ 列 | 拳击 | 芭蕾 |
|---|---|---|
| 拳击 | 2, 1 | 0, 0 |
| 芭蕾 | 0, 0 | 1, 2 |
用圈法一分钟就能查出两个纯 NE:(拳击, 拳击) = (2, 1) 和 (芭蕾, 芭蕾) = (1, 2)。 再加上一个混合 NE(行玩家 2/3 拳击、列玩家 1/3 拳击,第 12 章会算),一共三个。
💀 多均衡的真实代价:两个人各自「理性地」挑一个自己偏好的 NE,实际打出来是 (拳击, 芭蕾) = (0, 0) —— 两人都归零,比任何一个均衡都差。 ⚠️ NE 是「稳定性」的判据,不是「会发生什么」的预测;多均衡时它根本没做出预测。
② 可能是低效的 —— 囚徒困境
唯一的 NE 是 (叛变, 叛变) = (1, 1),而 (合作, 合作) = (2, 2) 让两个人都多拿 1。 用第 9 章的话说:这个均衡被帕累托支配,它是帕累托劣的。
⭐ 「均衡」和「好」是两个不相干的词。 补贴大战、军备竞赛、团队一起刷代理指标 —— 这些系统稳定在所有人都不想要的点上,机理都是这个:每个人单独看都在做正确的事。
③ 计算困难
| 问题 | 复杂度 |
|---|---|
| 找一个 NE | PPAD-完全(Daskalakis 等 / Chen 与 Deng,2005)。⚠️ 只有两个玩家时一样难 |
| 是否存在让玩家 i 拿到 x 的 NE | NP-难(两人时就已经是,Gilboa 与 Zemel, 1989) |
| 是否存在结果帕累托最优的 NE / 让 i 完全不用某动作的 NE | NP-难 |
⭐ 两种「难」不要混:找一个 NE 属于 PPAD —— 解一定存在(Nash 定理),难在找到它。 而加了附加条件的那几个问题可能真的无解,于是掉进 NP-难。 普遍相信 PPAD ≠ FP,也就是说:没有高效算法能算一般博弈的 NE。
➕ 还有一个 NE 管不住的:联盟一起偏离
NE 只挡一个人反悔。囚徒困境里 (叛变, 叛变) 挡得住单人反悔, 却挡不住两个人商量好一起换成 (合作, 合作) —— 两人同时变好。
于是有了强纳什均衡(Aumann, 1959):任何一个玩家子集都找不到共同改法让子集里所有人都变好。 ⚠️ 它不保证存在 —— 囚徒困境一个强 NE 都没有: (叛变, 叛变) 挡不住两人联盟,(合作, 合作) 挡不住单人叛变。
三个毛病对应三条出路:多重性 → 精炼(子博弈完美均衡,第 14 章); 三个一起 → 换设定(零和博弈里全部消失); 低效 → 换规则(不接受博弈,去设计博弈,第 16 章机制设计)。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 12 · 混合策略 | 圈法解不开的罚球博弈在那里被解开;Nash 定理保证「一定存在」的那个解就是它 |
| 13 · 零和与极大极小 | ⭐ 本章第五节的三个毛病在零和博弈里全部消失:值唯一、能高效算。想知道 NE 什么时候真正好用,去那里 |
| 14 · 扩展式博弈 | 「多均衡怎么办」的第一条出路:轮流出手时用子博弈完美均衡筛掉靠不可信威胁撑起来的那些 NE |
| 09 · 正常形博弈 | 回去看收益矩阵和帕累托支配的定义 —— 本章的「帕累托劣」用的就是那一章的判据。⚠️ 帕累托支配(两个结果之间)和下面那条的支配策略(一个人的两个动作之间)是两回事,别混 |
| 10 · 支配策略 | ⭐ 支配策略、严格劣势、IESDS 的定义都在那一章(不在 09)。本章第四节那句「NE 只会在熬过迭代删除支配的动作上放概率」用的就是它 —— 手算前先把被支配的动作删干净,矩阵会小很多 |
| 16 · 机制设计在解什么 | 囚徒困境改不了之后唯一的出路:换掉规则本身,把游戏设计成「均衡恰好是你想要的结果」 |
| 模型上线之后 15 · 长期效应与代理指标 | ⭐ 同一股「局部最优 ≠ 全局最优」的味道,但机制不一样:那一章是单个优化者的代理指标失效(古德哈特),没有第二个利益方;本章的坏结果是每一方都在最优反应推出来的。⚠️ 别把它当囚徒困境读 —— 去那里学的是「指标涨了不等于目标达成」 |
| 智能体工程教程 13 · 多 Agent 协作 | 那边是工程(目标一致,怎么编排),这边是理论(目标冲突,会怎样)—— 子 Agent 目标不一致时才该用本章的框架 |
| 强化学习基础 02 · MDP | 分界线:MDP 里环境不会针对你,最优策略唯一且能算;对面换成会还手的玩家,「最优」就退化成「均衡」 |
✅ 检查点
- 用一句话说清纳什均衡的定义。哪半句最容易被漏掉?
- 罚球博弈里让两人轮流改成最佳响应会发生什么?这说明了什么?
- 圈法的五步是什么?为什么「双圈」正好等于 NE 的定义?
- 用圈法算一遍正文那个 3×3 博弈:两个玩家各圈了哪三格,NE 是哪格、收益多少?
- Nash 存在性定理说了什么、没说什么?「非构造性」为什么重要?
- 性别之争有几个纳什均衡?两人各挑一个自己喜欢的均衡去打,会打出什么结果?
- 「找一个 NE」和「找一个让玩家 i 拿到 x 的 NE」,难度类型有什么不同?为什么?
- 囚徒困境的 NE 挡得住什么、挡不住什么?强纳什均衡补了哪个洞,代价是什么?
👀 答案
- 每个人打的都是对别人策略的最佳响应,即 $u_i(s_i,s_{-i}) \ge u_i(t_i,s_{-i})$ 对所有 i 和所有 $t_i$ 成立。最容易漏的是「只要别人不改」—— NE 只管单边偏离。
- 四步转回起点,无限循环:(左,左) → 罚球者改右 → 守门员改右 → 罚球者改左 → 守门员改左 → 回到 (左,左)。说明它没有任何纯策略 NE,必须允许混合。
- ①写成「行收益, 列收益」矩阵 ②逐列圈第一个数的最大值 ③逐行圈第二个数的最大值 ④双圈格 = 纯 NE ⑤一个双圈都没有就去第 12 章。因为圈 = 最佳响应、双圈 = 互为最佳响应,正是 NE 的定义。⚠️ 并列最大值要全圈。
- 行玩家(逐列)圈 (a,x)=3、(c,y)=3、(b,z)=4;列玩家(逐行)圈 (a,y)=4、(b,x)=3、(c,y)=5。唯一双圈 (c, y),收益 (3, 5)。
- 说了:每个有限正常形博弈都存在(混合)NE(Nash, 1950)。没说:能算出来、只有一个、结果好。「非构造性」=证明走 Brouwer 不动点定理,只证明东西在那儿,不给找法 —— 这正是「找 NE 是 PPAD-完全」的根子。
- 三个:(拳击,拳击)=(2,1)、(芭蕾,芭蕾)=(1,2),加一个混的(行 2/3 拳击、列 1/3 拳击)。💀 各挑各爱的会打出 (0, 0),比任何一个均衡都差 —— NE 是稳定性判据,不是对「会发生什么」的预测。
- 「找一个 NE」是 PPAD-完全(两人时一样难),关键在解一定存在,难的只是找到它;「让 i 拿到 x 的 NE」可能压根不存在,所以掉进 NP-难。⭐ 存在性有没有保证,决定它落进哪一类。
- (叛变,叛变)=(1,1) 挡得住任何人单独反悔(单独改只会从 1 掉到 0),挡不住两人一起换成 (合作,合作)=(2,2)。强纳什均衡(Aumann, 1959)补上了这个洞,代价是不保证存在 —— 囚徒困境里一个都没有。
🛑 可以停在这里
⚡ 走神救援
⭐纳什均衡=一张策略表,每个人都说「只要别人不改,我也不想改」 —— 也就是每个人都在对别人打最佳响应,⚠️ 它只管单边偏离。⚠️光靠轮流改成最佳响应解不开博弈:罚球从 (左,左) 出发四步转回起点无限循环,因为它根本没有纯策略 NE。⭐⭐手算套路(圈法)五步:写成「行收益, 列收益」矩阵 → 逐列圈第一个数的最大值(行玩家的最佳响应)→ 逐行圈第二个数的最大值(列玩家的最佳响应)→ 双圈格就是纯 NE → 一个双圈都没有就去第 12 章。正文那个 3×3 里行玩家圈 (a,x)、(c,y)、(b,z),列玩家圈 (a,y)、(b,x)、(c,y),唯一双圈 (c,y)=(3,5);⚠️ 并列最大值必须全圈。Nash 存在性定理(1950):每个有限正常形博弈都有(混合)NE;证明走 Brouwer 不动点,非构造性 —— 只说东西在那儿不给找法,这正是「算不出来」的根子。⭐ 它顺手兑现了第 10 章那个欠账:NE 只会在「熬过迭代删除支配」的动作上放概率,加上「NE 至少有一个」,就得到 IESDS 删到只剩一格时那一格必是唯一 NE(⚠️ 只对严格支配成立,弱支配会把 NE 删没)。⭐⭐三个毛病:①多重(性别之争有 3 个 NE:(拳击,拳击)=(2,1)、(芭蕾,芭蕾)=(1,2) 和一个混的;💀 两人各挑各爱的会打出 (0,0),比任何均衡都差 —— NE 是稳定性判据不是预测)②低效(囚徒困境唯一 NE 是 (叛变,叛变)=(1,1),被 (合作,合作)=(2,2) 帕累托支配)③难算(找一个 NE 是 PPAD-完全,两人也一样;带附加条件的判定问题是 NP-难)。另加一条:NE 只挡单人反悔,挡不住联盟一起改 —— 补丁是强纳什均衡(Aumann, 1959),但不保证存在。三条出路:精炼(14 章)、换设定到零和(13 章,三个毛病同时消失)、换规则去设计博弈(16 章机制设计)。
下一节 👉 12-混合策略.md ⭐⭐
去那里的理由:本章留下的两个欠账都在那里还 —— 罚球博弈到底怎么解, 以及 Nash 定理保证存在的那个混合均衡怎么用纸笔算出来。 那一章有个反直觉到几乎所有人第一次都会做错的点:你的概率不是为你自己调的。