📑 本页目录(点开跳转)
12 · 混合策略
⏱ 44 分钟 | ⭐⭐ 你掷骰子的概率,是替对手调的
🎯 一句话
当「被猜到就输」时,理性的做法是掷骰子;而你掷骰子的概率不是为了让自己舒服, 是为了让对手怎么选都一样。
上一章留了个欠账:罚球博弈里两个人轮流改最佳响应,四步转回原点,永远停不下来。 这一章把它解开,顺带给出 Nash 存在性定理保证的那个「一定存在」的东西长什么样。
🎲 一、为什么必须掷骰子
罚球博弈(matching pennies)的收益矩阵:
| 罚球者 \ 守门员 | 左 | 右 |
|---|---|---|
| 左 | −1, 1 | 1, −1 |
| 右 | 1, −1 | −1, 1 |
这个博弈的本质是「不能被猜到」。 只要你的选择是可预测的 —— 哪怕是「我永远踢左」这种 看起来很坚定的策略 —— 对手照着扑就行,你稳输。
⭐ 所以「不可预测」本身就是一种策略。 形式化之后它叫混合策略: 你不是选一个动作,而是选一个动作上的概率分布,然后按这个分布随机。
$$s_i : A_i \to [0,1],\qquad \sum_{a_i \in A_i} s_i(a_i) = 1$$
- 概率大于 0 的那些动作,合起来叫这个混合策略的支撑集(support)。
- 纯策略是混合策略的特例:支撑集只有一个动作,概率 1。
期望收益怎么算
两边都在掷骰子时,你拿到的收益是个随机变量,所以比的是期望: 把每一格的收益乘上「这一格被打出来的概率」,加起来。
$$u_i(s) = \sum_{a \in A} \Big(\prod_{j \in N} s_j(a_j)\Big)\, u_i(a)$$
举个数:罚球者 60% 左 / 40% 右,守门员 50% / 50%,罚球者的期望收益是
$$0.6{\times}0.5{\times}(-1) + 0.6{\times}0.5{\times}1 + 0.4{\times}0.5{\times}1 + 0.4{\times}0.5{\times}(-1) = 0$$
⚠️ 手算时别真的展开四项。有个省事得多的办法:先把对手的混合固定住, 算出你每个纯动作的期望收益,再按你自己的概率加权。 下一节整个套路都建在这上面。
💡 二、⭐⭐ 无差异原理:均衡里你其实无所谓
这是这一章的心脏。先看结论:
引理(无差异原理):策略组合 $s$ 是纳什均衡,当且仅当对每个玩家 $i$, 支撑集里的所有动作期望收益完全相等,而且不小于支撑集外任何动作的期望收益。
$$u_i(a_i, s_{-i}) = u_i(b_i, s_{-i}) \ \ge\ u_i(c_i, s_{-i}) > \qquad s_i(a_i)>0,\ s_i(b_i)>0,\ s_i(c_i)=0$$
为什么必须相等(一句话的反证)
假设你的支撑集里「左」的期望收益比「右」高。那你把押在「右」上的概率全部挪到「左」, 期望收益严格变高 —— 说明原来那个混合不是最佳响应,也就不可能是均衡的一部分。 所以:只要一个动作你还在用,它就必须和你在用的其他动作一样好。
⭐ 推论(手算时天天用):既然支撑集里每个动作期望收益都一样, 你怎么在支撑集内部分配概率,自己的期望收益都不变。 换句话说 —— 你的收益完全由对手的混合决定,和你自己的概率无关。
⚠️⚠️ 那我调概率是在调什么?—— 全章最反直觉的一句
⭐⭐ 「玩家是替对手随机的。」(Players randomize for other players.)
行玩家的混合概率 p,是由「让列玩家无差异」这个条件解出来的; 列玩家的混合概率 q,是由「让行玩家无差异」解出来的。
几乎所有人第一次都会做反:拿自己的收益去列方程解自己的概率。那样一定错。 记忆锚点:你调概率影响不到自己的期望(上面那条推论),只能影响对手的期望 —— 所以你的概率只可能是为对手的无差异条件服务的。
⭐ 还有一条推论:判断一个策略组合是不是 NE 很快 —— 不用遍历所有偏离, 只要检查「每个人支撑内的动作期望是否相等、且不低于支撑外的」就够了。 这一条在下面第五节的验证步骤里会直接用上。
🧮 三、2×2 混合 NE 的手算套路
上面那句「玩家是替对手随机的」不只是一句俏皮话,它直接就是手算步骤。
设行玩家混 $(p,\,1-p)$、列玩家混 $(q,\,1-q)$。四步:
| 步 | 做什么 | 关键 |
|---|---|---|
| ① | 先用第 11 章的圈法找纯 NE | 顺手把严格劣势的动作删掉 —— 它永远不会进任何 NE 的支撑集 |
| ② | ⭐ 令列玩家对他的两个动作无差异,解出 p | 列方程时用每格第二个数(列玩家的收益) |
| ③ | ⭐ 令行玩家对他的两个动作无差异,解出 q | 列方程时用每格第一个数(行玩家的收益) |
| ④ | 回代算两人的均衡期望收益,并验证 | 见第五节的三条清单 |
⭐⭐ 一句话记法:求谁的概率,就翻到对面的收益去列方程。 ⚠️ 拿行玩家自己的收益去解 p,是这一章唯一的、也是最普遍的错法。做完一定回头看一眼你用的是哪一列数。
例子① 罚球(matching pennies)
回到第一节那张表:
| 罚球者 \ 守门员 | 左 | 右 |
|---|---|---|
| 左 | −1, 1 | 1, −1 |
| 右 | 1, −1 | −1, 1 |
② 解 p(罚球者踢左的概率)—— 看守门员的收益,设罚球者混 $(p,1-p)$:
$$u_2(\text{扑左}) = p\cdot 1 + (1-p)\cdot(-1) = 2p-1$$ $$u_2(\text{扑右}) = p\cdot(-1) + (1-p)\cdot 1 = 1-2p$$
令两者相等:$2p-1 = 1-2p \Rightarrow 4p = 2 \Rightarrow \boxed{p = 1/2}$
③ 解 q(守门员扑左的概率)—— 看罚球者的收益,设守门员混 $(q,1-q)$:
$$u_1(\text{踢左}) = q\cdot(-1) + (1-q)\cdot 1 = 1-2q$$ $$u_1(\text{踢右}) = q\cdot 1 + (1-q)\cdot(-1) = 2q-1$$
令两者相等:$1-2q = 2q-1 \Rightarrow \boxed{q = 1/2}$
④ 回代:两人的均衡期望收益都是 0。这个博弈的唯一 NE 是 $\big((\tfrac12,\tfrac12),\,(\tfrac12,\tfrac12)\big)$ —— 第 11 章那个转不停的圈,到这里停住了。
⭐ 再念一遍那个反直觉点:罚球者的 1/2 是为了让守门员扑哪边都拿 0;守门员的 1/2 是为了让罚球者踢哪边都拿 0。 没有人在为自己调概率。
💡 一个改数字的小实验:为什么「把一个动作变好」会让你更少用它
把 (踢左, 扑右) 那一格从 1 分改成 3 分 —— 对罚球者是纯粹的好消息(左路空门时收益翻三倍)。零和,所以守门员在那格从 −1 变成 −3:
| 罚球者 \ 守门员 | 扑左 | 扑右 |
|---|---|---|
| 踢左 | 0, 0 | 3, −3 |
| 踢右 | 1, −1 | −1, 1 |
解 p(看守门员的收益):$u_2(\text{扑左}) = 0\cdot p + (-1)(1-p) = p-1$, $u_2(\text{扑右}) = (-3)p + 1\cdot(1-p) = 1-4p$。令相等:$p-1 = 1-4p \Rightarrow p = 2/5$。
解 q(看罚球者的收益):$u_1(\text{踢左}) = 0\cdot q + 3(1-q) = 3-3q$, $u_1(\text{踢右}) = 1\cdot q + (-1)(1-q) = 2q-1$。令相等:$3-3q = 2q-1 \Rightarrow q = 4/5$。
均衡收益:罚球者 $= 2\times\tfrac45 - 1 = 3/5$(另一式 $3-3\times\tfrac45 = 3/5$,对上了)。
⭐⭐ 看这个结果有多别扭:踢左变好了,罚球者踢左的概率却从 1/2 掉到 2/5, 守门员扑左的概率从 1/2 涨到 4/5。罚球者的收益确实从 0 涨到 3/5 —— 但这份好处是通过守门员改变行为兑现的,不是通过自己多踢左。
这是无差异原理的直接后果:你的概率由对手的收益决定,你的收益由对手的概率决定。 ⚠️ 所以「这个动作收益高,我就该多用它」在混合均衡里是错的。
✂️ 四、例子② 石头剪刀布:三个动作怎么办
三个动作,方程要多一条,但套路一模一样。
| 行 \ 列 | 石头 | 剪刀 | 布 |
|---|---|---|---|
| 石头 | 0, 0 | 1, −1 | −1, 1 |
| 剪刀 | −1, 1 | 0, 0 | 1, −1 |
| 布 | 1, −1 | −1, 1 | 0, 0 |
设行玩家混 $(p_1,p_2,p_3)$(石头/剪刀/布)。令列玩家对三个动作都无差异 —— 还是只看每格第二个数:
$$u_2(\text{石头}) = 0\cdot p_1 + 1\cdot p_2 + (-1)p_3 = p_2 - p_3$$ $$u_2(\text{剪刀}) = (-1)p_1 + 0\cdot p_2 + 1\cdot p_3 = p_3 - p_1$$ $$u_2(\text{布}) = 1\cdot p_1 + (-1)p_2 + 0\cdot p_3 = p_1 - p_2$$
三个相等,加上 $p_1+p_2+p_3=1$:
- 由 $p_2-p_3 = p_1-p_2$ 得 $p_1+p_3 = 2p_2$,代入归一化:$1-p_2 = 2p_2 \Rightarrow p_2 = 1/3$
- 由 $p_3-p_1 = p_1-p_2$ 得 $p_2+p_3 = 2p_1$,同样代入:$1-p_1 = 2p_1 \Rightarrow p_1 = 1/3$
- 所以 $p_3 = 1/3$,三个式子的公共值都是 0
$$\boxed{(p_1,p_2,p_3) = (\tfrac13,\tfrac13,\tfrac13)}$$
博弈对称,列玩家同理也是 $(\tfrac13,\tfrac13,\tfrac13)$,两人的均衡收益都是 0。
⭐ 数一下方程个数:n 个动作 → n 个未知数 → 需要 n 个方程 = 对手的 n−1 个无差异等式 + 1 个归一化。2×2 是 n=2 的特例(1 个等式 + 归一化)。
⚠️ 别被「三个都相等」骗了。这里三个动作恰好完全对称,所以答案是均匀分布; 一旦矩阵不对称(比如「出石头赢了给 2 分」),答案立刻就不是 1/3 了 —— 但列方程的方法一个字都不用改。
🥊 五、例子③ 性别之争:还第 11 章的账
第 11 章说性别之争有三个 NE,前两个纯的当场圈出来了,第三个混的欠着。现在补上。
| 行 \ 列 | 拳击 | 芭蕾 |
|---|---|---|
| 拳击 | 2, 1 | 0, 0 |
| 芭蕾 | 0, 0 | 1, 2 |
解 p(行玩家选拳击的概率)—— 看列玩家的收益:
$$u_2(\text{拳击}) = 1\cdot p + 0\cdot(1-p) = p,\qquad u_2(\text{芭蕾}) = 0\cdot p + 2(1-p) = 2-2p$$
$$p = 2-2p \Rightarrow \boxed{p = 2/3}$$
解 q(列玩家选拳击的概率)—— 看行玩家的收益:
$$u_1(\text{拳击}) = 2q,\qquad u_1(\text{芭蕾}) = 1-q,\qquad 2q = 1-q \Rightarrow \boxed{q = 1/3}$$
均衡收益:行玩家 $2q = 2/3$,列玩家 $p = 2/3$。
💀 这个均衡糟糕得值得单独记住。 把四格概率摊开:
| 结果 | 概率 | 收益 |
|---|---|---|
| (拳击, 拳击) | $\tfrac23\cdot\tfrac13 = \tfrac29$ | 2, 1 |
| (拳击, 芭蕾) | $\tfrac23\cdot\tfrac23 = \tfrac49$ | 0, 0 |
| (芭蕾, 拳击) | $\tfrac13\cdot\tfrac13 = \tfrac19$ | 0, 0 |
| (芭蕾, 芭蕾) | $\tfrac13\cdot\tfrac23 = \tfrac29$ | 1, 2 |
有 $\tfrac49+\tfrac19 = \tfrac59$ 的时间两个人根本没碰上面,各拿 0。 所以两人的期望收益只有 2/3,比两个纯 NE(拿 2 或拿 1)都差。
⭐ 这就是第 11 章那句「NE 是稳定性判据,不是对『会发生什么』的预测」最刺眼的版本: 这个组合完全稳定 —— 谁单方面改概率收益都不变 —— 但它 5/9 的时间在制造双输。
🔍 六、支撑集:怎么找,怎么验
前面三个例子都先假定了全支撑。真做题时支撑不是白送的,得猜。
验证清单(三条全过 = 是 NE)
对每个玩家 i:
- 支撑内的动作,期望收益全相等,记这个公共值为 $v_i$
- 支撑外的动作,期望收益 $\le v_i$(可以相等,不能更高)
- 概率非负、和为 1
⭐ 这三条来自第二节的无差异原理,不需要遍历所有可能的偏离。
找的办法:支撑枚举
猜一个支撑组合 → 按四步套路列线性方程 → 解 → 拿上面三条验证,不过关就换下一个。
- ⚠️ 概率跑到 $[0,1]$ 外面 → 这个支撑不成立,换;通常意味着某个动作根本不该被用。
- ⚠️ 解出 p = 0 或 1 → 它其实是纯策略,回去用圈法确认。
- ⚠️ 最容易漏第 2 条:3×3 里猜了两个动作的支撑,第三个动作必须不严格更好;不检查就交卷是最常见的丢分点。
⚠️ 为什么这不算高效算法:$m \times n$ 的非空支撑组合有 $(2^m-1)(2^n-1)$ 个,指数级 —— 正好对上第 11 章那句「找 NE 是 PPAD-完全」:解一定在,但不保证快速找到。 ⭐ 好在纸笔尺度够用:2×2 只有 $3\times3=9$ 种支撑组合(4 纯×纯、4 纯×混、1 混×混), 先删严格劣势动作还能再砍一批。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 13-零和与极大极小.html ⭐⭐ | 本章两个主例(罚球、石头剪刀布)都是零和。下一章说明:零和设定里混合均衡不但好算,而且所有 NE 都给同一个值 —— 第 11 章那三个毛病同时消失 |
| 11-纳什均衡.html | 回去看纯 NE 的圈法(第三节第 ① 步要用)、Nash 存在性定理和 PPAD-完全的出处 |
| 08-不确定性与期望效用.html | 本章从头到尾在对收益取期望。凭什么能这么加权平均?那一章的 vNM 定理是许可证 |
| 14-扩展式博弈.html | 罚球改成「一个人先亮」,混合立刻就不需要了 —— 随机化是同时出手才有的产物 |
| ../强化学习基础/07-探索与利用.html | 那边的策略也在故意随机(ε-greedy、熵正则),但理由相反:那是为了探索没试过的东西,这里是为了不被对手猜到 |
✅ 检查点
- 什么是混合策略?纯策略和它是什么关系?
- 无差异原理说了什么?为什么支撑集里的动作必须收益相等?
- 「玩家是替对手随机的」——具体到手算步骤,这句话让你把哪个人的收益写进方程?
- 用四步套路解罚球博弈,写出 p、q 和两人的均衡收益。
- 把 (踢左, 扑右) 从 1 分改成 3 分之后,罚球者踢左的概率往哪边走?为什么会是这个方向?
- 石头剪刀布里,如果行玩家混 $(p_1,p_2,p_3)$,列玩家出「石头」的期望收益是多少?三个动作各混 1/3 是怎么解出来的?
- 性别之争的混合 NE 是什么?两人各拿多少?为什么说它「比两个纯 NE 都差」?
- 验证一个混合组合是 NE,要查哪三条?最容易漏的是哪一条?
- 支撑枚举为什么不是高效算法?2×2 要试几种支撑?
👀 答案
- 混合策略是动作集上的一个概率分布 $s_i: A_i \to [0,1]$,$\sum_{a_i} s_i(a_i)=1$;概率大于 0 的动作合起来叫支撑集。纯策略是它的特例 —— 支撑集只有一个动作,概率 1。
- 策略组合是 NE 当且仅当每个玩家支撑内所有动作期望收益相等,且不小于支撑外任何动作。反证一句话:若支撑里「左」比「右」高,把押在「右」上的概率全挪到「左」,期望严格变高 → 原来那个混合不是最佳响应 → 不可能是 NE 的一部分。
- 写进对手的收益。⭐ 口诀:求谁的概率,就翻到对面的收益去列方程 —— 解行玩家的 p 用每格第二个数(令列玩家无差异),解列玩家的 q 用每格第一个数。根子是那条推论:你调自己的概率影响不到自己的期望,只能影响对手的期望。
- 令守门员无差异:$2p-1 = 1-2p \Rightarrow p = 1/2$;令罚球者无差异:$1-2q = 2q-1 \Rightarrow q = 1/2$。均衡收益两人都是 0,这是罚球博弈的唯一 NE,也是第 11 章那个「四步转回原点」的圈的终点。
- 反而变小:从 1/2 掉到 2/5。零和,所以那一格同时把守门员的损失从 −1 加深到 −3,守门员更怕这一格 → 扑左从 1/2 涨到 4/5 → 罚球者要维持守门员的无差异只能踢得更少。⭐ 收益确实从 0 涨到 3/5,但是通过对手改变行为兑现的。
- $u_2(\text{石头}) = 0\cdot p_1 + 1\cdot p_2 + (-1)p_3 = p_2-p_3$。三式($p_2-p_3$、$p_3-p_1$、$p_1-p_2$)两两相等配上 $p_1+p_2+p_3=1$:由 $p_1+p_3=2p_2$ 得 $p_2=1/3$,同理 $p_1=1/3$,于是 $p_3=1/3$,公共值都是 0。⭐ 方程个数 = 对手的 n−1 个无差异等式 + 1 个归一化。
- 行拳击 2/3、列拳击 1/3,两人期望收益都是 2/3。差的原因:$\tfrac49+\tfrac19=\tfrac59$ 的时间两人没碰上各拿 0,而两个纯 NE 给的是 (2,1) 和 (1,2)。💀「NE 是稳定性判据不是预测」最刺眼的例子 —— 完全稳定,却 5/9 的时间在制造双输。
- ① 支撑内期望全相等(记为 $v_i$)② 支撑外期望 $\le v_i$ ③ 概率非负且和为 1。⚠️ 最容易漏第 ② 条 —— 3×3 里猜了两个动作的支撑却不查第三个动作。另两个信号:概率跑出 [0,1] 说明支撑猜错,解出 0 或 1 说明其实是纯策略。
- $(2^m-1)(2^n-1)$ 个非空支撑组合,指数级,对上第 11 章的 PPAD-完全。2×2 只有 9 种(4 纯×纯、4 纯×混、1 混×混),纸笔够用。
🛑 可以停在这里
⚡ 走神救援
⭐「被猜到就输」时,理性做法是掷骰子:混合策略 = 动作上的概率分布,概率 >0 的动作叫支撑集(纯策略是支撑只有一个动作的特例)。⭐⭐心脏是无差异原理:$s$ 是 NE 当且仅当每个玩家支撑内所有动作期望收益相等、且不小于支撑外的。反证一句:若支撑里「左」比「右」高,把押「右」的概率全挪到「左」就严格更好 → 原混合不是最佳响应。⭐推论:你怎么在支撑内分配概率,自己的期望都不变,所以你的收益完全由对手的混合决定 —— 由此得到全章最反直觉的一句:「玩家是替对手随机的」。落到手算是四步:①圈法找纯 NE、删严格劣势动作 ②令列玩家无差异(用每格第二个数)解出 p ③令行玩家无差异(用每格第一个数)解出 q ④回代验证。⭐口诀:求谁的概率,就翻到对面的收益去列方程;⚠️拿自己的收益解自己的概率是最普遍的错法。罚球:$2p-1=1-2p \Rightarrow p=1/2$、$1-2q=2q-1 \Rightarrow q=1/2$,收益 0/0,第 11 章那个转不停的圈到此停住。把 (踢左,扑右) 从 1 改成 3 后,踢左概率反而从 1/2 掉到 2/5、守门员扑左从 1/2 涨到 4/5、罚球者收益从 0 涨到 3/5 —— 好处是通过对手的行为兑现的。石头剪刀布:$p_2-p_3$、$p_3-p_1$、$p_1-p_2$ 两两相等 + 归一化 → (1/3,1/3,1/3),值 0;方程个数 = 对手的 n−1 个无差异等式 + 1 个归一化。性别之争(还第 11 章的账):行拳击 2/3、列拳击 1/3,两人只拿 2/3,比两个纯 NE 都差 —— 5/9 的时间两人没碰上各拿 0,NE 是稳定性判据不是预测。验证三条:支撑内相等、支撑外 ≤、概率非负且和为 1,⚠️最容易漏第二条。找法是支撑枚举(猜支撑 → 列方程 → 解 → 验):概率跑出 [0,1] 就换支撑,解出 0/1 说明其实是纯策略;⚠️$(2^m-1)(2^n-1)$ 个组合是指数级,对上 PPAD-完全,但 2×2 只有 9 种,纸笔够用。
下一节 👉 13-零和与极大极小.md ⭐⭐
去那里的理由:本章两个主例都是零和博弈,而零和是整套理论里唯一真正被解决掉的设定 —— 第 11 章列的「多重 / 低效 / 难算」三个毛病,在那里同时消失。