🏠 总目录📚 本教程 12 · 混合策略
📑 本页目录(点开跳转)

12 · 混合策略

44 分钟 | ⭐⭐ 你掷骰子的概率,是替对手调的


🎯 一句话

当「被猜到就输」时,理性的做法是掷骰子;而你掷骰子的概率不是为了让自己舒服, 是为了让对手怎么选都一样。

上一章留了个欠账:罚球博弈里两个人轮流改最佳响应,四步转回原点,永远停不下来。 这一章把它解开,顺带给出 Nash 存在性定理保证的那个「一定存在」的东西长什么样。


🎲 一、为什么必须掷骰子

罚球博弈(matching pennies)的收益矩阵:

罚球者 \ 守门员
−1, 1 1, −1
1, −1 −1, 1

这个博弈的本质是「不能被猜到」。 只要你的选择是可预测的 —— 哪怕是「我永远踢左」这种 看起来很坚定的策略 —— 对手照着扑就行,你稳输。

所以「不可预测」本身就是一种策略。 形式化之后它叫混合策略: 你不是选一个动作,而是选一个动作上的概率分布,然后按这个分布随机。

$$s_i : A_i \to [0,1],\qquad \sum_{a_i \in A_i} s_i(a_i) = 1$$

期望收益怎么算

两边都在掷骰子时,你拿到的收益是个随机变量,所以比的是期望: 把每一格的收益乘上「这一格被打出来的概率」,加起来。

$$u_i(s) = \sum_{a \in A} \Big(\prod_{j \in N} s_j(a_j)\Big)\, u_i(a)$$

举个数:罚球者 60% 左 / 40% 右,守门员 50% / 50%,罚球者的期望收益是

$$0.6{\times}0.5{\times}(-1) + 0.6{\times}0.5{\times}1 + 0.4{\times}0.5{\times}1 + 0.4{\times}0.5{\times}(-1) = 0$$

⚠️ 手算时别真的展开四项。有个省事得多的办法:先把对手的混合固定住, 算出你每个纯动作的期望收益,再按你自己的概率加权。 下一节整个套路都建在这上面。


💡 二、⭐⭐ 无差异原理:均衡里你其实无所谓

这是这一章的心脏。先看结论:

引理(无差异原理):策略组合 $s$ 是纳什均衡,当且仅当对每个玩家 $i$, 支撑集里的所有动作期望收益完全相等,而且不小于支撑集外任何动作的期望收益。

$$u_i(a_i, s_{-i}) = u_i(b_i, s_{-i}) \ \ge\ u_i(c_i, s_{-i}) > \qquad s_i(a_i)>0,\ s_i(b_i)>0,\ s_i(c_i)=0$$

为什么必须相等(一句话的反证)

假设你的支撑集里「左」的期望收益比「右」高。那你把押在「右」上的概率全部挪到「左」, 期望收益严格变高 —— 说明原来那个混合不是最佳响应,也就不可能是均衡的一部分。 所以:只要一个动作你还在用,它就必须和你在用的其他动作一样好。

推论(手算时天天用):既然支撑集里每个动作期望收益都一样, 你怎么在支撑集内部分配概率,自己的期望收益都不变。 换句话说 —— 你的收益完全由对手的混合决定,和你自己的概率无关。

⚠️⚠️ 那我调概率是在调什么?—— 全章最反直觉的一句

⭐⭐ 「玩家是替对手随机的。」(Players randomize for other players.)

行玩家的混合概率 p,是由「让列玩家无差异」这个条件解出来的; 列玩家的混合概率 q,是由「让行玩家无差异」解出来的。

几乎所有人第一次都会做反:拿自己的收益去列方程解自己的概率。那样一定错。 记忆锚点:你调概率影响不到自己的期望(上面那条推论),只能影响对手的期望 —— 所以你的概率只可能是为对手的无差异条件服务的

⭐ 还有一条推论:判断一个策略组合是不是 NE 很快 —— 不用遍历所有偏离, 只要检查「每个人支撑内的动作期望是否相等、且不低于支撑外的」就够了。 这一条在下面第五节的验证步骤里会直接用上。


🧮 三、2×2 混合 NE 的手算套路

上面那句「玩家是替对手随机的」不只是一句俏皮话,它直接就是手算步骤

设行玩家混 $(p,\,1-p)$、列玩家混 $(q,\,1-q)$。四步:

做什么 关键
先用第 11 章的圈法找纯 NE 顺手把严格劣势的动作删掉 —— 它永远不会进任何 NE 的支撑集
令列玩家对他的两个动作无差异,解出 p 列方程时用每格第二个数(列玩家的收益)
令行玩家对他的两个动作无差异,解出 q 列方程时用每格第一个数(行玩家的收益)
回代算两人的均衡期望收益,并验证 见第五节的三条清单

⭐⭐ 一句话记法:求谁的概率,就翻到对面的收益去列方程。 ⚠️ 拿行玩家自己的收益去解 p,是这一章唯一的、也是最普遍的错法。做完一定回头看一眼你用的是哪一列数。

例子① 罚球(matching pennies)

回到第一节那张表:

罚球者 \ 守门员
−1, 1 1, −1
1, −1 −1, 1

② 解 p(罚球者踢左的概率)—— 看守门员的收益,设罚球者混 $(p,1-p)$:

$$u_2(\text{扑左}) = p\cdot 1 + (1-p)\cdot(-1) = 2p-1$$ $$u_2(\text{扑右}) = p\cdot(-1) + (1-p)\cdot 1 = 1-2p$$

令两者相等:$2p-1 = 1-2p \Rightarrow 4p = 2 \Rightarrow \boxed{p = 1/2}$

③ 解 q(守门员扑左的概率)—— 看罚球者的收益,设守门员混 $(q,1-q)$:

$$u_1(\text{踢左}) = q\cdot(-1) + (1-q)\cdot 1 = 1-2q$$ $$u_1(\text{踢右}) = q\cdot 1 + (1-q)\cdot(-1) = 2q-1$$

令两者相等:$1-2q = 2q-1 \Rightarrow \boxed{q = 1/2}$

④ 回代:两人的均衡期望收益都是 0。这个博弈的唯一 NE 是 $\big((\tfrac12,\tfrac12),\,(\tfrac12,\tfrac12)\big)$ —— 第 11 章那个转不停的圈,到这里停住了。

⭐ 再念一遍那个反直觉点:罚球者的 1/2 是为了让守门员扑哪边都拿 0;守门员的 1/2 是为了让罚球者踢哪边都拿 0。 没有人在为自己调概率。

💡 一个改数字的小实验:为什么「把一个动作变好」会让你更少用它

把 (踢左, 扑右) 那一格从 1 分改成 3 分 —— 对罚球者是纯粹的好消息(左路空门时收益翻三倍)。零和,所以守门员在那格从 −1 变成 −3:

罚球者 \ 守门员 扑左 扑右
踢左 0, 0 3, −3
踢右 1, −1 −1, 1

解 p(看守门员的收益):$u_2(\text{扑左}) = 0\cdot p + (-1)(1-p) = p-1$, $u_2(\text{扑右}) = (-3)p + 1\cdot(1-p) = 1-4p$。令相等:$p-1 = 1-4p \Rightarrow p = 2/5$。

解 q(看罚球者的收益):$u_1(\text{踢左}) = 0\cdot q + 3(1-q) = 3-3q$, $u_1(\text{踢右}) = 1\cdot q + (-1)(1-q) = 2q-1$。令相等:$3-3q = 2q-1 \Rightarrow q = 4/5$。

均衡收益:罚球者 $= 2\times\tfrac45 - 1 = 3/5$(另一式 $3-3\times\tfrac45 = 3/5$,对上了)。

⭐⭐ 看这个结果有多别扭:踢左变好了,罚球者踢左的概率却从 1/2 掉到 2/5, 守门员扑左的概率从 1/2 涨到 4/5。罚球者的收益确实从 0 涨到 3/5 —— 但这份好处是通过守门员改变行为兑现的,不是通过自己多踢左

这是无差异原理的直接后果:你的概率由对手的收益决定,你的收益由对手的概率决定。 ⚠️ 所以「这个动作收益高,我就该多用它」在混合均衡里是错的。


✂️ 四、例子② 石头剪刀布:三个动作怎么办

三个动作,方程要多一条,但套路一模一样。

行 \ 列 石头 剪刀
石头 0, 0 1, −1 −1, 1
剪刀 −1, 1 0, 0 1, −1
1, −1 −1, 1 0, 0

设行玩家混 $(p_1,p_2,p_3)$(石头/剪刀/布)。令列玩家对三个动作都无差异 —— 还是只看每格第二个数

$$u_2(\text{石头}) = 0\cdot p_1 + 1\cdot p_2 + (-1)p_3 = p_2 - p_3$$ $$u_2(\text{剪刀}) = (-1)p_1 + 0\cdot p_2 + 1\cdot p_3 = p_3 - p_1$$ $$u_2(\text{布}) = 1\cdot p_1 + (-1)p_2 + 0\cdot p_3 = p_1 - p_2$$

三个相等,加上 $p_1+p_2+p_3=1$:

$$\boxed{(p_1,p_2,p_3) = (\tfrac13,\tfrac13,\tfrac13)}$$

博弈对称,列玩家同理也是 $(\tfrac13,\tfrac13,\tfrac13)$,两人的均衡收益都是 0

数一下方程个数:n 个动作 → n 个未知数 → 需要 n 个方程 = 对手的 n−1 个无差异等式 + 1 个归一化。2×2 是 n=2 的特例(1 个等式 + 归一化)。

⚠️ 别被「三个都相等」骗了。这里三个动作恰好完全对称,所以答案是均匀分布; 一旦矩阵不对称(比如「出石头赢了给 2 分」),答案立刻就不是 1/3 了 —— 但列方程的方法一个字都不用改


🥊 五、例子③ 性别之争:还第 11 章的账

第 11 章说性别之争有三个 NE,前两个纯的当场圈出来了,第三个混的欠着。现在补上。

行 \ 列 拳击 芭蕾
拳击 2, 1 0, 0
芭蕾 0, 0 1, 2

解 p(行玩家选拳击的概率)—— 看列玩家的收益

$$u_2(\text{拳击}) = 1\cdot p + 0\cdot(1-p) = p,\qquad u_2(\text{芭蕾}) = 0\cdot p + 2(1-p) = 2-2p$$

$$p = 2-2p \Rightarrow \boxed{p = 2/3}$$

解 q(列玩家选拳击的概率)—— 看行玩家的收益

$$u_1(\text{拳击}) = 2q,\qquad u_1(\text{芭蕾}) = 1-q,\qquad 2q = 1-q \Rightarrow \boxed{q = 1/3}$$

均衡收益:行玩家 $2q = 2/3$,列玩家 $p = 2/3$。

💀 这个均衡糟糕得值得单独记住。 把四格概率摊开:

结果 概率 收益
(拳击, 拳击) $\tfrac23\cdot\tfrac13 = \tfrac29$ 2, 1
(拳击, 芭蕾) $\tfrac23\cdot\tfrac23 = \tfrac49$ 0, 0
(芭蕾, 拳击) $\tfrac13\cdot\tfrac13 = \tfrac19$ 0, 0
(芭蕾, 芭蕾) $\tfrac13\cdot\tfrac23 = \tfrac29$ 1, 2

有 $\tfrac49+\tfrac19 = \tfrac59$ 的时间两个人根本没碰上面,各拿 0。 所以两人的期望收益只有 2/3比两个纯 NE(拿 2 或拿 1)都差

⭐ 这就是第 11 章那句「NE 是稳定性判据,不是对『会发生什么』的预测」最刺眼的版本: 这个组合完全稳定 —— 谁单方面改概率收益都不变 —— 但它 5/9 的时间在制造双输


🔍 六、支撑集:怎么找,怎么验

前面三个例子都先假定了全支撑。真做题时支撑不是白送的,得猜。

验证清单(三条全过 = 是 NE)

对每个玩家 i:

  1. 支撑内的动作,期望收益全相等,记这个公共值为 $v_i$
  2. 支撑外的动作,期望收益 $\le v_i$(可以相等,不能更高)
  3. 概率非负和为 1

⭐ 这三条来自第二节的无差异原理,不需要遍历所有可能的偏离

找的办法:支撑枚举

猜一个支撑组合 → 按四步套路列线性方程 → 解 → 拿上面三条验证,不过关就换下一个。

⚠️ 为什么这不算高效算法:$m \times n$ 的非空支撑组合有 $(2^m-1)(2^n-1)$ 个,指数级 —— 正好对上第 11 章那句「找 NE 是 PPAD-完全」:解一定在,但不保证快速找到。 ⭐ 好在纸笔尺度够用:2×2 只有 $3\times3=9$ 种支撑组合(4 纯×纯、4 纯×混、1 混×混), 先删严格劣势动作还能再砍一批。


🔗 这一章连到哪里

去哪 为什么
13-零和与极大极小.html ⭐⭐ 本章两个主例(罚球、石头剪刀布)都是零和。下一章说明:零和设定里混合均衡不但好算,而且所有 NE 都给同一个值 —— 第 11 章那三个毛病同时消失
11-纳什均衡.html 回去看纯 NE 的圈法(第三节第 ① 步要用)、Nash 存在性定理和 PPAD-完全的出处
08-不确定性与期望效用.html 本章从头到尾在对收益取期望。凭什么能这么加权平均?那一章的 vNM 定理是许可证
14-扩展式博弈.html 罚球改成「一个人先亮」,混合立刻就不需要了 —— 随机化是同时出手才有的产物
../强化学习基础/07-探索与利用.html 那边的策略也在故意随机(ε-greedy、熵正则),但理由相反:那是为了探索没试过的东西,这里是为了不被对手猜到

✅ 检查点

  1. 什么是混合策略?纯策略和它是什么关系?
  2. 无差异原理说了什么?为什么支撑集里的动作必须收益相等?
  3. 「玩家是替对手随机的」——具体到手算步骤,这句话让你把哪个人的收益写进方程?
  4. 用四步套路解罚球博弈,写出 p、q 和两人的均衡收益。
  5. 把 (踢左, 扑右) 从 1 分改成 3 分之后,罚球者踢左的概率往哪边走?为什么会是这个方向?
  6. 石头剪刀布里,如果行玩家混 $(p_1,p_2,p_3)$,列玩家出「石头」的期望收益是多少?三个动作各混 1/3 是怎么解出来的?
  7. 性别之争的混合 NE 是什么?两人各拿多少?为什么说它「比两个纯 NE 都差」?
  8. 验证一个混合组合是 NE,要查哪三条?最容易漏的是哪一条?
  9. 支撑枚举为什么不是高效算法?2×2 要试几种支撑?
👀 答案
  1. 混合策略是动作集上的一个概率分布 $s_i: A_i \to [0,1]$,$\sum_{a_i} s_i(a_i)=1$;概率大于 0 的动作合起来叫支撑集纯策略是它的特例 —— 支撑集只有一个动作,概率 1。
  2. 策略组合是 NE 当且仅当每个玩家支撑内所有动作期望收益相等,且不小于支撑外任何动作。反证一句话:若支撑里「左」比「右」高,把押在「右」上的概率全挪到「左」,期望严格变高 → 原来那个混合不是最佳响应 → 不可能是 NE 的一部分。
  3. 写进对手的收益。⭐ 口诀:求谁的概率,就翻到对面的收益去列方程 —— 解行玩家的 p 用每格第二个数(令列玩家无差异),解列玩家的 q 用每格第一个数。根子是那条推论:你调自己的概率影响不到自己的期望,只能影响对手的期望。
  4. 令守门员无差异:$2p-1 = 1-2p \Rightarrow p = 1/2$;令罚球者无差异:$1-2q = 2q-1 \Rightarrow q = 1/2$。均衡收益两人都是 0,这是罚球博弈的唯一 NE,也是第 11 章那个「四步转回原点」的圈的终点。
  5. 反而变小:从 1/2 掉到 2/5。零和,所以那一格同时把守门员的损失从 −1 加深到 −3,守门员更怕这一格 → 扑左从 1/2 涨到 4/5 → 罚球者要维持守门员的无差异只能踢得更少。⭐ 收益确实从 0 涨到 3/5,但是通过对手改变行为兑现的
  6. $u_2(\text{石头}) = 0\cdot p_1 + 1\cdot p_2 + (-1)p_3 = p_2-p_3$。三式($p_2-p_3$、$p_3-p_1$、$p_1-p_2$)两两相等配上 $p_1+p_2+p_3=1$:由 $p_1+p_3=2p_2$ 得 $p_2=1/3$,同理 $p_1=1/3$,于是 $p_3=1/3$,公共值都是 0。⭐ 方程个数 = 对手的 n−1 个无差异等式 + 1 个归一化
  7. 行拳击 2/3、列拳击 1/3,两人期望收益都是 2/3。差的原因:$\tfrac49+\tfrac19=\tfrac59$ 的时间两人没碰上各拿 0,而两个纯 NE 给的是 (2,1) 和 (1,2)。💀「NE 是稳定性判据不是预测」最刺眼的例子 —— 完全稳定,却 5/9 的时间在制造双输
  8. ① 支撑内期望全相等(记为 $v_i$)② 支撑外期望 $\le v_i$ ③ 概率非负且和为 1。⚠️ 最容易漏第 ② 条 —— 3×3 里猜了两个动作的支撑却不查第三个动作。另两个信号:概率跑出 [0,1] 说明支撑猜错,解出 0 或 1 说明其实是纯策略。
  9. $(2^m-1)(2^n-1)$ 个非空支撑组合,指数级,对上第 11 章的 PPAD-完全2×2 只有 9 种(4 纯×纯、4 纯×混、1 混×混),纸笔够用。

🛑 可以停在这里

走神救援

「被猜到就输」时,理性做法是掷骰子:混合策略 = 动作上的概率分布,概率 >0 的动作叫支撑集(纯策略是支撑只有一个动作的特例)。⭐⭐心脏是无差异原理:$s$ 是 NE 当且仅当每个玩家支撑内所有动作期望收益相等、且不小于支撑外的。反证一句:若支撑里「左」比「右」高,把押「右」的概率全挪到「左」就严格更好 → 原混合不是最佳响应。⭐推论:你怎么在支撑内分配概率,自己的期望都不变,所以你的收益完全由对手的混合决定 —— 由此得到全章最反直觉的一句:「玩家是替对手随机的」。落到手算是四步:①圈法找纯 NE、删严格劣势动作 ②令列玩家无差异(用每格第二个数)解出 p令行玩家无差异(用每格第一个数)解出 q ④回代验证。⭐口诀:求谁的概率,就翻到对面的收益去列方程;⚠️拿自己的收益解自己的概率是最普遍的错法。罚球:$2p-1=1-2p \Rightarrow p=1/2$、$1-2q=2q-1 \Rightarrow q=1/2$,收益 0/0,第 11 章那个转不停的圈到此停住。把 (踢左,扑右) 从 1 改成 3 后,踢左概率反而从 1/2 掉到 2/5、守门员扑左从 1/2 涨到 4/5、罚球者收益从 0 涨到 3/5 —— 好处是通过对手的行为兑现的石头剪刀布:$p_2-p_3$、$p_3-p_1$、$p_1-p_2$ 两两相等 + 归一化 → (1/3,1/3,1/3),值 0;方程个数 = 对手的 n−1 个无差异等式 + 1 个归一化性别之争(还第 11 章的账):行拳击 2/3、列拳击 1/3,两人只拿 2/3比两个纯 NE 都差 —— 5/9 的时间两人没碰上各拿 0,NE 是稳定性判据不是预测验证三条:支撑内相等、支撑外 ≤、概率非负且和为 1,⚠️最容易漏第二条。找法是支撑枚举(猜支撑 → 列方程 → 解 → 验):概率跑出 [0,1] 就换支撑,解出 0/1 说明其实是纯策略;⚠️$(2^m-1)(2^n-1)$ 个组合是指数级,对上 PPAD-完全,但 2×2 只有 9 种,纸笔够用。

下一节 👉 13-零和与极大极小.md ⭐⭐

去那里的理由:本章两个主例都是零和博弈,而零和是整套理论里唯一真正被解决掉的设定 —— 第 11 章列的「多重 / 低效 / 难算」三个毛病,在那里同时消失。

打卡记录保存在你的浏览器里,首页能看到总进度