📑 本页目录(点开跳转)
08 · 不确定性与期望效用
⏱ 42 分钟 | ⭐ 「算期望」这件事凭什么合法
🎯 一句话
只要你的偏好满足理性 + 连续性 + 独立性,比较随机结果就一定等价于比较期望效用。 这是 von Neumann–Morgenstern 定理。它把「遇到随机就算期望」从一种习惯升级成了一条定理。
🎲 一、上一章的效用在这里不够用了
上一章的结论是:理性偏好可以写成效用函数,但效用是序数的,数值只承载排序。
可真实决策的结果往往是随机的(读一个好学校只是更可能拿到好 offer, 推一条内容给用户他可能点也可能划走)。这时候要比的不再是「苹果 vs 香蕉」,而是 $[0.8 : \text{苹果},\ 0.2 : \text{香蕉}]$ 这种彩票和 $[1:\text{橘子}]$ 之间谁更好。
⚠️ 序数效用在这里立刻失效:要算「0.8 份苹果的效用 + 0.2 份香蕉的效用」, 你得先承认效用能做加权平均,也就是承认它是个可以做算术的量。 可上一章说过 $u=(3,2,1)$ 和 $v=(100,2,1)$ 表示同一个偏好 —— 平均值算出来完全不同。 这一章就是在补这个洞。
🎫 二、彩票:把随机结果写下来
彩票(lottery) 就是 $A$ 上的一个概率分布,全体彩票记作 $\mathcal{L}(A) = \{\, p \in [0,1]^A : \sum_{x \in A} p(x) = 1 \,\}$。 记法用中括号,冒号左边概率、右边结果:$L = [\,0.05 : \text{过},\ 0.95 : \text{挂}\,]$。
复合彩票(compound lottery) 是「彩票的彩票」:$[\,\alpha : L_1,\ (1-\alpha) : L_2\,]$ 表示以概率 $\alpha$ 执行 $L_1$、以 $1-\alpha$ 执行 $L_2$。它可以摊平成简单彩票:
$$L(a) = \alpha \cdot L_1(a) + (1-\alpha)\cdot L_2(a) \qquad \text{对每个 } a \in A$$
热身算一个:$L_1 = [0.6 : x,\ 0.4 : y]$,$L_2 = [1 : y]$,$L = [\,0.5 : L_1,\ 0.5 : L_2\,]$, 则 $L(x) = 0.5\times0.6 = 0.3$,$L(y) = 0.5\times0.4 + 0.5\times1 = 0.7$,和为 1 ✓。
⭐ 摊平看着无聊,其实是一条实质假设:它默认「先抛硬币再抽奖」和「直接按合成概率抽奖」 对你完全一样 —— 你只在乎最终的概率分布,不在乎抽奖的过程和层数。 真有人在乎(享受抽奖过程,或讨厌悬念拖太久),那种偏好这套框架装不下。
🤔 三、比较彩票的方式不止「算期望」一种
关键的一步:$\mathcal{L}(A)$ 本身也是一个(无穷大的)选项集合,所以 可以直接在彩票上定义偏好关系,完全不需要提到期望。讲义给了两条链,对比着看(设 $a \succ b$):
链一(符合直觉,也符合期望效用):$\ [1:a] \succ [0.99:a,\ 0.01:b] \succ [0.98:a,\ 0.02:b] \succ \cdots$ —— 「$b$ 掺得越少越好」,很自然。
链二(也完全合法,但它不是期望效用):$\ [1:a] \succ [1:b] \succ [0.99:a,\ 0.01:b] \succ \cdots$ —— 读一遍:宁可确定拿到差的 $b$,也不要「99% 拿到好的 $a$」。 这个人厌恶随机化本身,只要结果不确定就先扣一大笔分。
⭐ 链二不可能被期望效用表示,两行说清:若存在这样的 $u$,则 $[1:a] \succ [1:b]$ 给出 $u(a) > u(b)$; 而 $[0.99:a, 0.01:b]$ 的期望效用 $0.99u(a) + 0.01u(b)$ 是两者的加权平均,必然严格夹在中间, 所以它必须排在 $[1:b]$ 前面 —— 和链二正相反,矛盾。
💡 这一节的全部意义:「遇到随机就算期望」不是天经地义的,它是一条额外假设。 下一节的两条公理就是把它拆成两句可以逐条检查的话。
📏 四、两条公理
① 连续性(continuity)
对所有满足 $L_1 \succ L_2 \succ L_3$ 的彩票,存在 $\epsilon > 0$ 使得 $$[\,1-\epsilon : L_1,\ \epsilon : L_3\,] \ \succ\ L_2\ \succ\ [\,1-\epsilon : L_3,\ \epsilon : L_1\,]$$
讲义的例子最好懂:偏好是 和朋友出去玩($L_1$)$\succ$ 学习($L_2$)$\succ$ 撞见前任($L_3$)。 连续性说:只要「撞见前任」的概率足够小,你还是宁可出门玩,而不是留下学习。 它排除掉的是词典式偏好:「哪怕只有百万分之一的概率撞见前任,我也绝不出门。」
⚠️ 这种偏好现实里真实存在(涉及生命危险的选择基本都长这样)。 所以连续性和传递性一样,是规范性假设,不是经验事实。
② 独立性(independence)
对所有彩票 $L_1, L_2, L_3$ 和所有 $p \in (0,1)$: $$L_1 \succsim L_2 \iff [\,p:L_1,\ (1-p):L_3\,] \ \succsim\ [\,p:L_2,\ (1-p):L_3\,]$$
人话:两边掺进去的是同一个东西、同样的概率,这部分共有,应该能约掉。
具体场景:你在 $L_1$(80% 拿 100 元)和 $L_2$(确定拿 70 元)之间选。现在改规则:先抛硬币, 正面执行你选的那个,反面不管你选什么都罚 50 元。独立性说你的选择不该改变。
⚠️ 这是被实验推翻得最狠的一条(阿莱悖论:真人在「确定拿到」附近会系统性违反它)。 但它在规范层面依然站得住 —— 违反它的人同样能被做成钱泵。
⭐ 五、vNM 定理
定理(von Neumann and Morgenstern, 1947) $\mathcal{L}(A)$ 上的偏好关系 $\succsim$ 是理性的、连续的、独立的, 当且仅当存在 $A$ 上的效用函数 $u$,使得对所有彩票 $L_1, L_2 \in \mathcal{L}(A)$: $$L_1 \succsim L_2 \iff \sum_{x \in A} L_1(x)\,u(x)\ \ge\ \sum_{x \in A} L_2(x)\,u(x)$$
右边那个和就是期望效用 $EU(L) = \sum_x L(x)u(x)$。证明不给 —— 它长而且看懂了也不改变你的用法。 但下面三条「它意味着什么」必须拿走。
① 「算期望效用」从习惯变成了定理。 你不再需要假设「agent 最大化期望效用」, 只假设他的偏好满足那三条,「他在最大化某个 $u$ 的期望」是推出来的。这是整个决策论的地基。
② $u$ 只是偏好的紧凑表示,不是「快乐的度量」。 它不在 agent 脑子里, 是我们从他的选择反推出来的。问「他的效用真的是 3 吗」没有意义。
③ ⭐ 唯一性:$u$ 只在正仿射变换下唯一。 对任意 $\alpha>0$、任意 $\beta$, $\alpha u(\cdot)+\beta$ 表示同一个偏好(期望是线性的,同乘同加不改变不等号方向)。这比上一章强多少:
| 问题 | 序数效用(07 章) | vNM 效用(本章) |
|---|---|---|
| 允许什么变换 | 任意严格递增 $f$ | 只允许 $\alpha u + \beta$,$\alpha>0$ |
| $u(a)-u(b)$ 单独有意义吗 | ❌ | ❌($\alpha$ 会缩放它) |
| $\dfrac{u(a)-u(b)}{u(b)-u(c)}$ 有意义吗 | ❌ | ✅ 有($\alpha$、$\beta$ 都约掉了) |
| 「$u(a)$ 是 $u(b)$ 的 2 倍」有意义吗 | ❌ | ❌ 仍然没有($\beta$ 能平移零点) |
| 能比较彩票吗 | ❌ | ✅ 这就是全部的意义 |
⭐ 记这一行就够:vNM 效用是区间尺度,和摄氏温度一模一样 —— 「20°C 比 10°C 高的幅度等于 30°C 比 20°C 高的幅度」对,「20°C 是 10°C 的两倍热」错。
✍️ 六、手算:标定一个 vNM 效用函数
这是考试的标准题型,务必自己走一遍。
设 $A = \{a, b, c\}$,某人的偏好 $\succsim$ 是理性、连续、独立的。已知两条信息: ① $[1:a] \succ [1:b]$(确定拿 $a$ 好过确定拿 $b$) ② $\big[\tfrac12 : b,\ \tfrac12 : c\big] \ \sim\ \big[\tfrac23 : a,\ \tfrac13 : c\big]$
求:$a$、$b$、$c$ 三者的排序,以及一个表示它的 vNM 效用函数。
第 1 步:由 vNM 定理,存在 $u$ 使得比彩票 = 比期望效用。 条件 ① 给出 $u(a) > u(b)$。
第 2 步:把条件 ② 写成期望效用相等, $\tfrac12 u(b) + \tfrac12 u(c) = \tfrac23 u(a) + \tfrac13 u(c)$。 两边同乘 6 得 $3u(b) + 3u(c) = 4u(a) + 2u(c)$,整理成
$$u(c) \;=\; 4u(a) - 3u(b)$$
第 3 步:判断排序。 代进去做差:
$$u(c) - u(a) \;=\; 4u(a) - 3u(b) - u(a) \;=\; 3\big(u(a) - u(b)\big) \;>\; 0$$
因为第 1 步已有 $u(a) > u(b)$。所以 $u(c) > u(a) > u(b)$,即 $c \succ a \succ b$。 ⭐ 题目根本没直接说 $c$ 排第几,是那条无差异关系逼出来的。
第 4 步:用两个自由度钉死数值。 正仿射变换有 $\alpha$、$\beta$ 两个自由度,正好够钉两个点; 惯例是最差的定 0、最好的定 1:$v(b)=0,\ v(c)=1$。代回上式得 $1 = 4v(a)$,即 $v(a) = \tfrac14$。
第 5 步:验算(考试丢分最多的一步)。左边 $=\tfrac12\times0+\tfrac12\times1=\tfrac12$, 右边 $=\tfrac23\times\tfrac14+\tfrac13\times1=\tfrac16+\tfrac13=\tfrac12$ ✓, 且 $1 > \tfrac14 > 0$ 与第 3 步排序一致 ✓。
🔑 手法固化:最好的定 1、最差的定 0,中间的用一条无差异等式解出来。 这套路能用,纯粹因为 vNM 效用的自由度恰好是 2 个。
📉 七、风险态度就藏在效用函数的形状里
一句话的事,不展开成金融课:凹的 $u$(边际效用递减)$\Rightarrow$ 风险厌恶。 设 $u(x)=\sqrt{x}$,彩票 $L = [\,\tfrac12 : 0,\ \tfrac12 : 100\,]$(单位:元):
- 期望金额 $=50$ 元,期望效用 $EU(L)=\tfrac12\sqrt{0}+\tfrac12\sqrt{100}=5$
- 而确定拿 50 元的效用 $u(50)=\sqrt{50}\approx 7.07 > 5$ ⭐ 所以他宁可不赌
- 解 $\sqrt{x}=5$ 得 $x=25$:确定给 25 元他就肯放弃这张彩票(叫确定等价), 风险溢价 $=50-25=25$ 元 —— 他愿意为「不赌」付掉一半
⭐ 要记的只有这一句:风险态度不是 vNM 之外的额外假设,完全由 $u$ 的形状决定 —— 凹 = 厌恶、直线 = 中性、凸 = 偏好。「风险厌恶的 agent」和「$u$ 凹的 agent」是同一件事。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 09-正常形博弈.html | 下一章开始有别人了。收益矩阵里那些数默认就是 vNM 效用 —— 只有这样,后面对随机行为求期望才合法 |
| 12-混合策略.html | 混合策略就是「对自己的行动开一张彩票」,那一章每算一次收益都在用本章的期望效用。⚠️ 它默认 $u_i$ 是 vNM 效用,换成随便一个序数效用,那些算式全部失效 |
| ../强化学习基础/03-价值函数与贝尔曼方程.html | 价值函数 $V^\pi(s) = \mathbb{E}[\sum \gamma^t r_t]$ 就是一个期望效用。那边直接对奖励求期望、从不解释凭什么 —— 凭的就是 vNM 定理。反过来也提醒你:奖励必须当 vNM 效用来设计,随手套个单调变换(比如取 log)会改变最优策略 |
✅ 检查点
- 为什么序数效用不足以比较彩票?用上一章那组数字说明。
- 复合彩票怎么摊平?这一步默认了什么假设?
- 「$[1:a] \succ [1:b] \succ [0.99:a, 0.01:b] \succ \cdots$」在说什么?为什么它不可能是期望效用?
- 连续性和独立性各自在说什么?分别用「撞见前任」和「反面罚 50 元」那两个场景复述。
- vNM 定理怎么陈述?它「意味着什么」的三条分别是?
- vNM 效用允许哪些变换?哪些说法有意义、哪些仍然没有?(用摄氏温度那个类比答)
- 已知 $[1:a] \succ [1:b]$ 且 $[\tfrac12:b, \tfrac12:c] \sim [\tfrac23:a, \tfrac13:c]$,排序是什么?取 $v(b)=0, v(c)=1$ 时 $v(a)$ 是多少?
- $u(x)=\sqrt{x}$、彩票 $[\tfrac12:0, \tfrac12:100]$ 时,期望效用、确定等价、风险溢价各是多少?
👀 答案
- 算期望要求效用能做加权平均。可 $u=(3,2,1)$ 和 $v=(100,2,1)$ 表示同一个偏好,加权平均算出来完全不同,谁大谁小都可能翻转。
- $L(a) = \alpha L_1(a) + (1-\alpha)L_2(a)$。默认你只在乎最终的概率分布,不在乎抽奖过程和层数。
- 「宁可确定拿差的 $b$,也不要 99% 拿到好的 $a$」,即厌恶随机化本身。若存在 $u$ 则 $u(a)>u(b)$,而 $0.99u(a)+0.01u(b)$ 必然严格夹在中间、必须排在 $[1:b]$ 前面 —— 矛盾。
- 连续性:$L_1 \succ L_2 \succ L_3$ 时存在 $\epsilon>0$ 使 $[1-\epsilon:L_1,\epsilon:L_3] \succ L_2 \succ [1-\epsilon:L_3,\epsilon:L_1]$ ——「撞见前任的概率够小你还是出门玩」,排除词典式偏好。独立性:$L_1 \succsim L_2 \iff [p:L_1,(1-p):L_3] \succsim [p:L_2,(1-p):L_3]$ ——「反面一律罚 50 元」两边共有,不该改变你的选择。
- 理性 + 连续 + 独立 $\iff$ 存在 $u$ 使 $L_1 \succsim L_2 \iff \sum_x L_1(x)u(x) \ge \sum_x L_2(x)u(x)$。① 算期望效用是推出来的不是假设的;② $u$ 是从选择反推的紧凑表示;③ 唯一到正仿射变换 $\alpha u+\beta$($\alpha>0$)。
- 只允许 $\alpha u+\beta$($\alpha>0$)。有意义:效用差的比值、比较彩票。没意义:单独一个差值、「$u(a)$ 是 $u(b)$ 的 2 倍」。摄氏温度同理。
- $c \succ a \succ b$。由 $\tfrac12 u(b)+\tfrac12 u(c) = \tfrac23 u(a)+\tfrac13 u(c)$ 整理得 $u(c)=4u(a)-3u(b)$,故 $u(c)-u(a)=3(u(a)-u(b))>0$。取 $v(b)=0,v(c)=1$ 得 $v(a)=\tfrac14$(验算两边都是 $\tfrac12$ ✓)。
- $EU=\tfrac12\sqrt0+\tfrac12\sqrt{100}=\mathbf{5}$;确定等价由 $\sqrt{x}=5$ 得 $\mathbf{25}$ 元;期望金额 50 元,风险溢价 $\mathbf{25}$ 元。
🛑 可以停在这里
⚡ 走神救援
上一章说效用是序数的,这一章补那个洞:要比随机结果,效用就得能做加权平均。彩票是 $A$ 上的概率分布 $[0.05:\text{过},\ 0.95:\text{挂}]$,复合彩票按 $L(a)=\alpha L_1(a)+(1-\alpha)L_2(a)$ 摊平(默认你只在乎最终分布、不在乎抽奖层数)。⭐ 关键认识:「遇到随机就算期望」不是天经地义的。 讲义那条链 $[1:a] \succ [1:b] \succ [0.99:a,0.01:b] \succ \cdots$ 就是反例 —— 宁可确定拿差的 $b$ 也不要 99% 的 $a$;它不可能是期望效用,因为 $0.99u(a)+0.01u(b)$ 是加权平均、必然夹在中间。要让「算期望」合法得再加两条公理:连续性(出去玩 ≻ 学习 ≻ 撞见前任:撞见的概率够小你还是出门玩 —— 排除词典式偏好)和独立性(两边掺同样概率的同一个东西该约掉:「反面一律罚 50 元」不影响你的选择。⚠️ 阿莱悖论说真人系统性违反它)。⭐⭐ vNM 定理:理性 + 连续 + 独立 $\iff$ 存在 $u$ 使 $L_1 \succsim L_2 \iff \sum L_1(x)u(x) \ge \sum L_2(x)u(x)$。三条含义:① 最大化期望效用是推出来的不是假设的;② $u$ 是从选择反推的紧凑表示,不是快乐的度量;③ ⭐ 唯一到正仿射变换 $\alpha u+\beta$($\alpha>0$) —— 效用差的比值终于有意义了,但「效用是 2 倍」仍然没意义,和摄氏温度一模一样。手算题型:由 $[\tfrac12:b,\tfrac12:c] \sim [\tfrac23:a,\tfrac13:c]$ 与 $a \succ b$ 整理得 $u(c)=4u(a)-3u(b)$,于是 $u(c)-u(a)=3(u(a)-u(b))>0$,推出 $c \succ a \succ b$;取 $v(b)=0,v(c)=1$ 解出 $v(a)=\tfrac14$(套路:最好的定 1、最差的定 0,中间用一条无差异等式解)。风险态度全在 $u$ 的形状里:$u=\sqrt{x}$、彩票 $[\tfrac12:0,\tfrac12:100]$ 时期望效用 5、确定等价 25 元、风险溢价 25 元;凹 = 厌恶,直线 = 中性,凸 = 偏好。
下一节 👉 09-正常形博弈.md