📑 本页目录(点开跳转)
07 · 偏好与效用:理性到底是什么意思
⏱ 36 分钟 | ⭐ 全板块真正的起点
🎯 一句话
「理性」在博弈论里不是形容词,是两条可以逐条打勾的性质:完全性 + 传递性。 偏好一旦满足这两条,就能被写成一个效用函数 $u$,此后所有「谁更好」的问题都变成「谁的数更大」。
🚪 一、从这一章进来完全没问题
前面 5 章讲的是逻辑:命题逻辑、一阶逻辑、怎么把知识写成公式、怎么机械地推出结论。 那是知识表示与推理的一条腿 —— 关心的是一个 agent 怎么「知道」事情。
从这一章开始是另一条腿:一群 agent 各有各的想法、利益还不一致,该怎么做决定。
⭐ 两条腿之间几乎不共享前置知识。 你如果是冲着博弈论 / 投票 / 分配来的,可以直接从这里开始读, 前面那 5 章的一个符号都不会在这里出现。真正需要的前置只有两样: ① 看得懂 $\ge$、$\forall$ 这类符号(看不懂连蒙带猜也行); ② 一点点概率 —— 下一章会用,会算加权平均就够了。
这一章要做的事只有一件:把「这个 agent 想要什么」变成一个数学对象。 没有这一步,后面所有的「他会怎么选」「这个结果好不好」都无从谈起。
| 你在哪 | 这一章 | 下一章 | 再往后 |
|---|---|---|---|
| 想要什么 | 偏好 ≿ → 效用 $u$ | 结果随机时怎么办(彩票、期望效用) | 多个人同时选(正常形博弈) |
🧩 二、偏好关系:只有三个符号
设 $A$ 是所有备选项的集合(苹果、香蕉、樱桃;或者坦白、沉默)。 一个 agent 的偏好写成 $A$ 上的一个二元关系 $\succsim$:
$$x \succsim y \quad\text{读作:} x \text{ 至少和 } y \text{ 一样好}$$
$\succsim$ 可以拆成两半:
| 符号 | 定义 | 人话 |
|---|---|---|
| $x \succ y$ | $x \succsim y$ 且不满足 $y \succsim x$ | 严格更喜欢 $x$ |
| $x \sim y$ | $x \succsim y$ 且 $y \succsim x$ | 两个都行,无所谓 |
例:我喜欢苹果多过香蕉,香蕉和樱桃对我一样,写成
$$\text{苹果} \succ \text{香蕉} \sim \text{樱桃}$$
⚠️ 偏好关系不带「强度」信息。 $x \succ y$ 只说了「$x$ 更好」,没说好多少。 「我爱苹果爱到愿意为它走十公里,而香蕉只比樱桃好一点点」—— 这句话里的强度, $\succsim$ 一个字都装不下。记住这条,第七节会因为它翻车。
⚖️ 三、理性 = 完全性 + 传递性
一个偏好关系叫理性的(rational),当且仅当它同时满足:
| 性质 | 形式 | 在说什么 |
|---|---|---|
| 完全性 completeness | $\forall x,y \in A:\ x \succsim y \ \lor\ y \succsim x$ | 任何两个选项都能比出来,不许说「没法比」 |
| 传递性 transitivity | $\forall x,y,z \in A:\ x \succsim y \land y \succsim z \Rightarrow x \succsim z$ | 比较不能自相矛盾 |
理性的 agent 就定义为:按某个理性偏好关系,在所有可行选项里挑最好的那个。
⚠️ 最常混的一对:「无所谓」不是「没法比」。 $x \sim y$ 是两个方向都成立($x \succsim y$ 且 $y \succsim x$)—— 这完全符合完全性,无所谓是一种合法的态度。 违反完全性的是两个方向都不成立:你既不觉得 $x$ 至少一样好,也不觉得 $y$ 至少一样好。 那种情况下,如果桌上只剩这两个选项,「挑最好的」这条指令根本没有定义。
💸 四、传递性为什么不能少:钱泵
传递性听起来像句废话,但去掉它,你就是一台提款机。这个论证叫 money pump(钱泵)。
假设三个杯子 A、B、C,你的偏好成了一个环:
$$A \succ B,\qquad B \succ C,\qquad C \succ A$$
注意这里每一条单独看都不奇怪,坏就坏在合起来成了环(传递性要求 $A \succ B \succ C \Rightarrow A \succ C$,可你偏偏说 $C \succ A$)。
现在我来当那个抽你钱的人。你手里拿着 C。
| 步骤 | 我做什么 | 你为什么答应 | 你手里 | 你的钱 |
|---|---|---|---|---|
| ① | 拿 B 跟你换 C,收你 1 元 | 因为 $B \succ C$,多花 1 元也值 | B | −1 |
| ② | 拿 A 跟你换 B,收你 1 元 | 因为 $A \succ B$ | A | −2 |
| ③ | 拿 C 跟你换 A,收你 1 元 | 因为 $C \succ A$ | C | −3 |
⭐ 这就是「不理性」的操作性定义:不是「看起来怪」,而是 存在一套能系统性抽干你的方案,并且你在每一步都是自愿的、都觉得自己赚了。
🔑 为什么这个论证有说服力: 它没有诉诸「你应该怎样」这种价值判断,只是指出 —— 偏好成环的 agent 会被环境(或者别的 agent)稳定地剥削。在一个有对手的世界里, 这样的 agent 活不下去。这就是我们把传递性写进假设的全部理由。
☕ 五、可是传递性有时真的不成立
讲义自己给了一个反例,很值得记住:
往咖啡里多加一粒糖,我完全无所谓($c_k \sim c_{k+1}$,对每个 $k$ 都成立)。 但是不加糖的咖啡 $\succ$ 加了满满一勺糖的咖啡。
一勺糖是几千粒。如果 $\sim$ 是传递的,那么 $c_0 \sim c_1 \sim \cdots \sim c_{3000}$ 应该推出 $c_0 \sim c_{3000}$, 可我明明说了 $c_0 \succ c_{3000}$。传递性在这里真的破了。
破的原因不是人蠢,是感知有阈值:单步差异小于可分辨的最小量,累积起来却是大差异。 类似的还有颜色、音量、价格。
⭐ 所以理性是一个建模假设,不是一个心理学发现。 后面所有的定理都建立在它上面,它们的结论只在这个假设成立的范围内可靠。 遇到「模型预测和真人行为对不上」的时候,第一个该怀疑的往往就是这里。
📐 六、从偏好到效用函数
偏好关系用起来很笨:$n$ 个选项要记 $n^2$ 对比较。有没有更紧凑的表示?有。
效用函数 $u : A \to \mathbb{R}$ 给每个选项配一个实数。我们说 $u$ 表示(represent) 偏好 $\succsim$,如果
$$x \succsim y \iff u(x) \ge u(y) \quad \text{对所有 } x,y \in A$$
例:$u(\text{苹果}) = 2$,$u(\text{香蕉}) = 1$,$u(\text{樱桃}) = 1$,正好表示了第二节那个偏好。
📌 命题:当选项个数可数时,一个偏好关系能被效用函数表示 $\iff$ 它是理性的。
这个「当且仅当」的两个方向意思完全不同,值得分开看:
⟸ 方向(有 $u$ 就一定理性)—— 一句话就证完了,所以给你看:
- 完全性:任意两个实数 $u(x)$、$u(y)$ 总有 $u(x) \ge u(y)$ 或 $u(y) \ge u(x)$,所以 $x \succsim y$ 或 $y \succsim x$ 必有一条成立。
- 传递性:$u(x) \ge u(y)$ 且 $u(y) \ge u(z)$ $\Rightarrow$ $u(x) \ge u(z)$,因为实数的 $\ge$ 本来就是传递的。
⭐ 看出来了吗:理性的两条要求,其实就是实数序的两条性质。 完全性 = 实数总能比大小,传递性 = $\ge$ 传递。 所谓「理性」,本质上就是「能被摆到数轴上」。
⟹ 方向(理性就一定能写成 $u$) 需要构造,可数时可以逐个赋值挤进实数里; 选项不可数时会出问题(词典序偏好就是经典反例)。这个方向不给证明,知道结论就够。
⚠️ 七、效用是序数的(这一章最贵的一个误解)
看下面三个效用函数:
| 选项 | $u$ | $v$ | $w$ |
|---|---|---|---|
| a | 3 | 100 | 1 |
| b | 2 | 2 | 0 |
| c | 1 | 1 | −5 |
它们表示的是同一个偏好 $a \succ b \succ c$。因为表示的定义只管 $\ge$ 的方向,不管具体数值。 更一般地:任何严格递增变换 $f$,$f(u(\cdot))$ 都表示同一个偏好。
于是下面这三句话全是错的:
| ❌ 错误说法 | 为什么错 |
|---|---|
| 「a 的效用是 c 的 3 倍,所以 a 好 3 倍」 | 在 $v$ 下变成 100 倍,在 $w$ 下比值根本没意义(有负数) |
| 「a 比 b 好的程度 = b 比 c 好的程度」(都差 1) | 在 $v$ 下是差 98 和差 1 |
| 「把两个人的效用加起来算总福利」 | 两人的 $u$ 各自可以随便做递增变换,加出来的数没有意义 |
⭐ 序数效用能承载的信息量,正好就是「排序」,一点不多。 数值只是排序的一个载体,就像给赛跑选手编号 1、2、3 —— 你不会说「第 1 名比第 3 名快 3 倍」。
💀 实践里长什么样:把 1–5 星评分当成基数效用直接求平均。 「4 星 vs 3 星」和「2 星 vs 1 星」未必是同样大小的差距,可平均值把它们当成一样大了。 这不是说不能用,是说你在用的时候多假设了一条「评分是等距的」,而这条假设不在偏好数据里 —— 出问题的时候(比如某个群体系统性地不打 1 星),你得知道是这一步埋的雷。
⚡ 但别绝望,下一章会把这条限制打破一半。 一旦允许比较彩票(结果带随机性),von Neumann–Morgenstern 定理会把效用的自由度 从「任意严格递增变换」收紧到「正仿射变换 $\alpha u + \beta$($\alpha > 0$)」。 那时候效用差值的比值就有意义了 —— 这正是「期望效用」能算的原因。
🔗 这一章连到哪里
| 去哪 | 为什么 |
|---|---|
| 08-不确定性与期望效用.html | 序数效用在结果随机时不够用了。那一章会把 $u$ 从「排序的载体」升级成「能求期望的量」,并说清楚凭什么可以这么做 |
| 09-正常形博弈.html | 那一章把 $u$ 变成 $u_i$:每个玩家一个效用函数,而且参数是所有人的行动。理解那个下标 $i$ 的前提是先理解这里的 $u$ |
| ../强化学习基础/02-MDP.html | RL 里的 reward 是直接给你一个数,从来不问它从哪来。这一章就是那个数的来历:它必须是某个偏好的效用表示,否则「最大化期望回报」这句话没有意义 |
| ../机器学习与深度学习基础/05-评估与过拟合.html | 反过来的一个提醒:损失函数不是效用函数。损失是你定的优化目标,效用是agent 真实的排序,两者对不上就是「优化了指标、伤了体验」的根源 |
✅ 检查点
- 偏好关系的三个符号 $\succsim$、$\succ$、$\sim$ 分别怎么定义?后两个都是从第一个推出来的吗?
- 「理性偏好」的两条要求是什么?各自的形式写法是?
- 「无所谓」和「没法比」差在哪?哪一个违反完全性?
- 钱泵是怎么运作的?完整走一遍三步,说出每一步你为什么答应、最后损失多少。
- 钱泵这个论证的说服力来自哪里(为什么它比「成环看起来很怪」更有力)?
- 咖啡加糖那个反例,破的是哪一条性质?破的原因是什么?
- 「一个偏好能被效用函数表示 ⟺ 它是理性的」,$\Leftarrow$ 那半边为什么一句话就能证完?
- 下面三句话为什么都错:「a 的效用是 c 的 3 倍」「a 比 b 好的程度等于 b 比 c 好的程度」「把两人效用加起来算总福利」?
- 下一章会把效用的自由度从什么收紧到什么?收紧之后多出来的能力是什么?
👀 答案
- $x \succsim y$ = 「$x$ 至少和 $y$ 一样好」,是原始概念。$x \succ y$ 定义为 $x \succsim y$ 且不 $y \succsim x$;$x \sim y$ 定义为 $x \succsim y$ 且 $y \succsim x$。所以后两个都是从 $\succsim$ 推出来的。
- 完全性 $\forall x,y:\ x \succsim y \lor y \succsim x$;传递性 $\forall x,y,z:\ x \succsim y \land y \succsim z \Rightarrow x \succsim z$。
- 「无所谓」$x \sim y$ 是两个方向都成立,完全符合完全性;「没法比」是两个方向都不成立,违反完全性。后者会让「挑最好的」这条指令没有定义。
- 偏好成环 $A \succ B \succ C \succ A$,你手里拿 C:① 我用 B 换你的 C 收 1 元(因为 $B \succ C$);② 用 A 换你的 B 收 1 元(因为 $A \succ B$);③ 用 C 换你的 A 收 1 元(因为 $C \succ A$)。回到起点,杯子没变,你少了 3 元,而且可以无限循环。
- 因为它不诉诸价值判断,只指出成环的 agent 会被环境或别的 agent 稳定剥削,而且每一步都是自愿的。在有对手的世界里这样的 agent 活不下去 —— 这是把传递性写进假设的全部理由。
- 破的是传递性($\sim$ 的传递链)。每加一粒糖都无所谓,但 $c_0 \succ c_{3000}$。原因是感知有阈值:单步差异小于可分辨的最小量,累积起来却是大差异。
- 因为理性的两条要求就是实数序的两条性质:完全性 = 任意两个实数总能比大小;传递性 = 实数的 $\ge$ 本来就传递。所以有了 $u$,两条自动成立。
- 因为 $u=(3,2,1)$、$v=(100,2,1)$、$w=(1,0,-5)$ 表示的是同一个偏好,任何严格递增变换都保序。倍数在 $v$ 下变成 100 倍、在 $w$ 下有负数没法算;差值在 $u$ 下都是 1、在 $v$ 下是 98 和 1;两人的 $u$ 各自可以随便变换,加起来的数没有意义。⭐ 序数效用承载的信息正好就是排序。
- 从「任意严格递增变换」收紧到「正仿射变换 $\alpha u + \beta$,$\alpha > 0$」。收紧之后效用差值的比值有了意义,这正是可以算期望效用的原因。
🛑 可以停在这里
⚡ 走神救援
这一章把「这个 agent 想要什么」变成了数学对象。偏好关系 $\succsim$ 读作「至少一样好」,拆成严格部分 $\succ$($x \succsim y$ 且非 $y \succsim x$)和无差异部分 $\sim$(两个方向都成立)。⭐ 理性 = 完全性 + 传递性:完全性说任何两项都能比($\forall x,y: x \succsim y \lor y \succsim x$),传递性说比较不自相矛盾。⚠️ 别把「无所谓」(两方向都成立,合法)和「没法比」(两方向都不成立,违反完全性)搞混。⭐⭐ 传递性不能少的理由是钱泵:偏好成环 $A \succ B \succ C \succ A$、你手里拿 C 时,我可以①用 B 换 C 收 1 元 ②用 A 换 B 收 1 元 ③用 C 换 A 收 1 元 —— 一圈回到起点、杯子一模一样、你少了 3 元,还能无限循环。它的说服力在于不诉诸价值判断,只指出成环的 agent 会被稳定剥削且每步自愿。但传递性有真实反例:每次多加一粒糖都无所谓,可无糖咖啡 $\succ$ 加满一勺糖的咖啡(3000 粒),破在感知阈值上 —— 所以理性是建模假设不是心理学发现。效用函数 $u$ 表示 $\succsim$ 的定义是 $x \succsim y \iff u(x) \ge u(y)$;命题说可数选项下「能被 $u$ 表示」⟺「理性」,其中 ⟸ 方向一句话就完:理性那两条就是实数序的两条性质(能比大小 + $\ge$ 传递)。⚠️ 最贵的误解:效用是序数的。$u=(3,2,1)$、$v=(100,2,1)$、$w=(1,0,-5)$ 表示同一个偏好,所以「效用 3 倍」「两段差距一样大」「两人效用相加算总福利」全错;实践里的样子是把 1–5 星评分当等距量求平均。下一章 vNM 定理会把自由度从「任意递增变换」收紧到「正仿射变换 $\alpha u + \beta$」,届时效用差值的比值才有意义。
下一节 👉 08-不确定性与期望效用.md