🏠 总目录📚 本教程 07 · 偏好与效用
📑 本页目录(点开跳转)

07 · 偏好与效用:理性到底是什么意思

36 分钟 | ⭐ 全板块真正的起点


🎯 一句话

「理性」在博弈论里不是形容词,是两条可以逐条打勾的性质:完全性 + 传递性。 偏好一旦满足这两条,就能被写成一个效用函数 $u$,此后所有「谁更好」的问题都变成「谁的数更大」。


🚪 一、从这一章进来完全没问题

前面 5 章讲的是逻辑:命题逻辑、一阶逻辑、怎么把知识写成公式、怎么机械地推出结论。 那是知识表示与推理的一条腿 —— 关心的是一个 agent 怎么「知道」事情

从这一章开始是另一条腿:一群 agent 各有各的想法、利益还不一致,该怎么做决定

两条腿之间几乎不共享前置知识。 你如果是冲着博弈论 / 投票 / 分配来的,可以直接从这里开始读, 前面那 5 章的一个符号都不会在这里出现。真正需要的前置只有两样: ① 看得懂 $\ge$、$\forall$ 这类符号(看不懂连蒙带猜也行); ② 一点点概率 —— 下一章会用,会算加权平均就够了

这一章要做的事只有一件:把「这个 agent 想要什么」变成一个数学对象。 没有这一步,后面所有的「他会怎么选」「这个结果好不好」都无从谈起。

你在哪 这一章 下一章 再往后
想要什么 偏好 ≿ → 效用 $u$ 结果随机时怎么办(彩票、期望效用) 多个人同时选(正常形博弈)

🧩 二、偏好关系:只有三个符号

设 $A$ 是所有备选项的集合(苹果、香蕉、樱桃;或者坦白、沉默)。 一个 agent 的偏好写成 $A$ 上的一个二元关系 $\succsim$:

$$x \succsim y \quad\text{读作:} x \text{ 至少和 } y \text{ 一样好}$$

$\succsim$ 可以拆成两半:

符号 定义 人话
$x \succ y$ $x \succsim y$ 且满足 $y \succsim x$ 严格更喜欢 $x$
$x \sim y$ $x \succsim y$ $y \succsim x$ 两个都行,无所谓

例:我喜欢苹果多过香蕉,香蕉和樱桃对我一样,写成

$$\text{苹果} \succ \text{香蕉} \sim \text{樱桃}$$

⚠️ 偏好关系不带「强度」信息。 $x \succ y$ 只说了「$x$ 更好」,没说好多少。 「我爱苹果爱到愿意为它走十公里,而香蕉只比樱桃好一点点」—— 这句话里的强度, $\succsim$ 一个字都装不下。记住这条,第七节会因为它翻车。


⚖️ 三、理性 = 完全性 + 传递性

一个偏好关系叫理性的(rational),当且仅当它同时满足:

性质 形式 在说什么
完全性 completeness $\forall x,y \in A:\ x \succsim y \ \lor\ y \succsim x$ 任何两个选项都能比出来,不许说「没法比」
传递性 transitivity $\forall x,y,z \in A:\ x \succsim y \land y \succsim z \Rightarrow x \succsim z$ 比较不能自相矛盾

理性的 agent 就定义为:按某个理性偏好关系,在所有可行选项里挑最好的那个

⚠️ 最常混的一对:「无所谓」不是「没法比」。 $x \sim y$ 是两个方向都成立($x \succsim y$ 且 $y \succsim x$)—— 这完全符合完全性,无所谓是一种合法的态度。 违反完全性的是两个方向都不成立:你既不觉得 $x$ 至少一样好,也不觉得 $y$ 至少一样好。 那种情况下,如果桌上只剩这两个选项,「挑最好的」这条指令根本没有定义


💸 四、传递性为什么不能少:钱泵

传递性听起来像句废话,但去掉它,你就是一台提款机。这个论证叫 money pump(钱泵)

假设三个杯子 A、B、C,你的偏好成了一个环:

$$A \succ B,\qquad B \succ C,\qquad C \succ A$$

注意这里每一条单独看都不奇怪,坏就坏在合起来成了环(传递性要求 $A \succ B \succ C \Rightarrow A \succ C$,可你偏偏说 $C \succ A$)。

现在我来当那个抽你钱的人。你手里拿着 C。

步骤 我做什么 你为什么答应 你手里 你的钱
拿 B 跟你换 C,收你 1 元 因为 $B \succ C$,多花 1 元也值 B −1
拿 A 跟你换 B,收你 1 元 因为 $A \succ B$ A −2
拿 C 跟你换 A,收你 1 元 因为 $C \succ A$ C −3
钱泵:偏好成环,你就是一台提款机CBA换 B,付 1 元换 A,付 1 元换 C,付 1 元一圈回到起点,杯子一模一样,钱少了 3 元,而且可以无限循环
偏好成环时的钱泵:每一步你都心甘情愿,一圈之后净损失 3 元。

这就是「不理性」的操作性定义:不是「看起来怪」,而是 存在一套能系统性抽干你的方案,并且你在每一步都是自愿的、都觉得自己赚了。

🔑 为什么这个论证有说服力: 它没有诉诸「你应该怎样」这种价值判断,只是指出 —— 偏好成环的 agent 会被环境(或者别的 agent)稳定地剥削。在一个有对手的世界里, 这样的 agent 活不下去。这就是我们把传递性写进假设的全部理由。


☕ 五、可是传递性有时真的不成立

讲义自己给了一个反例,很值得记住:

往咖啡里多加一粒糖,我完全无所谓($c_k \sim c_{k+1}$,对每个 $k$ 都成立)。 但是不加糖的咖啡 $\succ$ 加了满满一勺糖的咖啡

一勺糖是几千粒。如果 $\sim$ 是传递的,那么 $c_0 \sim c_1 \sim \cdots \sim c_{3000}$ 应该推出 $c_0 \sim c_{3000}$, 可我明明说了 $c_0 \succ c_{3000}$。传递性在这里真的破了。

破的原因不是人蠢,是感知有阈值:单步差异小于可分辨的最小量,累积起来却是大差异。 类似的还有颜色、音量、价格。

所以理性是一个建模假设,不是一个心理学发现。 后面所有的定理都建立在它上面,它们的结论只在这个假设成立的范围内可靠。 遇到「模型预测和真人行为对不上」的时候,第一个该怀疑的往往就是这里。


📐 六、从偏好到效用函数

偏好关系用起来很笨:$n$ 个选项要记 $n^2$ 对比较。有没有更紧凑的表示?有。

效用函数 $u : A \to \mathbb{R}$ 给每个选项配一个实数。我们说 $u$ 表示(represent) 偏好 $\succsim$,如果

$$x \succsim y \iff u(x) \ge u(y) \quad \text{对所有 } x,y \in A$$

例:$u(\text{苹果}) = 2$,$u(\text{香蕉}) = 1$,$u(\text{樱桃}) = 1$,正好表示了第二节那个偏好。

📌 命题:当选项个数可数时,一个偏好关系能被效用函数表示 $\iff$ 它是理性的

这个「当且仅当」的两个方向意思完全不同,值得分开看:

⟸ 方向(有 $u$ 就一定理性)—— 一句话就证完了,所以给你看:

⭐ 看出来了吗:理性的两条要求,其实就是实数序的两条性质。 完全性 = 实数总能比大小,传递性 = $\ge$ 传递。 所谓「理性」,本质上就是「能被摆到数轴上」。

⟹ 方向(理性就一定能写成 $u$) 需要构造,可数时可以逐个赋值挤进实数里; 选项不可数时会出问题(词典序偏好就是经典反例)。这个方向不给证明,知道结论就够


⚠️ 七、效用是序数的(这一章最贵的一个误解)

看下面三个效用函数:

选项 $u$ $v$ $w$
a 3 100 1
b 2 2 0
c 1 1 −5

它们表示的是同一个偏好 $a \succ b \succ c$。因为表示的定义只管 $\ge$ 的方向,不管具体数值。 更一般地:任何严格递增变换 $f$,$f(u(\cdot))$ 都表示同一个偏好。

于是下面这三句话全是错的

❌ 错误说法 为什么错
「a 的效用是 c 的 3 倍,所以 a 好 3 倍」 在 $v$ 下变成 100 倍,在 $w$ 下比值根本没意义(有负数)
「a 比 b 好的程度 = b 比 c 好的程度」(都差 1) 在 $v$ 下是差 98 和差 1
「把两个人的效用加起来算总福利」 两人的 $u$ 各自可以随便做递增变换,加出来的数没有意义

序数效用能承载的信息量,正好就是「排序」,一点不多。 数值只是排序的一个载体,就像给赛跑选手编号 1、2、3 —— 你不会说「第 1 名比第 3 名快 3 倍」。

💀 实践里长什么样:把 1–5 星评分当成基数效用直接求平均。 「4 星 vs 3 星」和「2 星 vs 1 星」未必是同样大小的差距,可平均值把它们当成一样大了。 这不是说不能用,是说你在用的时候多假设了一条「评分是等距的」,而这条假设不在偏好数据里 —— 出问题的时候(比如某个群体系统性地不打 1 星),你得知道是这一步埋的雷。

但别绝望,下一章会把这条限制打破一半。 一旦允许比较彩票(结果带随机性),von Neumann–Morgenstern 定理会把效用的自由度 从「任意严格递增变换」收紧到「正仿射变换 $\alpha u + \beta$($\alpha > 0$)」。 那时候效用差值的比值就有意义了 —— 这正是「期望效用」能算的原因。


🔗 这一章连到哪里

去哪 为什么
08-不确定性与期望效用.html 序数效用在结果随机时不够用了。那一章会把 $u$ 从「排序的载体」升级成「能求期望的量」,并说清楚凭什么可以这么做
09-正常形博弈.html 那一章把 $u$ 变成 $u_i$:每个玩家一个效用函数,而且参数是所有人的行动。理解那个下标 $i$ 的前提是先理解这里的 $u$
../强化学习基础/02-MDP.html RL 里的 reward 是直接给你一个数,从来不问它从哪来。这一章就是那个数的来历:它必须是某个偏好的效用表示,否则「最大化期望回报」这句话没有意义
../机器学习与深度学习基础/05-评估与过拟合.html 反过来的一个提醒:损失函数不是效用函数。损失是你定的优化目标,效用是agent 真实的排序,两者对不上就是「优化了指标、伤了体验」的根源

✅ 检查点

  1. 偏好关系的三个符号 $\succsim$、$\succ$、$\sim$ 分别怎么定义?后两个都是从第一个推出来的吗?
  2. 「理性偏好」的两条要求是什么?各自的形式写法是?
  3. 「无所谓」和「没法比」差在哪?哪一个违反完全性?
  4. 钱泵是怎么运作的?完整走一遍三步,说出每一步你为什么答应、最后损失多少。
  5. 钱泵这个论证的说服力来自哪里(为什么它比「成环看起来很怪」更有力)?
  6. 咖啡加糖那个反例,破的是哪一条性质?破的原因是什么?
  7. 「一个偏好能被效用函数表示 ⟺ 它是理性的」,$\Leftarrow$ 那半边为什么一句话就能证完?
  8. 下面三句话为什么都错:「a 的效用是 c 的 3 倍」「a 比 b 好的程度等于 b 比 c 好的程度」「把两人效用加起来算总福利」?
  9. 下一章会把效用的自由度从什么收紧到什么?收紧之后多出来的能力是什么?
👀 答案
  1. $x \succsim y$ = 「$x$ 至少和 $y$ 一样好」,是原始概念。$x \succ y$ 定义为 $x \succsim y$ 且 $y \succsim x$;$x \sim y$ 定义为 $x \succsim y$ $y \succsim x$。所以后两个都是从 $\succsim$ 推出来的
  2. 完全性 $\forall x,y:\ x \succsim y \lor y \succsim x$;传递性 $\forall x,y,z:\ x \succsim y \land y \succsim z \Rightarrow x \succsim z$。
  3. 「无所谓」$x \sim y$ 是两个方向都成立,完全符合完全性;「没法比」是两个方向都不成立,违反完全性。后者会让「挑最好的」这条指令没有定义。
  4. 偏好成环 $A \succ B \succ C \succ A$,你手里拿 C:① 我用 B 换你的 C 收 1 元(因为 $B \succ C$);② 用 A 换你的 B 收 1 元(因为 $A \succ B$);③ 用 C 换你的 A 收 1 元(因为 $C \succ A$)。回到起点,杯子没变,你少了 3 元,而且可以无限循环。
  5. 因为它不诉诸价值判断,只指出成环的 agent 会被环境或别的 agent 稳定剥削,而且每一步都是自愿的。在有对手的世界里这样的 agent 活不下去 —— 这是把传递性写进假设的全部理由。
  6. 破的是传递性($\sim$ 的传递链)。每加一粒糖都无所谓,但 $c_0 \succ c_{3000}$。原因是感知有阈值:单步差异小于可分辨的最小量,累积起来却是大差异。
  7. 因为理性的两条要求就是实数序的两条性质:完全性 = 任意两个实数总能比大小;传递性 = 实数的 $\ge$ 本来就传递。所以有了 $u$,两条自动成立。
  8. 因为 $u=(3,2,1)$、$v=(100,2,1)$、$w=(1,0,-5)$ 表示的是同一个偏好,任何严格递增变换都保序。倍数在 $v$ 下变成 100 倍、在 $w$ 下有负数没法算;差值在 $u$ 下都是 1、在 $v$ 下是 98 和 1;两人的 $u$ 各自可以随便变换,加起来的数没有意义。⭐ 序数效用承载的信息正好就是排序
  9. 从「任意严格递增变换」收紧到「正仿射变换 $\alpha u + \beta$,$\alpha > 0$」。收紧之后效用差值的比值有了意义,这正是可以算期望效用的原因。

🛑 可以停在这里

走神救援

这一章把「这个 agent 想要什么」变成了数学对象。偏好关系 $\succsim$ 读作「至少一样好」,拆成严格部分 $\succ$($x \succsim y$ 且非 $y \succsim x$)和无差异部分 $\sim$(两个方向都成立)。⭐ 理性 = 完全性 + 传递性:完全性说任何两项都能比($\forall x,y: x \succsim y \lor y \succsim x$),传递性说比较不自相矛盾。⚠️ 别把「无所谓」(两方向都成立,合法)和「没法比」(两方向都不成立,违反完全性)搞混。⭐⭐ 传递性不能少的理由是钱泵:偏好成环 $A \succ B \succ C \succ A$、你手里拿 C 时,我可以①用 B 换 C 收 1 元 ②用 A 换 B 收 1 元 ③用 C 换 A 收 1 元 —— 一圈回到起点、杯子一模一样、你少了 3 元,还能无限循环。它的说服力在于不诉诸价值判断,只指出成环的 agent 会被稳定剥削且每步自愿。但传递性有真实反例:每次多加一粒糖都无所谓,可无糖咖啡 $\succ$ 加满一勺糖的咖啡(3000 粒),破在感知阈值上 —— 所以理性是建模假设不是心理学发现效用函数 $u$ 表示 $\succsim$ 的定义是 $x \succsim y \iff u(x) \ge u(y)$;命题说可数选项下「能被 $u$ 表示」⟺「理性」,其中 ⟸ 方向一句话就完:理性那两条就是实数序的两条性质(能比大小 + $\ge$ 传递)。⚠️ 最贵的误解:效用是序数的。$u=(3,2,1)$、$v=(100,2,1)$、$w=(1,0,-5)$ 表示同一个偏好,所以「效用 3 倍」「两段差距一样大」「两人效用相加算总福利」全错;实践里的样子是把 1–5 星评分当等距量求平均。下一章 vNM 定理会把自由度从「任意递增变换」收紧到「正仿射变换 $\alpha u + \beta$」,届时效用差值的比值才有意义。

下一节 👉 08-不确定性与期望效用.md

打卡记录保存在你的浏览器里,首页能看到总进度