🏠 总目录📚 本教程 16 · 机制设计在解什么
📑 本页目录(点开跳转)

16 · 机制设计在解什么

30 分钟 | ⭐⭐ 全板块的转折点:从「会发生什么」到「让什么发生」


🎯 一句话

前面 7 章都在问「给定规则,理性的人会怎么做」。从这一章开始反过来问:「我想要某个结果,规则该怎么写」。

⭐ 这不是换个话题,是换了个身份 —— 你从旁观者变成了规则的制定者


🍰 一、先玩一个:怎么分蛋糕才没人抱怨

两个小孩分一块蛋糕,都想要多的。你是家长,怎么分才能让两个人都无话可说?

一人切、一人选(cut and choose):

🔨 规则:小孩 A 把蛋糕切成两块,小孩 B 先挑一块,剩下那块给 A。

走一遍 A 的心思。他知道 B 会挑大的那块,所以:

A 怎么切 B 会拿走 A 剩下
60% / 40% 60% 40% 😖
55% / 45% 55% 45% 😐
50% / 50% 50% 50%

A 的最优策略是尽全力切均匀 —— 不是因为他善良,而是规则让不均匀对他自己不利

⭐⭐ 这就是机制设计的全部精神不去劝人变好,而是把规则设计成「按自己利益行事,恰好导向你想要的结果」。

再看结果的性质:切的人拿到自己认为的一半(他自己切的),挑的人拿到自己认为至少一半(他先挑)。 ⭐ 两个人都不会羡慕对方 —— 这个性质叫无嫉妒(envy-free)第 19 章会正式定义它。

💡 另一个经典:所罗门王判子。两个女人争一个孩子,国王说「劈成两半一人一半」—— 真母亲立刻放弃。⭐ 他没有去查证据,而是设计了一个让真话自己暴露出来的规则。


🔄 二、转折:博弈论 vs 机制设计

博弈论(09–15 章) 机制设计(16 章起)
规则 给定的、不能改 你要设计的东西
你的位置 分析者 / 参与者 规则制定者(social planner)
问题 给定这张收益表,会落到哪一格? 我想落到某一格,收益表该长什么样
典型工具 支配、纳什均衡、逆向归纳 策略防伪、个体理性、不可能定理
一句话 游戏是黑箱,预测结果 游戏是你写的,倒推规则

为什么必须有这一章第 9 章的囚徒困境给出了一个死结 —— 两个理性的人必然落到 (1,1),而 (2,2) 就在旁边。 💀 你没法靠「教育大家聪明一点」解决它,因为坏结果恰恰是理性推出来的。 唯一的出路是换掉游戏本身

🔨 具体到囚徒困境:如果引入「事后互相举报可查、背叛者要赔偿 2」这条规则, 叛变的收益从 3 降到 1、从 1 降到 −1,合作就变成了占优策略。 ⭐ 规则一改,同样理性的两个人自动落到 (2,2)。这就是机制设计在做的事。


🏗️ 三、框架:五个部件和两个动作

讲义给的框架很简洁:

   Agents(有各自的偏好)
        │  ① 报告偏好
        ▼
   Mechanism / Social Planner(你设计的那套规则)
        │  ② 按报告选出结果
        ▼
   Outcome(谁得到什么)

一个机制永远由两部分组成

部分 英文 在干什么 分蛋糕例子里
偏好征询 Preference Elicitation :让参与者报出自己的偏好 A 通过「怎么切」隐式报出他对蛋糕的估值
偏好聚合 Preference Aggregation :根据报告决定结果 B 挑一块,剩下给 A

⚠️ 第一部分才是难点,而且是全部麻烦的来源。 聚合规则你想怎么写都行;但参与者报的偏好是他自己说的,他完全可以撒谎 —— 如果撒谎能让他拿到更好的结果,他一定会撒。

⭐⭐ 机制设计的核心难题一句话你要在「参与者可能说谎」的前提下,设计一套仍能得到好结果的规则。


📏 四、什么叫「好」:四个想要的性质

设计之前得先说清楚目标。讲义把它们分成三类,我再加一条实践中必须有的:

⭐⭐ 策略防伪(Strategyproofness, SP)

如实报出真实偏好,是每个参与者的(弱)占优策略。 换句话说:说谎永远不会让你变好。

这是机制设计里最想要的性质,理由不只是「诚实是美德」:

好处 说明
参与者不用动脑 不需要猜别人怎么报、不需要懂博弈论,照实说就行
设计者能信任输入 收到的数据就是真实偏好,基于它做的分析才有意义
公平 懂策略的人不会占不懂的人的便宜

💡 ⭐ 回顾第 10 章占优策略是唯一不需要猜对手的推理。 SP 就是在人为地制造一个占优策略出来 —— 把「说真话」变成那个不用动脑的选项。

个体理性(Individual Rationality, IR)

参与不会比不参与更差。

⚠️ 听起来是废话,其实是硬约束:没有 IR 的机制没人会用第 18 章的住房市场里,IR 具体化成「你换到的房子不比你原来的差」。

效率(Efficiency)

主要是第 9 章定义过的帕累托最优:没有一种改法能让一个人更好而不让另一个更差。 ⚠️ 注意 PO 完全不管公平 —— 「一个人拿光」也是帕累托最优的。

公平(Fairness)

无嫉妒(谁也不想跟别人换)、平等主义福利(最差的那个人尽量好)等等。 第 19 章会把这一类拆成一整个阶梯。


⚔️ 五、为什么这是门学问:性质会打架

如果四条能同时满足,机制设计就没什么可研究的了。问题恰恰是它们经常互相冲突。

这才是后面 10 章的真正主线:不是「学十个算法」,而是 在每个场景里搞清楚「哪几条能同时要,哪几条必须放弃」

讲义把这件事说得很直白 —— 对每个场景,要么给出机制并证明它满足哪些性质,要么给出反例证明做不到

先剧透几个结论,让你知道这条线通向哪里:

场景 结论 在哪一章
双边匹配 稳定匹配一定存在(DA 算法),⭐ 但提案方受益、被提案方吃亏,且只有提案方是 SP 的 17
住房交换 ⭐ 满足 SP + IR + PO 的机制本质上只有 TTC 一个 18
不可分物品分配 ⚠️ 无嫉妒常常根本不存在(两人一件物品就不行),只能退到 EF1 19
投票 💀 G–S 定理:候选项 ≥3 时,SP + 非独裁不可兼得 26

⭐⭐ 注意最后一行:在投票这个场景里,策略防伪被证明是要不起的。 这不是「还没设计出来」,是数学上不存在。 机制设计的成熟标志,就是知道什么时候该停止寻找


💰 六、一个能看到钱的真实例子

抽象框架听完了,看一个每天在跑、每年过千亿的实例:在线广告拍卖

框架部件 广告拍卖里对应什么
Agents 广告主
Preferences 一次点击对我值多少钱(只有他自己知道
偏好征询 出价
偏好聚合 按 eCPM 排序 + 决定谁付多少钱
Outcome 谁的广告被展示、各付多少

一价拍卖(谁出价高谁赢、按自己的出价付)不是 SP 的 —— 你赢了会后悔多付, 于是所有人不停试探,出价剧烈震荡。 ⭐ 二价拍卖(付刚好赢过下一名的价)在单个位置上是 SP 的 —— 报真实估值是占优策略, 系统因此稳定下来。

🔗 完整的账在 《推荐算法》15b · 广告:从推荐到竞价: eCPM 怎么把不同计费方式换算到同一把尺子、GSP 的付费公式怎么手算、 ⭐ 为什么多位置的 GSP 其实不是激励相容的、而理论上正确的 VCG 反而没人用 (答案是「广告主看不懂账单」——可解释性打败了理论最优)。 那一章是这一章最好的落地对照:一个明知有缺陷、却被全行业采用的机制。


🔗 这一章连到哪里

去哪 为什么
09 · 正常形博弈 ⭐ 回去看囚徒困境:本章存在的理由就是那个死结 —— 理性推出坏结果,教育没用,只能换规则
10 · 支配策略 ⭐ 策略防伪 = 人为制造一个占优策略。那一章讲了占优策略为什么珍贵(唯一不用猜对手的推理),这一章讲怎么把它造出来
17 · 稳定匹配 · 18 · 住房市场与 TTC 本框架的头两个完整实例。⭐ 18 章的「SP+IR+PO ⟹ 只能是 TTC」是刻画一整类机制的典范
19 · 怎么算公平 本章「公平」只给了名字,那一章拆成 EF / EF1 / PROP / MMS 一整个阶梯,并说明为什么必须退让
26 · 不可能定理 ⭐⭐ 本章列的四条性质,那一章给出它们的数学边界:Arrow 和 G–S 告诉你哪些组合根本要不起
../推荐算法/15b-广告-从推荐到竞价.html ⭐⭐ 本框架每年过千亿的工业落点。看完抽象定义之后,那是一个能立刻看到钱的实例

✅ 检查点

  1. 博弈论和机制设计在提问方式上有什么根本区别?你的身份变了什么?
  2. 「一人切一人选」里,切的人为什么会尽量切均匀?这说明了机制设计的什么精神?
  3. 这个机制产出的结果满足什么公平性质?两个人各自的保证是什么?
  4. 为什么说囚徒困境「没法靠教育解决」?出路是什么?举一个改规则的具体例子。
  5. 一个机制由哪两部分组成?哪一部分是全部麻烦的来源,为什么?
  6. 策略防伪的定义是什么?它带来的三个好处分别是什么?
  7. 策略防伪和第 10 章的占优策略是什么关系?
  8. 个体理性为什么不是废话?
  9. 「性质会打架」是什么意思?为什么说这才是后面十章的真正主线?
  10. 一价拍卖为什么不是策略防伪的?二价拍卖在单个位置上为什么是?
👀 答案
  1. 博弈论:规则给定、不能改,你是分析者,问「给定这张收益表会落到哪一格」;机制设计:规则是你要设计的,你是规则制定者(social planner),问「我想落到某一格,收益表该长什么样」。⭐ 一句话:游戏是黑箱就预测,游戏是你写的就倒推
  2. 因为他知道对方会挑大的那块,切得越不均匀,自己剩下的越少(60/40 只剩 40%,50/50 能保住 50%)。⭐⭐ 精神:不去劝人变好,而是把规则设计成「按自己利益行事恰好导向你想要的结果」。
  3. 无嫉妒(envy-free)。切的人拿到自己认为的一半(因为是他自己切的),挑的人拿到自己认为至少一半(因为他先挑)。两个人都不会羡慕对方。
  4. 因为坏结果 (1,1) 恰恰是理性推出来的 —— 没有人犯错、没有信息不对称,教育「聪明一点」改变不了任何东西。出路是换掉游戏本身。🔨 例子:加一条「背叛者要赔偿 2」,叛变收益从 3 降到 1、从 1 降到 −1,合作变成占优策略,同样理性的两人自动落到 (2,2)。
  5. ① 偏好征询(Preference Elicitation):问参与者报偏好;② 偏好聚合(Preference Aggregation):按报告算结果。⚠️ 第一部分是全部麻烦的来源 —— 聚合规则你想怎么写都行,但参与者报的偏好是他自己说的,能撒谎;只要撒谎有利,他一定撒。⭐⭐ 核心难题:在参与者可能说谎的前提下,仍要得到好结果。
  6. 如实报出真实偏好是每个人的(弱)占优策略,即说谎永远不会让你变好。三个好处:① 参与者不用动脑(不用猜别人、不用懂博弈论)② ⭐ 设计者能信任输入(收到的就是真实偏好,基于它的分析才有意义)③ 公平(懂策略的人占不到不懂的人的便宜)。
  7. ⭐ 第 10 章说占优策略是唯一不需要猜对手的推理,但它很罕见。SP 就是人为地制造一个占优策略出来 —— 把「说真话」变成那个不用动脑的选项。
  8. 因为它是硬约束:参与不能比不参与更差,否则没人会用这个机制。第 18 章住房市场里它具体化成「换到的房子不比原来的差」。
  9. 四条性质(SP / IR / PO / 公平)经常互相冲突,不能同时满足。⭐ 所以后面十章的主线不是「学十个算法」,而是在每个场景搞清楚哪几条能同时要、哪几条必须放弃:匹配里「提案方受益、只有提案方 SP」;住房交换里「SP+IR+PO ⟹ 只能是 TTC」;分配里「EF 常常不存在,只能退到 EF1」;💀 投票里「G–S:候选项 ≥3 时 SP + 非独裁不可兼得」。⭐⭐ 机制设计的成熟标志,是知道什么时候该停止寻找。
  10. 一价拍卖:按自己的出价付,赢了会发现多付了(第二名可能低很多),于是不停向下试探,出价剧烈震荡,报真实估值不是最优。二价拍卖:付的是刚好赢过下一名的价,多报不会让你多付、少报可能让你输掉,所以报真实估值是占优策略 —— 单个位置上它是 SP 的。⚠️ 但多位置的 GSP 就不是了(见推荐算法 15b)。

🛑 可以停在这里

走神救援

⭐⭐ 这一章是全板块的转折点:身份从「分析者」变成「规则制定者」。 前面 7 章问「给定规则,理性的人会怎么做」;从这里开始倒过来问「我想要某个结果,规则该怎么写」。开场例子「一人切一人选」把全部精神浓缩了:A 切、B 先挑,A 切 60/40 只剩 40%,切 50/50 能保住 50% —— ⭐ 他尽力切均匀不是因为善良,是因为规则让不均匀对他自己不利。⭐⭐ 机制设计不劝人变好,它把规则设计成「按自己利益行事恰好导向你想要的结果」。 结果还自带无嫉妒:切的人拿到自己认为的一半,挑的人拿到自己认为至少一半。(另一个经典:所罗门王说「把孩子劈两半」——没查证据,而是设计了让真话自己暴露的规则。)⭐ 为什么非有这一章不可:第 9 章囚徒困境是个死结,(1,1) 是理性推出来的,💀 教育「聪明一点」没用 —— 唯一出路是换游戏。🔨 加一条「背叛者赔偿 2」,叛变收益 3→1、1→−1,合作就变成占优策略,同样理性的两人自动落到 (2,2)。框架:Agents(有偏好)→ Mechanism(你设计的规则)→ Outcome,而任何机制都由两部分组成偏好征询(问)+ 偏好聚合(算)。⚠️⚠️ 第一部分是全部麻烦的来源 —— 聚合规则随你写,但参与者报的偏好是他自己说的,能撒谎;⭐⭐ 核心难题就是「在参与者可能说谎的前提下仍要得到好结果」。四条想要的性质:⭐⭐ 策略防伪 SP(如实报是弱占优策略,说谎永远不会更好)—— 三个好处是参与者不用动脑、⭐设计者能信任输入、懂策略的人占不到便宜;⭐ 它本质上是人为制造一个占优策略(回顾第 10 章:占优策略是唯一不用猜对手的推理,只是太罕见)。IR 个体理性(参与不比不参与差,不是废话——没有它没人会用)。PO 效率(⚠️ 完全不管公平,一个人拿光也是 PO)。公平(无嫉妒、平等主义福利,第 19 章展开)。⭐⭐ 这门学问之所以存在,是因为四条性质会打架 —— 后面十章的真正主线不是「学十个算法」,而是每个场景里哪几条能同时要、哪几条必须放弃:匹配「提案方受益、只有提案方 SP」(17 章)、住房交换「SP+IR+PO ⟹ 本质上只有 TTC」(18 章)、分配「EF 常常根本不存在,退到 EF1」(19 章)、💀 投票「G–S:候选项 ≥3 时 SP 和非独裁不可兼得」(26 章)。⭐ 最后一条是数学上不存在,不是还没设计出来 —— 机制设计的成熟标志是知道什么时候停止寻找。 工业落点:广告拍卖里 agents=广告主、偏好=一次点击值多少(只有他自己知道)、征询=出价、聚合=按 eCPM 排序并定价;⭐ 一价拍卖不是 SP 的(赢了后悔多付 → 不停试探 → 出价震荡),单位置二价是 SP 的(报真实估值占优,系统稳定)——完整的账在《推荐算法》15b。

下一节 👉 17-稳定匹配.md

打卡记录保存在你的浏览器里,首页能看到总进度