经济学•章节 11•1 分钟•Updated September 24, 2026

微观经济学 — 博弈论:混合策略、重复博弈与可信性

O
Oiyo贡献者
11/11

微观经济学 — 均衡是在对方选择给定时的相互最优反应

第8章的古诺均衡已经是纳什均衡。本章把博弈论的工具一般化:没有纯策略均衡时(混合策略),选择有先后顺序时(逆向归纳),同一博弈重复进行时(贴现因子)。首先要明确,一个人的最优化与多人之间的均衡是不同的概念。最优化中环境是固定的,而均衡中彼此的选择构成了彼此的环境。

1. 纳什均衡

纳什均衡是这样一组策略:在其他参与者的策略给定时,所有参与者都没有改变自己策略的激励。在囚徒困境中,(坦白,坦白)是纳什均衡,但对双方而言都比都沉默更差。纳什均衡是稳定性的概念,而不是效率的概念。

2. 混合策略:使对方无差异的概率

下面的博弈不存在纯策略均衡(格中为行参与者与列参与者的收益)。

不存在纯策略均衡的博弈
列:左列:右
行:上(2, 1)(0, 3)
行:下(1, 2)(3, 0)

无论从哪一格出发,总有人想偏离。在(上,左)列会改为右,在(上,右)行会改为下,在(下,右)列会改为左,在(下,左)行会改为上。

在混合策略均衡中,每个参与者选择的概率要使对方在两个纯策略之间无差异。如果对方不是无差异的,他就只会用一个纯策略,那样我的混合也就不再是最优反应。

  • 若列以概率qq选左,行选上的期望收益为2q2q,选下为q+3(1−q)=3−2qq+3(1-q)=3-2q。两者相等时q=3/4q=3/4。
  • 若行以概率pp选上,列选左的期望收益为p+2(1−p)=2−pp+2(1-p)=2-p,选右为3p3p。两者相等时p=1/2p=1/2。
混合策略纳什均衡的条件
E[u−i(s1)∣σi]=E[u−i(s2)∣σi]E[u_{-i}(s_1)\mid \sigma_i] = E[u_{-i}(s_2)\mid \sigma_i]
我的概率σ_i是使对方两个纯策略期望收益相等的值。决定我的概率的是对方的收益,而不是我自己的收益。

均衡为(行:上1/2,列:左3/4),行的期望收益为2×0.75=1.52\times 0.75=1.5,列的期望收益为3×0.5=1.53\times 0.5=1.5。常见的错误是把50%当作默认值,或用自己的收益计算概率。足球点球中罚球者左右混合的比例,不是由罚球者的偏好决定,而是由守门员扑救两侧的能力决定。

3. 序贯博弈与逆向归纳

选择有先后顺序时,把博弈画成树,从最后一步往前解。潜在进入者决定是否进入由在位企业占据的市场;若进入,在位企业决定是打价格战还是共存。

进入博弈(进入者收益,在位者收益)
进入者的选择在位者的反应收益
不进入—(0, 100)
进入共存(30, 50)
进入价格战(−10, 20)

在位企业威胁说:“你进来我就打价格战。“如果进入者相信,就不会进入,(不进入,价格战)是纳什均衡。但一旦进入者真的进来,在位企业共存(50)比打价格战(20)更好。这一威胁不可信。

用逆向归纳求解,最后一步在位企业选择共存,知道这一点的进入者就会进入(30 > 0)。在所有子博弈中都是最优反应的这一均衡称为子博弈完美均衡,它能剔除依赖不可信威胁的纳什均衡。

使威胁可信的方法是承诺。如果在位企业事先建设大规模产能,使得即使对手进入,大量生产、压低价格反而更有利(例如价格战60 > 共存50),威胁就成为真正的最优反应,进入被阻止。这就是不可逆的沉没投资具有战略价值的原因,与第8章斯塔克尔伯格领导者的逻辑相同。

4. 重复博弈

一次博弈中会背叛的局面,若重复进行,合作就可能维持。设合作时每期得400韩元,背叛一次在当期得700韩元,此后对方永远惩罚,每期只得50韩元。在贴现因子δ\delta下:

4001−δ ≥ 700+50 δ1−δ⟺δ ≥ 700−400700−50≈0.46\frac{400}{1-\delta}\ \ge\ 700+\frac{50\,\delta}{1-\delta}\quad\Longleftrightarrow\quad \delta\ \ge\ \frac{700-400}{700-50}\approx 0.46

分子是背叛一次多得的300韩元,分母是背叛收益与惩罚收益之差650韩元。只要足够重视未来,合作就是均衡。第8章的合谋条件就是这个式子的应用。

有两点需要注意。第一,在已知结束时点的有限次重复博弈中,最后一期必然背叛,于是前一期也背叛,逆向归纳使合作从第一期起就瓦解。合作要维持,结束时点必须不确定。第二,在无限次重复博弈中,不只合作,非常多的结果都可能成为均衡(无名氏定理)。重复只是使合作成为可能,并不保证合作。

威胁与承诺可信的条件
说法可信的条件工具
我会报复报复在当时对自己也必须是最优的子博弈完美均衡
我会打价格战价格战路径必须是均衡贴现因子、背叛的可观察性
我会阻止进入必须用不可逆的投资锁定选择沉没产能、长期合同

练习题

在上表中,当列以3/4的概率选左时,行两个策略的期望收益是多少?上为2×0.75=1.52\times 0.75=1.5,下为1×0.75+3×0.25=1.51\times 0.75+3\times 0.25=1.5,两者相等。行选哪一个都无差异,因此各以1/2混合也是最优反应。若列以0.9的概率选左,上的期望收益1.8大于下的1.2,行就只选上,于是列改选右,均衡被打破。

参考资料

  • Robert Gibbons, Game Theory for Applied Economists, ch. 1–2
  • Avinash Dixit and Susan Skeath, Games of Strategy, ch. 6–7, 10
  • Hal Varian, Intermediate Microeconomics, ch. 29–30
  • MIT OpenCourseWare, 14.12 Economic Applications of Game Theory
O

Oiyo

Editorial Desk

The OIYO editorial desk researches money, law, lifestyle, and self-understanding topics against primary sources and public statistics. Every piece carries source notes and is reviewed on a regular cycle for accuracy and usefulness.