経済学•第11章•約1分•最終更新 2026年9月24日

ミクロ経済学 — ゲーム理論:混合戦略・繰り返し・信頼性

O
Oiyo寄稿者
11/11

ミクロ経済学 — 均衡とは相手を固定したうえでの相互最善反応である

第8章のクールノー均衡はすでにナッシュ均衡だった。この章ではゲーム理論の道具を一般化する。純粋戦略では均衡がないとき(混合戦略)、選択に順番があるとき(後ろ向き帰納法)、同じゲームが繰り返されるとき(割引因子)である。まず、1人の最適化と複数人の均衡は別の概念であることを確認しておく。最適化では環境が固定されているが、均衡では互いの選択が互いの環境になる。

1. ナッシュ均衡

ナッシュ均衡とは、すべてのプレイヤーが他のプレイヤーの戦略を所与としたとき、自分の戦略を変える誘因がない戦略の組み合わせである。囚人のジレンマでは(自白、自白)がナッシュ均衡だが、両者とも黙秘するより悪い。ナッシュ均衡は安定性の概念であって効率性の概念ではない。

2. 混合戦略:相手を無差別にする確率

次のゲームには純粋戦略の均衡がない(各マスは行プレイヤーと列プレイヤーの利得)。

純粋戦略の均衡がないゲーム
列:左列:右
行:上(2, 1)(0, 3)
行:下(1, 2)(3, 0)

どのマスから出発しても誰かが逸脱したくなる。(上, 左)では列が右へ、(上, 右)では行が下へ、(下, 右)では列が左へ、(下, 左)では行が上へ移る。

混合戦略均衡では、各プレイヤーは相手が2つの純粋戦略の間で無差別になるように確率を選ぶ。相手が無差別でなければ一方の純粋戦略だけを使うはずで、そうなれば自分の混合も最善ではなくなるからである。

  • 列が左を確率qqで選ぶと、行の期待値は上が2q2q、下がq+3(1−q)=3−2qq+3(1-q)=3-2qである。両者が等しくなるのはq=3/4q=3/4。
  • 行が上を確率ppで選ぶと、列の期待値は左がp+2(1−p)=2−pp+2(1-p)=2-p、右が3p3pである。両者が等しくなるのはp=1/2p=1/2。
混合戦略ナッシュ均衡の条件
E[u−i(s1)∣σi]=E[u−i(s2)∣σi]E[u_{-i}(s_1)\mid \sigma_i] = E[u_{-i}(s_2)\mid \sigma_i]
自分の確率σ_iは、相手の2つの純粋戦略の期待値を等しくする値である。自分の確率を決めるのは自分の利得ではなく相手の利得である。

均衡は(行:上1/2、列:左3/4)で、行の期待利得は2×0.75=1.52\times 0.75=1.5、列の期待利得は3×0.5=1.53\times 0.5=1.5である。よくある誤りは、50%を既定値とすることや、自分の利得で確率を計算することである。サッカーのPKでキッカーが左右を混ぜる割合は、キッカーの好みではなくゴールキーパーの止める能力が決める。

3. 逐次ゲームと後ろ向き帰納法

選択に順番があるときは、ゲームを木で描いて最後から解く。既存企業(防衛者)がいる市場に参入者が入るかどうかを決め、入れば防衛者が価格戦争をするか共存するかを決める。

参入ゲーム(参入者の利得、防衛者の利得)
参入者の選択防衛者の対応利得
参入しない—(0, 100)
参入共存(30, 50)
参入価格戦争(−10, 20)

防衛者が「入ってきたら価格戦争をする」と脅す。参入者がこれを信じれば参入せず、(参入しない、価格戦争)はナッシュ均衡である。しかし参入者が実際に入ってきた後なら、防衛者にとっては価格戦争(20)より共存(50)のほうがよい。脅しは信頼できない。

後ろ向き帰納法で解くと、最後の段階で防衛者は共存を選び、それを知る参入者は参入する(30 > 0)。すべての部分ゲームで最善反応になっているこの均衡を部分ゲーム完全均衡という。信頼できない脅しに頼るナッシュ均衡をふるい落とす概念である。

脅しを信頼できるものにする方法はコミットメントである。防衛者があらかじめ大規模な設備を建てておき、参入が起きても大量生産で価格を下げるほうがむしろ得になるようにすれば(例:価格戦争60 > 共存50)、脅しが実際の最善反応になり、参入が阻止される。後戻りできない埋没投資が戦略的価値をもつ理由であり、第8章のシュタッケルベルクの先導者と同じ論理である。

4. 繰り返しゲーム

1回なら裏切るゲームでも、繰り返されれば協力が維持されうる。協力すれば毎期400ウォン、1回逸脱すればその期に700ウォンを得て、以後は相手が永遠に処罰して毎期50ウォンになるとしよう。割引因子δ\deltaのもとで

4001−δ ≥ 700+50 δ1−δ⟺δ ≥ 700−400700−50≈0.46\frac{400}{1-\delta}\ \ge\ 700+\frac{50\,\delta}{1-\delta}\quad\Longleftrightarrow\quad \delta\ \ge\ \frac{700-400}{700-50}\approx 0.46

分子は1回の逸脱で余分に得る300ウォン、分母は逸脱利得と処罰利得の差650ウォンである。将来を十分に重視すれば協力が均衡になる。第8章の共謀の条件はこの式の応用である。

注意点が2つある。第一に、終わりの時点がわかっている有限回の繰り返しゲームでは、最終期に裏切ることが確実なのでその前の期にも裏切り、後ろ向き帰納法で最初の期から協力が崩れる。協力が維持されるには終わりが不確実でなければならない。第二に、無限回の繰り返しゲームでは協力だけでなく非常に多くの結果が均衡になりうる(フォーク定理)。繰り返しは協力を可能にするだけで、保証はしない。

脅しと約束が信頼される条件
言葉信頼性の条件道具
報復する報復がその時点で自分にとっても最善でなければならない部分ゲーム完全均衡
価格戦争をする戦争の経路が均衡でなければならない割引因子、逸脱の観測可能性
参入を阻止する後戻りできない投資で選択肢を縛らなければならない埋没設備、長期契約

確認問題

上の表で列が左を3/4で選ぶとき、行の2つの戦略の期待値は。上は2×0.75=1.52\times 0.75=1.5、下は1×0.75+3×0.25=1.51\times 0.75+3\times 0.25=1.5で等しい。行はどちらを選んでも無差別なので、1/2ずつ混ぜることも最善反応である。もし列が左を0.9で選べば、上の期待値1.8が下の1.2より大きくなり、行は上だけを選ぶ。すると列は右に移って均衡が崩れる。

参考資料

  • Robert Gibbons, Game Theory for Applied Economists, ch. 1–2
  • Avinash Dixit and Susan Skeath, Games of Strategy, ch. 6–7, 10
  • Hal Varian, Intermediate Microeconomics, ch. 29–30
  • MIT OpenCourseWare, 14.12 Economic Applications of Game Theory
O

Oiyo

編集部

OIYO編集部は、経済・法律・生活・自己理解のテーマを一次資料と公開統計で検証してまとめます。すべての記事は出典を明記し、定期的に見直して正確さと実用性を保ちます。