战略思维

博弈论——对策略性相互依存的数学分析

博弈论——对策略性相互依存的数学分析

大家好,我是 Senko。 本文将解读“博弈论(Game Theory)”

它是用数学分析多位参与人在彼此顾及对方行动的情况下做决策之处境的学问。作为横跨经济学、政治学、生物学、计算机科学的理论发展起来,成了 20 世纪后半最具影响力的智识框架之一。

本文是处理博弈论全貌的概论。各概念的详细解读,会在各处附上专门文章的链接。初次接触博弈论的读者,从“标准式博弈与占优策略”(囚徒困境、纳什均衡)一节读起,比较容易抓住全貌。

博弈的分类体系

博弈论的诞生与历史

冯·诺伊曼与《博弈论与经济行为》

博弈论的数学基础,可上溯到匈牙利出身的天才数学家约翰·冯·诺伊曼 1928 年发表的论文《室内博弈的理论》。他在国际象棋、扑克这类二人零和博弈中证明了“极小化极大定理”,指出即便纯策略下没有均衡,只要使用混合策略,均衡也必定存在。

1944 年,冯·诺伊曼与经济学家奥斯卡·摩根斯坦合著出版了《博弈论与经济行为》。这部著作超过 600 页,是把博弈论确立为经济学分析工具的里程碑之作。

约翰·纳什与“纳什均衡”

冯·诺伊曼的理论局限于二人零和博弈,而 1950 年普林斯顿大学的研究生约翰·纳什提出了可适用于非零和博弈、多人博弈的一般均衡概念。在仅 27 页的博士论文里给出的“纳什均衡”,把博弈论的应用范围剧烈地拓宽了。

纳什后来患上精神分裂症,在长年的精神困境中挺了过来,1994 年与约翰·海萨尼、莱因哈德·泽尔滕一同获得诺贝尔经济学奖。他跌宕的一生也被电影《美丽心灵》(2001 年)描绘过。

纳什均衡——谁也不想改变策略的均衡状态zh.senkohome.com/strategic-thinking-nash-equilibrium/

此后的发展与诺贝尔奖

博弈论在 1960~80 年代急速发展。

泽尔滕(1994 年获奖):提出子博弈完美均衡与逆向归纳法。建立了把不合理的威胁从均衡中排除的“精炼”框架。

海萨尼(1994 年获奖):确立了分析不完全信息博弈(参与人不知道对方收益或特性的处境)的贝叶斯博弈框架。

奥曼(2005 年获奖):把重复博弈与无名氏定理数学地严密化,并把共同知识(Common Knowledge)概念化。

谢林(2005 年获奖):把博弈论应用于核威慑论、谈判论与国际安全保障,提出焦点(谢林点)的概念。

马斯金、迈尔森、赫维茨(2007 年获奖):机制设计(设计能产生理想结果之制度的“逆博弈论”)。

沙普利、罗斯(2012 年获奖):稳定匹配理论及其在市场设计上的应用。

博弈论诺奖得主之多,说明这套理论已多么深地嵌入现代经济学与社会科学的中枢。

博弈的基本要素

博弈论分析的是“多个决策主体(参与人)在顾及彼此行动之结果的情况下选择行动”的处境。这种处境被称为“博弈”,由三个基本要素构成。

参与人(Player):做决策的主体。人、企业、国家、生物物种等等,只要能带着意图选择行动,什么都可以成为参与人。博弈论通常假定参与人是力图最大化自身收益的“理性主体”。

策略(Strategy):参与人可选行动方案的集合。

  • 纯策略(Pure Strategy):确定地选择某个特定行动的计划(“必定向右走”)
  • 混合策略(Mixed Strategy):以概率选择各行动的计划(“以 50% 的概率向右走”)

按博弈不同,既有只有有限策略的情形(石头剪刀布的三选一),也有连续策略空间的情形(把价格定成多少)。

收益(Payoff):各参与人从策略组合(结果)中得到的结果评价值。通常表示为效用(主观满意度)。博弈论中的“理性”,就是按最大化这份收益去行动。

博弈由“各参与人选定自己策略时收益如何决定”这个函数(收益函数)来形式化。

博弈的分类

博弈论处理的博弈按多个轴分类。

按合作结构分类非合作博弈(Non-Cooperative Game):参与人在没有约束力协议的情况下独立决策的博弈。现代博弈论的中心正是非合作博弈,纳什均衡就在这个语境下定义。

合作博弈(Cooperative Game):参与人组成联盟(Coalition)、并能在联盟内达成有约束力协议的博弈。分析会形成哪些联盟、收益如何分配。沙普利值与核是主要的均衡概念。

按信息结构分类完全信息博弈(Perfect Information Game):全部参与人知道全部信息(过去的全部行动、对方的收益函数)的博弈。国际象棋、中国象棋是其典型。

不完全信息博弈(Imperfect Information Game):存在一部分参与人不知道的信息(对方的收益、特性、过去的行动)的博弈。拍卖、扑克、保险市场是其典型。

按时间结构分类静态博弈(Static Game / 同时行动):全部参与人同时(或在看不到对方行动的情况下)选择策略的博弈。

动态博弈(Dynamic Game / 依次行动):参与人按顺序行动,后行者能观察先行者行动的博弈。

这些组合起来产生四类博弈(参见上面的分类图)。各自使用不同的均衡概念与分析手法。

按零和性分类零和博弈(Zero-Sum Game):全部参与人的收益之和恒定,一方所得即另一方所失的博弈。国际象棋、扑克、极小化极大策略是主要对象。

非零和博弈(Non-Zero-Sum Game):参与人全体有可能同时获益(或同时受损)的博弈。现实的商业、外交、环境问题几乎都是非零和的。

标准式博弈与占优策略

支付矩阵的读法

静态博弈用“支付矩阵”(Payoff Matrix)表示。

在二人博弈中,行参与人选择策略以定下“行”,列参与人选择策略以定下“列”。各格里按(行参与人收益,列参与人收益)的形式写出收益。

囚徒困境的支付矩阵

上图是“囚徒困境”(Prisoner’s Dilemma)的支付矩阵。两名嫌疑人(囚徒 A、囚徒 B)在不同房间受审,要在沉默(合作)与告发(背叛)之间做选择。

  • 双方合作(沉默):双方收益为 3(两人都受轻罚)
  • 只有 A 背叛 B(告发):A 收益 5(无罪释放),B 收益 0(重罚)
  • 只有 B 背叛 A:B 收益 5,A 收益 0
  • 双方背叛:双方收益为 1(中等处罚)

占优策略

“占优策略”(Dominant Strategy)指的是无论对方采取什么策略,都总能带来比其他任何策略更高(或不低于)收益的策略。

在囚徒困境里从 A 的立场看:- B 合作时:A 合作→收益 3,A 背叛→收益 5(背叛更优)

  • B 背叛时:A 合作→收益 0,A 背叛→收益 1(背叛更优)

两种情况下都是“背叛”更优,因此“背叛”是 A 的占优策略。B 同样以“背叛”为占优策略。

存在占优策略时,理性的参与人必定选择占优策略。不必去想“对方会做什么”,光靠自己的策略就定下了最优。

纳什均衡

并非所有参与人都拥有占优策略。多数博弈里的处境是“自己的最优对策随对方策略而变”。

这时用上的就是纳什均衡(Nash Equilibrium)。

定义:在把对方策略视为给定的前提下,全部参与人都在最大化自身收益(都在采取最优反应)的策略组合。

在纳什均衡下,任何一位参与人单独改变策略都不会改善收益(没有偏离的动机)。

在囚徒困境里,(背叛,背叛)就是纳什均衡:- 对方选“背叛”时,A 若改成“合作”收益会降到 0(现在是 1)→不偏离

  • B 同理

不过,纳什均衡未必是帕累托最优。囚徒困境里明明(合作,合作)的(3,3)对双方更好,成为均衡的却是(背叛,背叛)的(1,1)。这就是“社会困境”的结构。

帕累托效率——是否还有不牺牲任何人的改善余地zh.senkohome.com/strategic-thinking-pareto/

纳什均衡存在定理:纳什证明了“有限博弈中若把混合策略计入,纳什均衡必定存在”。这就是纳什博士论文的核心。

代表性博弈详解

囚徒困境(Prisoner’s Dilemma)

如上文所述。它是个人的理性行动损害集体整体利益这一社会困境的代表例。

军备竞赛(双方都裁军则双方费用都下降,可各国以扩军为占优策略)、价格战(全行业维持高价则整体获利,可各家以降价为占优策略)、公共品问题(全员贡献则全员得利,可个人以搭便车为占优策略),全都具有囚徒困境的结构。

斗鸡博弈(Chicken Game / Hawk-Dove Game)

两辆车迎面对开,谁先拐弯谁就输给对方,双方都不拐就相撞。

支付矩阵的结构(一例):

对方:拐弯对方:直行
自己:拐弯(0, 0)(−1, 1)
自己:直行(1, −1)(−10, −10)

纳什均衡有两个:(自己直行、对方拐弯)与(自己拐弯、对方直行)。纯策略均衡有多个,落到哪一个视处境而定。

具有斗鸡博弈结构的现实处境:核威慑(谁先退让)、正面对峙、企业的价格战(先涨价的一方吃亏)、国际谈判(谁先让步)。

协调博弈(Coordination Game)

双方选择相同,收益就越高的博弈。

对方:A 规格对方:B 规格
自己:A 规格(10, 10)(0, 0)
自己:B 规格(0, 0)(10, 10)

纳什均衡是(A, A)与(B, B)两个。收敛到哪一个才是问题,这正是谢林点(焦点)登场的地方。人们倾向于全体收敛到“大家看起来都会选”的那个规格。

技术规格之争、语言、货币、交通规则(靠右还是靠左行驶)都具有协调博弈的结构。

性别之战(Battle of the Sexes)

收益并不完全一致,但协调本身也有价值的博弈。

丈夫想看足球,妻子想去音乐会,可两人一起行动本身有价值。

妻:足球妻:音乐会
夫:足球(3, 1)(0, 0)
夫:音乐会(0, 0)(1, 3)

纳什均衡是(足球,足球)与(音乐会,音乐会)两个。丈夫偏好的均衡与妻子偏好的均衡不同。这是“均衡选择问题”的典型例,由社会规范、惯例与沟通来决定收敛到哪一个均衡。

混合策略均衡

有些博弈不存在纯策略纳什均衡,其代表就是“石头剪刀布”

对方:石头对方:剪刀对方:布
自己:石头(0, 0)(1, −1)(−1, 1)
自己:剪刀(−1, 1)(0, 0)(1, −1)
自己:布(1, −1)(−1, 1)(0, 0)

任何纯策略都存在“对方一旦选择其最优反应,另一个策略就变成最优”的循环,因此不存在纯策略纳什均衡。

这种情况下的解就是混合策略纳什均衡。以 1/3 的概率各出一手,就构成混合策略均衡。当对方以各 1/3 的概率出手时,自己无论选哪个纯策略期望收益都相等(均等概率下为 0),以各 1/3 随机出手也一样。

混合策略的直觉含义:为了不让对方预测自己的行动而随机行动,在策略上成为最优,这样的场面是存在的。在体育中(足球点球、棒球配球、网球发球方向),为了不被对方读出,随机性很有效。

纳什的均衡存在定理保证:只要允许混合策略,有限博弈中均衡必定存在。

展开式博弈与逆向归纳法

带时间的动态博弈不用支付矩阵,而用“博弈树”(展开式博弈)表示。

展开式博弈与逆向归纳法

上图是“进入博弈”(Entry Deterrence Game)。

设定:- 进入企业(先手)在考虑是否进入市场

  • 在位企业(后手)在被进入时,可选择“用价格战彻底开打”或“共存(协调定价)”

收益:- 进入 → 价格战:(先手:−1,后手:2)竞争使双方疲敝

  • 进入 → 协调定价:(先手:3,后手:5)分割市场使双方获利
  • 不进入:(先手:0,后手:10)在位企业独享垄断利润

逆向归纳法的步骤

分析展开式博弈要用“逆向归纳法”(Backward Induction),即从博弈树的末端(终端节点)反向分析。

第 1 步(最后的决策):进入企业进入时,在位企业要在“价格战(收益 2)”与“协调定价(收益 5)”间选择。5 > 2,所以在位企业选择“协调定价”

第 2 步(最初的决策):进入企业预见到第 1 步的结果再判断。“进入”会得到协调定价、收益 3;“不进入”收益 0。3 > 0,所以进入企业选择“进入”

均衡结果(子博弈完美纳什均衡):(进入,协调定价)→ 收益(3, 5)

排除不可信的威胁

即便在位企业威胁说“你敢进来我就打价格战”,可实际被进入时协调比价格战更有利(5 > 2),所以这个威胁是“不可信的威胁(Non-Credible Threat)”

进入企业会看穿这一点,无视威胁而进入。

这正是逆向归纳法的重要洞见。泽尔滕的“子博弈完美均衡”(SPNE)只承认在博弈的所有“子博弈(子树)”上都构成纳什均衡的策略组合为均衡,从而把“不可信的威胁”排除出去。

对现实的含意:可以分析外交谈判中的威胁能否执行、企业“绝不撤出”宣言的可信度、以及“不写作业就禁止看电视”这种家长的威胁是否真会执行。

重复博弈与无名氏定理

一次性的囚徒困境里“背叛”是均衡,可在同一批参与人反复对局的“重复博弈”(Repeated Game)中,情况就变了。

无限重复博弈与无名氏定理:用贴现因子 δ(0 < δ < 1,δ 越大越重视将来)来评价未来收益时,若 δ 足够大(参与人重视长期关系),每期“合作”(也就是帕累托最优)就可能成为纳什均衡。

这被称为“无名氏定理”(Folk Theorem)。

直觉的说明:“现在背叛,眼前能拿到收益 5,可此后对方也会一直背叛,只能拿到 1。维持协作则每期能拿 3。只要足够重视将来,长期协作的价值就大于背叛的一时之利。”

用算式写条件:维持合作的激励成立的条件是 δ ≥ (5−3)/(5−1) = 0.5。也就是说,贴现因子在 50% 以上(把将来看作一半以上的价值)时,合作就能维持。

阿克塞尔罗德与一报还一报策略:演化博弈论的文章里有详细处理——在重复囚徒困境的计算机锦标赛中,“一报还一报”(Tit for Tat)策略拿了总冠军。它是先合作、此后照搬对方上一次行动这样单纯的策略。

演化博弈论——合作为何演化,一报还一报为何强zh.senkohome.com/strategic-thinking-evolutionary-game/

无名氏定理对现实的启示:欧佩克产油国的协调、行业协会的卡特尔、地域社区的互助关系、外交上的长期伙伴关系,都是靠重复博弈维持合作的例子。反过来,一次性交易增多的匿名市场,或看不到未来还会打交道的处境,合作就容易崩坏。

不完全信息博弈与贝叶斯均衡

现实中许多策略处境里,对方的收益、能力、意图等私人信息(类型)是不知道的。这就是“不完全信息博弈”(Game of Incomplete Information)。

海萨尼提出了“贝叶斯博弈”(Bayesian Game)的框架:假定各参与人对对方的“类型”持有概率性信念(先验概率)来做分析。

贝叶斯纳什均衡(Bayesian Nash Equilibrium):全部参与人持有关于对方类型的信念,并在该信念下最大化期望收益的策略组合。

密封投标拍卖的例子:在密封投标(全员同时提交报价)中,各投标人只知道自己的估值,不知道对方的估值。作为贝叶斯博弈分析时,可从“对方拥有怎样的估值分布”这一先验概率,导出与自己估值相应的最优报价策略(投标函数)。

信号传递博弈:具有信息不对称的动态博弈之典型。持有信息的一方(worker)向不持有信息的一方(employer)发出信号,employer 观察信号后更新信念并做决策。斯宾塞的学历信号模型就是其典型例。

完美贝叶斯均衡(Perfect Bayesian Equilibrium: PBE):适用于动态不完全信息博弈的均衡概念,要求“参与人按贝叶斯法则更新信念,同时在各信息集上最大化期望收益”。它被用于分析信号传递博弈。

合作博弈论

相对于至此解读的非合作博弈论,“合作博弈论”(Cooperative Game Theory)分析的是参与人组成联盟(Coalition)、并能在联盟内达成有约束力协议的处境。

核(Core):能在联盟内实现比任何联盟单独行动都更好结果的收益分配的集合。属于核的分配具有“防止联盟脱离”的稳定性。

沙普利值(Shapley Value):劳埃德·沙普利提出的、在 n 人合作博弈中计算“公平收益分配”的方法。它被定义为各参与人在全部联盟形成顺序中所贡献的“边际贡献”的期望值,并被刻画为满足有效性、对称性、线性与虚拟参与人四条公理的唯一分配规则。

沙普利值在 AI 与机器学习领域也受到关注。用于量化复杂模型预测中各特征贡献多少的 SHAP(SHapley Additive exPlanation)值,就是沙普利值在机器学习上的应用。

博弈论的应用领域

博弈论的应用已大大超出经济学的范围。

产业组织理论:分析企业间的竞争行为(定价、设备投资、研发、广告)。伯特兰竞争(价格竞争)、古诺竞争(数量竞争)、斯塔克尔伯格竞争(领导者与追随者)都是博弈论的基本模型。卡特尔、寡头价格的维持、阻止进入的策略也是分析对象。

拍卖与市场设计:在机制设计的语境下,设计具有理想性质(效率、收益最大化、激励相容)的拍卖形式。在频谱拍卖、互联网广告竞价、电力市场设计上均有应用。

国际政治与安全保障:分析核威慑的逻辑、军控谈判、关税战、国际协定的遵守问题。在“威胁的可信度”“承诺问题”“升级”的分析上,博弈论扮演着中心角色。

生物学与进化论:作为演化博弈论,分析动物的行为模式(领地争夺、合作行为、信号传递)。把“适应度”视作收益,把自然选择与博弈的均衡概念(演化稳定策略)对应起来。

计算机科学与 AI:多智能体系统、网络游戏的算法设计、强化学习的博弈式形式化。特别是近年来,在 AlphaGo 之类的游戏 AI、自动驾驶车的决策,以及 AI 智能体之间的协调问题上,博弈论担着重要角色。

政治学与投票理论:分析选民的策略性投票行为、选举制度设计、议会中的联盟形成与游说博弈。

博弈论的局限与批评

博弈论是强大的理论,但也有若干根本性的局限。

理性假定:博弈论假定“参与人会理性地行动以最大化自身收益”,可实验经济学与行为经济学的研究表明,人会系统性地做出非理性的选择。

“最后通牒博弈”(Ultimatum Game)是展示这一局限的著名实验。提议者提出把 100 元分成“自己 X 元、对方 100−X 元”,接受者选择接受、还是让双方都变成 0 元。理性地想,接受者哪怕 1 元也该接受(总比 0 好),可现实中“不公平的提案”(20 元以下等)会以高概率被拒绝。人们表现出“为了惩罚而付出成本”的行为,与理性假定相矛盾。

多重均衡问题:许多博弈存在多个纳什均衡,单靠博弈论无法预测会收敛到哪一个。均衡选择问题可用“演化稳定性”“风险占优均衡”“谢林点”等路径部分应对,却没有完整的解决。

共同知识假定:博弈的结构与参与人的理性“被全员知道,且全员知道全员知道,且全员知道全员知道全员知道……”这样无限的共同知识(Common Knowledge)假定,在现实中很难成立。

忽视外部性:在存在对参与人之外影响(外部性)的处境里,博弈论的标准框架不能直接应对。在环境问题、公共品这类外部性很大的问题上,还需要系统思考式的分析。

计算复杂性:在大规模博弈中,纳什均衡的计算可能变成 NP 困难。当博弈论的解在计算上难以实际求出时,理论上的均衡概念未必能成为实践的指针。

结语

本文解读了“博弈论”。

博弈论从冯·诺伊曼与纳什的数学基础起步,发展成了分析静态、动态、完全信息、不完全信息等多样博弈的统一框架。

“分析自己的选择影响对方行动、对方的选择影响自己行动的处境”这个博弈论的基本追问,贯穿着经济学、政治学、生物学与计算机科学。

各概念更详细的解读请见以下文章。

想返回框架一览的读者请点击下方链接。

我们下一篇文章见。

战略思维框架大全——博弈论到系统思考共 14 个zh.senkohome.com/strategic-thinking-list/