大家好,我是 Senko。 本文将解读“纳什均衡”。
它是构成博弈论核心的概念,指的是多位参与人各自力图最大化自身利益的结果,自然抵达的稳定状态。这个结构潜藏在竞争、谈判、协调的一切场面里,被广泛应用于经济学、政治学、生物学乃至军事战略。
博弈论的诞生与纳什的登场
博弈论由 20 世纪的数学家约翰·冯·诺伊曼与奥斯卡·摩根斯坦在 1944 年的著作《博弈论与经济行为》中体系化。不过最初的理论局限于收益总和为零的“零和博弈”,也就是只处理一方之胜直连另一方之败的纯粹竞争处境。
突破这个框架的,是 1928 年出生的约翰·福布斯·纳什。当时还是普林斯顿大学研究生的纳什,1950 年用仅 27 页的论文形式化了包含收益总和不为零的博弈(非零和博弈)在内的一般均衡概念。这就是纳什均衡。
纳什此后患上精神分裂症,与病魔搏斗了三十多年。1994 年获得诺贝尔经济学奖时他已康复,其一生被拍成电影《美丽心灵》(2001 年)。他的成就展示了简化的数学模型可以成为解析现实复杂策略处境的工具,被视为 20 世纪对社会科学影响最大的成果之一。
纳什均衡的定义
定义很简单:“全部参与人在把其他参与人的策略视为给定时,只有自己改变策略也无法改善收益的状态”就是纳什均衡。
换句话说,抵达纳什均衡的参与人单方面改变策略也不会获益,所以谁都没有改变行动的动机。结果这个状态便稳定地持续下去。
要紧的是,纳什均衡并不意味着“对彼此都好的状态”,它只不过是“谁都没有单方面偏离之动机的稳定状态”。这一点在与后面要讲的囚徒困境的关系上,会成为核心问题。
与占优策略的差别
在纳什均衡之前该先理解的概念,是“占优策略”(Dominant Strategy)。
占优策略指的是无论对方采取怎样的策略,对自己而言都总是最优的策略。在囚徒困境里,“坦白(背叛)”就是占优策略。无论对方沉默还是坦白,自己坦白都会让刑期更短。
可许多博弈里并不存在占优策略。即便在那种情况下,也把均衡定义为“彼此都在对对方策略做出最优反应的状态”的,正是纳什均衡。占优策略均衡是纳什均衡的特例。
用支付矩阵寻找纳什均衡
通过用支付矩阵分析二人二策略的博弈,就能理解寻找纳什均衡的方法。
性别之战(Battle of the Sexes)的例子
设有一对情侣必须在不商量的情况下各自决定假日去哪。
- 甲喜欢音乐会(去成了 3 分,橄榄球 1 分)
- 乙喜欢橄榄球(去成了 3 分,音乐会 1 分)
- 两人去了不同地方则双方 0 分
| 乙去音乐会 | 乙去橄榄球 | |
|---|---|---|
| 甲去音乐会 | 甲:3 / 乙:1 | 甲:0 / 乙:0 |
| 甲去橄榄球 | 甲:0 / 乙:0 | 甲:1 / 乙:3 |
纳什均衡有两个:“双方音乐会”与“双方橄榄球”。在任一均衡下,只要有一方单方面变更就会变成 0 分,所以没有偏离的动机。
可是“会抵达哪一个均衡”这个均衡选择问题并没有解决。两人若能事先商量就好办,不能商量时,谢林点(焦点)之类的概念会影响均衡选择。
斗鸡博弈的例子
设两位司机在正面相撞的路线上对开,谁先避让谁就被叫作“胆小鬼(chicken)”。
- 双方都直行则双双撞毁(最糟)
- 只有一方避让,则避让者是“胆小鬼”(吃亏),直行者“有勇气”(占便宜)
- 双方都避让则平局(还行)
| 对方直行 | 对方避让 | |
|---|---|---|
| 自己直行 | −10 / −10 | +3 / −1 |
| 自己避让 | −1 / +3 | 0 / 0 |
纳什均衡是“一方直行、一方避让”这两个。比如在(自己直行、对方避让)的状态下,自己改成避让会从 +3 变成 0 而吃亏,所以没有改变的动机;对方改成直行会从 −1 变成 −10 而更亏,也没有改变的动机。双方都没有偏离动机的状态就是纳什均衡。
这个博弈常被用来给核战争威慑、劳资谈判、国际外交的结构建模。
混合策略均衡
不只是纯粹的选择(向右还是向左、直行还是避让),以概率把策略混起来的“混合策略”下,纳什均衡同样成立。
石头剪刀布的例子
在石头剪刀布里,以各 1/3 的概率出石头、剪刀、布,就是混合策略的纳什均衡。
为什么?如果对方多出石头,自己多出布就更划算。可自己一旦多出布,对方就会多出剪刀。像这样在纯策略均衡不存在时,把概率混起来就能达到均衡。
数学上,混合策略均衡由“对方按均衡概率行动时,自己无论选哪个纯策略期望收益都相同”这个条件来定义。
由纳什的存在定理可知,一切有限博弈(参与人数与策略数有限)都至少存在一个纳什均衡(含混合策略)。这个证明用到了布劳威尔不动点定理这样高深的数学。
在网球发球上的应用
网球发球时,发球方选择往右还是往左打,接球方选择往哪边准备。发球方若集中往右打,接球方也会往右准备;于是发球方往左打就更有利……如此产生循环。
体育经济学的研究表明,实际分析顶尖选手的发球会发现,各方向发球的比例大致接近混合策略均衡的概率。
子博弈完美均衡
纳什均衡定义在“同时行动”(全部参与人同时选择)的博弈上,可现实中“依次行动”(轮流选择)的博弈也很多。这时作为纳什均衡的精炼,“子博弈完美均衡”就变得重要。
逆向归纳法
它是从最后一步反向思考来求均衡的手法。
例:进行两次交易的卖方与买方。在最后(第二次)交易中,卖方不做质量保证在短期看更划算。预见到这一点的买方会拒绝第二次交易,于是连第一次交易也可能一开始就不成立。
这种逆向推理作为“时间一致性”问题,被应用于货币政策、政治承诺、国际条约可信度的讨论。能否事先承诺“事后不改成对自己有利的行动”,会影响均衡的可实现性。
价格竞争与均衡:伯特兰与古诺
产业组织理论中两个著名模型,是纳什均衡的应用例。
伯特兰的价格竞争
当产品同质(完全相同)而两家企业竞争价格时(伯特兰竞争),纳什均衡下双方的价格都会降到与边际成本相等。明明只有两家企业,结果却与完全竞争相同,这就是“伯特兰悖论”。
为什么?对方卖 100 元,自己卖 99 元就能把客人全抢过来;可对方也会降到 99 元。这场竞争一直持续到边际成本。谁涨价谁失去客人,谁降价谁亏本,所以边际成本均衡是稳定的。
古诺的数量竞争
当各家同时决定的不是价格而是“产量”时(古诺竞争),均衡处在比边际成本均衡价格更高(各家利润为正)、又比垄断更便宜的中间点。古诺均衡是“各家把对方产量视为给定、求自家最优产量后得到的均衡”,属于标准的纳什均衡概念。
它常被用来给现实的寡头市场(少数大企业竞争的市场)建模。
军备竞赛:作为囚徒困境的纳什均衡
冷战时期美苏的核军备竞赛,是纳什均衡悲剧性的应用例。
对两国来说,核裁军(合作)会带来最好的结果。可对方裁军时,只有本国扩军就能占据压倒性优势;对方扩军时,本国裁军就会陷入压倒性劣势。两种情况下扩军都是“理性的”。
结果双方抵达都扩军的纳什均衡,而这个状态在经济与安全上都比双方都裁军更糟。现实中人们靠军控条约(SALT、START)这种“制度”尝试跳出这个困境。是重复博弈与“可信的承诺”改变了均衡。
欧佩克与产油国卡特尔
石油输出国组织(OPEC)的产量配额谈判也是纳什均衡的典型例。
成员国全体限产则价格上涨,对全体都有利。可对各国而言,在他国限产之中只有自己增产,利益才最大(背叛接近占优策略)。结果协调容易崩坏,走向过剩生产与价格下跌。
欧佩克运转(协调得以维持)的时候,可以看作是重复博弈带来的制裁威胁、监督机制、以及领导国(沙特阿拉伯)的协调力改变了“均衡”。
多重均衡与均衡选择问题
许多博弈存在多个纳什均衡。仅凭理论很难预测“哪个均衡会实现”,这被称为“均衡选择问题”。
影响均衡选择的因素有以下几种。
谢林点(焦点):因文化与历史而作为“显著选项”被人们自然选中的均衡(另文详述)。
公平规范:带有“公平感”的均衡更受人们偏好。实验经济学中多次确认,比起理论均衡,更公平的分配常被选中。
沟通:若事先能商量,就更容易收敛到特定均衡。不过没有约束力的商量(廉价磋商)能否改变均衡,取决于利益的一致程度。
演化动态:在反复的相互作用中会收敛到哪个均衡,由演化博弈论来分析(参见另文)。
实验经济学揭示的局限
纳什均衡以“理性的参与人”为前提,可实验经济学表明人未必按纳什均衡行事。
最后通牒博弈:把 100 元分给两人。提议者定分配方案,接受者若拒绝则双方 0 元。纳什均衡是“1 元:99 元(提议者拿 99 元)”,可现实中不公平的提案频繁被拒绝。人有着“宁可自己吃亏也要施加惩罚”的倾向。
公共品博弈:在团体向共有资金投资的实验中,与纳什均衡“全员搭便车(投 0 元)”的预测不同,起初许多人会合作性地行动,不过随着反复进行,合作有崩坏的倾向。
这些发现表明,纳什均衡在“社会规范、情感、互惠”较弱的处境里更接近现实,而在这些较强的处境里则需要修正。
用纳什均衡做现实分析的方法
把用纳什均衡分析实际问题的步骤整理如下。
①识别参与人:谁是决策者。梳理企业、国家、个人的组合。
②定义策略空间:明确各参与人可取的选项(连续变量还是离散变量)。
③设定收益:把各策略组合下各参与人所得的利益量化。
④寻找均衡:求各参与人的最优反应函数,找出它们相交的点(均衡)。
⑤评价均衡的性质:是否帕累托有效。是否存在多重均衡。均衡是否稳定(对小扰动是否收敛)。
光是做这套分析,“企业为什么不停降价”“各国为什么不裁军”这类看着像情绪或政治的问题,就能被结构性地理解。
结语
本文解读了“纳什均衡”。
“谁单方面改变策略都不会获益的状态”这个定义乍看简单,可它背后有着多重均衡问题、混合策略、动态博弈中的精炼与实验检验等等深层结构。
尤其重要的视角有两个。一个是“纳什均衡虽然稳定,却未必是好状态”。另一个是“制度、重复与沟通能够改变均衡本身”。现实社会问题中的许多,同时也是“如何从糟糕的纳什均衡里跳出来”这道设计题。
作为相关框架,极小化极大策略与演化博弈论一并阅读会理解得更深。
框架一览与博弈论概论请从下方进入。
我们下一篇文章见。
📚 系列:战略思维框架(3/16)


