战略思维

演化博弈论——合作为何演化,一报还一报为何强

演化博弈论——合作为何演化,一报还一报为何强

大家好,我是 Senko。 本文将解读“演化博弈论”

它是用博弈论的框架分析生物演化、社会规范形成与人类合作行为的学问。它与通常的博弈论根本不同之处在于,评价策略的“好坏”不靠固定标准,而是把它当作与其他策略相互作用的结果

博弈论——对策略性相互依存的数学分析zh.senkohome.com/strategic-thinking-game-theory/

图解

演化博弈论的诞生

演化博弈论由生物学家约翰·梅纳德·史密斯与数学家乔治·普赖斯在 1970 年代提出。他们的目的,是用“个体会按最大化基因利益的方式行动”这个自然选择框架,去解释动物的攻击行为、领地争夺与合作行为等行为模式。

在 1973 年的论文《动物斗争的逻辑》中,梅纳德·史密斯引入了“演化稳定策略(ESS)”的概念,把生物种群中能稳定维持的策略之条件数学地形式化了。

此后,罗伯特·阿克塞尔罗德关于合作演化的研究(1984 年《合作的进化》)让演化博弈论越出生物学,扩展到政治学、经济学、社会学与计算机科学。

与通常博弈论的差别

通常的博弈论设定理性的人会最大化自身收益这个前提。相对地,演化博弈论在以下几点上不同。

摘掉理性假定:参与人不必非得理性计算后行动。遗传上被编程的行为模式(本能、习惯、模仿)也可以。

分析群体动态:分析的不是单个参与人的最优策略,而是策略在整个群体中的分布如何变化。

用适应度(Fitness)评价:策略的好坏不按“收益的大小”,而按“持有该策略的个体在群体内是增是减(适应度)”来评价。

动态的均衡概念:在纳什均衡这类静态均衡概念之外,还做动态分析,看群体从任何初始状态出发会收敛到怎样的均衡。

纳什均衡——谁也不想改变策略的均衡状态zh.senkohome.com/strategic-thinking-nash-equilibrium/

阿克塞尔罗德的锦标赛

演化博弈论最著名的实验,是政治学家罗伯特·阿克塞尔罗德在 1980 年代举办的“重复囚徒困境计算机大赛”

在一次性的囚徒困境里双方背叛是纳什均衡,可与同一对手反复对局时情况就不同了。会产生顾及对方将来如何行动的“未来之影”,长期合作便有可能成立。

阿克塞尔罗德请全世界的经济学家、心理学家与数学家提交程序,让全部策略循环赛式地进行重复囚徒困境对局。

第 1 届大赛:14 个策略参赛。仅由两行构成、最为简单的策略“一报还一报(Tit for Tat)”夺冠。

第 2 届大赛:在公开第 1 届结果之后有 62 个策略参赛,一报还一报再度取得最好成绩。

一报还一报策略的结构

“一报还一报(Tit for Tat)”策略只由两条规则构成。

  1. 第一局必定合作(友善开局)
  2. 此后照搬对方上一次的做法(对合作报以合作,对背叛报以背叛)

就这些。尽管如此简单,一报还一报却在与各种对手的综合成绩上最优,阿克塞尔罗德从四条性质来解释原因。

友善(Nice):不主动先背叛。先示以合作,就创造出彼此合作、拿到高收益的机会。

报复性(Retaliatory):对背叛立刻报复。不会零成本地接受盘剥,从而防止被单方面持续利用。

原谅得快(Forgiving):对方一回到合作,自己也立即回到合作。这维持了长期关系,防止报复的连锁(C→D→D→D→…这样没完没了的互相背叛)。

清晰易懂(Clear):它是对方容易预测自己行动的透明规则。只要对方明白“合作就会换来合作”“背叛就会遭到报复”,合作便更容易产生。

这些性质的组合,生出了既能与“协作型策略”也能与“盘剥型策略”周旋的鲁棒性。

一报还一报的局限与发展

一报还一报并非万能,已知有若干弱点。

对误解的脆弱:一旦出现通信噪声(非本意的背叛),一报还一报彼此之间就会陷入报复的连锁(背叛→背叛→背叛→…)。

克服这个弱点的策略是“宽容的一报还一报”(Generous Tit for Tat)。对方背叛时,以一定概率(比如 10~30%)原谅它并随机地合作。在有噪声的环境里,它往往比一报还一报成绩更好。

更进一步的Win-Stay, Lose-Shift(“巴甫洛夫策略”),是上次结果好就继续同样行动、结果差就改变行动的策略。在有噪声环境的模拟中,已表明巴甫洛夫策略优于一报还一报。

在以“用计算机模拟找出优于一报还一报之策略”为目的的近期研究中,已知用机器学习设计的策略在特定条件下表现压倒性。不过在“对各种对手都鲁棒”这一综合实力上,简单的一报还一报系策略依然强力。

演化稳定策略(ESS)

演化博弈论的中心概念,是“演化稳定策略”(ESS: Evolutionarily Stable Strategy)。

ESS 的形式定义:当群体几乎全员使用策略 I 时,若稀有的变异体想用策略 J 入侵,而策略 I 拥有比策略 J 更高的适应度(Fitness)、变异体无法增多,那么策略 I 就是 ESS。

数学上由以下条件表示:

  1. u(I,I) > u(J,I)(在 I 的群体中 I 比 J 收益更高),或者
  2. u(I,I) = u(J,I) 且 u(I,J) > u(J,J)(即便收益相等,I 也能挡住 J 的入侵)

这里 u(A,B) 是 A 在 B 群体中获得的收益。

ESS 是纳什均衡的一种,但反过来不成立。所有 ESS 都是纳什均衡,可并非所有纳什均衡都是 ESS。

在一次性的囚徒困境里,“全员背叛”的状态是 ESS。因为哪怕进来一个合作策略,它也只会被背叛策略盘剥而无法增多。

鹰鸽博弈与混合 ESS

演化博弈论的代表模型是“鹰鸽博弈(Hawk-Dove Game)”

在争夺资源(价值 V)的斗争中,有两种策略:

  • 鹰(Hawk):积极争斗,对方不退就开打。战斗要花费成本 C。
  • 鸽(Dove):回避争斗,对方是鹰就退让。

对局结果(V=6、C=10 时):

与鹰对局与鸽对局
用鹰(V−C)/2 = −2V = 6
用鸽0(退让)V/2 = 3

在全员是鹰的群体里,鹰与鹰相争平均收益 −2。进来一个鸽,它与鹰相遇得 0,高于鹰群的平均(−2),于是鸽会增多。

在全员是鸽的群体里,鸽与鸽分享资源得 3。进来一个鹰,它与鸽对局得 6,高于鸽群的平均(3),于是鹰会增多。

两种纯策略都不是 ESS,成立的均衡是鹰与鸽混杂的混合 ESS(鹰的比例 p = V/C)。在这个例子里,以 V/C = 6/10 = 60% 的概率用鹰的混合策略就是 ESS。

它被广泛用来解释现实生态系统中攻击性个体与非攻击性个体按一定比例共存的现象(如领地争夺中“示威行为”的演化)。

复制动态

作为演化博弈论的动态框架,有“复制动态(Replicator Dynamics)”

这个方程描述“群体内各策略的比例随时间如何变化”。

策略 i 的比例变化率 =(策略 i 的适应度 − 群体整体的平均适应度)× 策略 i 当前的比例

也就是说,原理很单纯:适应度高于平均的策略增多,低于平均的减少

复制动态最初被形式化为数理生物学的连续时间模型,在经济学与社会科学的应用中也扮演着重要角色。

ESS 可被刻画为复制动态的稳定平衡点。从任何初始状态出发都会收敛的 ESS 称为“全局稳定”,只在局部稳定的称为“局部稳定”。

合作演化的条件

从阿克塞尔罗德的实验与演化博弈论中,合作得以演化与维持的条件已经明确了若干。

未来之影(Shadow of the Future):今后与对方长期打交道的可能性越高,合作越容易维持。重复博弈的贴现因子 δ 较高(预期关系长久)时,合作就可能成为纳什均衡(无名氏定理)。

声誉机制:即便没有一对一的重复,只要有声誉(过去行为记录被他人知晓的机制),合作也能演化。这套被称为“间接互惠”的机制,是人类社会中声誉、信用与社会制裁的演化性根据。

群体的结构化:比起随机对局,若存在合作者聚在一起的群体结构(空间上、社会上的聚类),合作更容易演化,因为合作者不易被盘剥者包围。

惩罚(有成本的惩罚):若存在惩罚不合作个体的激励(“利他惩罚(Altruistic Punishment)”),就能排除不合作者以维持合作。不过若没有对“不惩罚”的惩罚(二阶惩罚),就会产生由谁来当惩罚者的问题(搭便车问题的二阶形态)。

绿胡子效应:若存在识别合作者的可信信号(像“绿胡子”那样的标记),合作者之间就能选择性地互动,合作也更容易演化。

对人类合作的演化性解释

演化博弈论为“人类这个物种为何会有如此大规模的合作”这个谜提供了理论基础。

与蚂蚁、蜜蜂等社会性昆虫不同,人类会与毫无血缘的他者大规模合作。演化生物学中,对这一现象的解释有以下几种假说在竞争。

亲缘选择(汉密尔顿的 r×B>C 法则):对血亲的利他行为会增加该基因的复制,因此利他行为本身能“自私地”演化。它难以适用于与遗传距离遥远之人的合作。

互惠利他主义(特里弗斯):期待将来回报的合作。只要有重复对局与声誉机制就能演化。

文化群体选择:拥有合作规范的群体在与不合作群体的竞争中胜出,合作规范便传开。关于是个体选择还是群体选择的理论争论仍在继续。

大规模合作之谜:阿克塞尔罗德的模型对小群体的反复博弈有效,可要解释匿名大都市社会中的合作(对陌生人的礼节、对公共品的贡献),还需要额外的机制(强互惠、惩罚威慑、制度强制)。

在商业与组织上的应用

演化博弈论的想法也能用于商业与组织设计。

行业的竞争动态:可用鹰鸽博弈的逻辑,分析行业内竞争型企业与协调型企业的比例如何变动。价格战(鹰策略)一旦激化,行业整体利润下滑,协调(鸽策略)便更容易成立。

公司内规则与文化的设计:职场中的合作行为同样遵循重复博弈的逻辑。声誉机制(360 度评价、公司内社区)与惩罚(对不合作者的声誉下降),是把合作作为 ESS 固定下来的机制。

开源社区:素不相识的开发者协作做出软件的开源机制,是声誉(GitHub 的贡献记录)、相互依赖(自己也用他人的代码)与间接互惠共同起作用、演化上稳定的合作案例。

结语

本文解读了“演化博弈论”。

演化博弈论不同于从博弈规则出发求均衡的通常博弈论,它从“许多个体各试某种策略,好的策略传开”这一动态出发去预测均衡。这个视角在分析无法以理性为前提的生物、社会与组织时尤其有效。

一报还一报所展示的“友善、报复、原谅得快、清晰易懂”这些特性,对于建立基于信任的长期关系,在今天依然给出实践性的提示。

框架一览与博弈论概论请从下方进入。

我们下一篇文章见。