大家好,我是 Senko。 本文将解读“基础比率谬误”。
有这么一个人:“内向、一丝不苟。爱好是读书和数学谜题,比起与人交谈更喜欢摆弄机器”。你觉得这人的职业是图书馆管理员,还是销售?多数人脱口而出“管理员”。可做销售工作的人,比图书馆管理员多出好几百倍。人物形象再像管理员,人头数量的差距也会轻松把它顶回去。这种忽视“人头”的癖好,就是基础比率谬误。
什么是基础比率谬误
基础比率谬误(英文 base rate neglect)指的是无视“在整体中原本占多大比例”这一先验信息(基础比率),只凭眼前个别的特征与印象来判断概率的倾向。
基础比率就是下面这类“地基上的数字”。
- 销售人员与图书馆管理员的人数之比
- 某种病的患病率(比如万分之一)
- 创业公司的存活率
- 某职业中的男女比例
理性的概率判断,应当在基础比率这块地基之上,再叠加个别证据来做(统计学上叫贝叶斯推断)。可人的直觉一旦找到个别证据、尤其是“像那么回事”的特征,就会瞬间忘掉地基的存在。
律师与工程师实验
用实验展示基础比率谬误的经典,是卡尼曼与特沃斯基 1973 年发表的“律师与工程师问题”。
参与者被告知:“这里有 100 份人物简介,其中 70 位是律师,30 位是工程师。现在随机抽出一份”,然后读到这样一段简介。
杰克,45 岁男性,已婚,有四个孩子。保守而谨慎,有野心。对政治和社会议题不感兴趣,闲暇时间大多花在木工、帆船和数学谜题上。
“你觉得杰克是工程师的概率是百分之几?”
多数参与者答 90% 上下,因为这段简介实在“太像工程师了”。可这一叠简介里工程师只占 30%。即便要把“像不像”纳入考量,也该从 30% 这个起点(基础比率)出发,可回答几乎完全无视了基础比率,只由印象决定。
最具决定性的是下面这个对比:告知“律师 70 人、工程师 30 人”的一组,与告知比例相反(律师 30 人、工程师 70 人)的一组,回答几乎没有差别。“像那么回事的描述”一出现,七比三这个地基数字就从判断中消失了。卡尼曼等人把这种按“相似程度”判断概率的机制,命名为“代表性启发”。杰克的描述越接近“工程师的典型形象”,人就越觉得概率高。
更有意思的是,把简介换成“毫无提示价值的空洞描述”,参与者仍然回答五五开。什么信息都没有时本该按基础比率作答,可连无意义的信息都能把基础比率赶出去。
出租车问题:目击证词能信到什么程度
能把基础比率的威力再体会深一层的,是卡尼曼等人同样用过的“出租车问题”。
某城市的出租车中,85% 属于绿色公司,15% 属于蓝色公司。某夜发生一起肇事逃逸,目击者证称“是蓝色出租车”。对目击者的辨色能力做测试后发现,在夜间条件下他有 80% 能正确识别,20% 会认错。那么,肇事的真是蓝色出租车的概率是多少?
直觉想答“目击者有 80% 准确,那大概就 80%”。可把基础比率算进去,答案会大变。
用 100 辆车来想。
- 蓝车 15 辆。目击者会把其中 80%,也就是 12 辆正确说成“蓝”
- 绿车 85 辆。目击者会把其中 20%,也就是 17 辆错误说成“蓝”
出现“是蓝色”这一证词的情形合计 29 辆,其中真正是蓝车的只有 12 辆。也就是说,证词正确的概率是 12÷29,约 41%——别说 80%,连一半都不到。
因为蓝车本来就少,“把绿车看成蓝车”的绝对数量压过了“正确看见蓝车”的数量,这就是基础比率的力量。准确率 80% 的证词,只要基础比率偏斜就会被轻易掀翻。这个结构与本站的“假阳性悖论”(精度 99% 的检查呈阳性也未必有病)完全相同,那一篇可以说是基础比率谬误的医疗版。
上网自诊、招聘、侧写
上网搜索症状是基础比率谬误的当代高发地。一搜头痛,列出来的全是重病的名字。自己的症状与文章里的症状清单“对得上”,就觉得得那个病的概率很高。可普通头痛与重大疾病之间,基础比率相差好几个数量级。症状上的“像”是对上了,概率的地基却完全不同。医生“先从常见病怀疑起”,正是忠实于基础比率、在统计上正确的姿态。
招聘与人物评价上也起作用。面试中“回答得挺优秀”这份代表性,会覆盖“这个履历层里实际做出成绩的人占多大比例”这个基础比率。这也是容易与光环效应、刻板印象合流的场合。
对罕见成功故事的憧憬同理。“大学退学创业大获成功”这个故事的“像那么回事”,与退学创业者成功的基础比率毫无关系。幸存者偏差那篇里写的“看分母”,其实就是确认基础比率的行为。
侧写与偏见的问题也与之相连。“凶手应该是这样一个人”这种基于代表性的推论,一旦无视了母体中符合这个形象的无辜者有几万人这一基础比率,就会成为冤案的温床。
对策是用“一万人的村子”来数
对付基础比率谬误,最实用的是用“自然频数”来思考:别用百分比,翻译成“一万个人里有几个”这样的人头数。
正如出租车问题所示,只要改成“100 辆里有……”这样按人头重数一遍,即便不懂贝叶斯定理也能抵达正确答案。据心理学家吉仁泽的研究,同一个问题改用自然频数呈现,医生与普通人的正确率都会大幅提高。人脑不擅长“百分比的乘法”,却应付得了“人头的点数”。
日常的检查清单是这样的。
- 觉得“挺像的”时,先问“这事本来是多少人里出一个?”
- 在扑向罕见的可能性(重病、大成功、阴谋)之前,先与“平淡的解释”的基础比率做比较
- 新闻里“某某的概率翻倍”这种表述,翻译成“从多少人里一个,变成了多少人里一个”(翻倍也可能只是十万分之一变成十万分之二)
- 看到检查或判定的命中率,想起出租车问题,去数“假阳性的绝对数”
与假阳性悖论的关系及防范
它和假阳性悖论是什么关系
是同一现象的不同切口。假阳性悖论(精度 99% 的检查呈阳性,若患病率低则实际患病概率只有百分之几)可以说是基础比率谬误发生在医疗检查语境下的名字。本文的律师与工程师问题、出租车问题,则是不限于检查的一般形态。数学上的计算过程在假阳性悖论那篇里有详解,想用数字追一遍“99% 为何会被掀翻”的读者可以去看。机制是相同的:当基础比率偏斜时,少数派一侧的“看错”在绝对数上压倒了真货。
不懂贝叶斯定理就防不住吗
不,好消息正在这里。正文介绍的自然频数,也就是“在一万人的村子里数”的方法,不用公式也能得到与贝叶斯推断相同的答案。步骤只有三步:① 把整体设为一万人(或一百人);② 按基础比率分成“符合的人/不符合的人”;③ 分别数出“证据成立的人数”,取比值。出租车问题的计算正是如此。比起背公式,养成“看到百分比就换算成人头”的反射,在实际生活中管用得多。
如果刻板印象在统计上是成立的呢
这是个敏感但重要的问题。先做个梳理:基于代表性之推论的错误,不在于“使用群体的倾向”本身,而在于无视基础比率,以及用群体的平均去断定个人。某个倾向即便在统计上真实存在,也不保证眼前这一个人会遵从它;尤其在招聘、授信、司法这类左右个人一生的判断中,用群体统计去裁决个人,其公正性本身就要受质疑(正因如此,许多国家都不问统计上是否成立,直接对基于属性的歧视性判断加以规制)。统计用于“群体的政策”,“个人的判断”则依据本人的实绩与行为——我认为这条界线,才是让统计素养与公正得以两全的现实答案。
相关的认知偏差
以下是本文的医疗版“假阳性悖论”、在不看分母这一结构上相通的“幸存者偏差”,以及同属印象覆盖概率一族的“可得性启发”。
结语
本文解读了“基础比率谬误”。
在“像工程师”的简介面前,七比三这个数字消失了;准确率 80% 的目击证词,在基础比率面前缩水到了 41%。“像那么回事”发出的光,强到足以把统计的地基抹掉。
看到百分比,就回到一万人的村子里重数一遍;遇到像那么回事的说法,先确认“这本来是多少人里一个的事”。我认为,从上网自诊到投资推销,这一道功夫是在当代“像那么回事的信息”洪水中活下去的、性价比最高的护具。
想返回认知偏差列表的读者请点击下方链接。
我们下一篇文章见。
📚 系列:认知偏差大全(25/26)


