大家好,我是 Senko。 本文将解读“辛普森悖论”。
数据的世界里潜藏着可怕的陷阱:把一个群体分成两组来比较,A 更优秀;可合在一起统计,B 反而更优秀——这种事真的会发生。在部分中成立的结论,未必在整体中成立。把这个事实拍在我们面前的,就是辛普森悖论。
用具体例子来看
假设某大学的入学考试引发了“是否存在性别歧视”的争议。
工学院
- 男性:800 人报考,480 人录取(录取率 60%)
- 女性:100 人报考,70 人录取(录取率 70%)
文学院
- 男性:200 人报考,40 人录取(录取率 20%)
- 女性:900 人报考,270 人录取(录取率 30%)
分学院来看,两个学院都是女性的录取率更高。
可是,合计一下……
- 男性总计:1000 人报考,520 人录取(录取率 52%)
- 女性总计:1000 人报考,340 人录取(录取率 34%)
咦?总体上反而是男性的录取率更高。
每个学院里都是女性更优秀,总体却是男性领先。数字没有说谎,结论却发生了逆转。这就是辛普森悖论。
逆转为什么会发生
机关藏在“报考者的分布”里。
在上面的例子中,男性大量报考录取率高的工学院(800 人),女性则大量报考录取率低的文学院(900 人)。
也就是说,男性集中在“容易考上的学院”,女性集中在“难考上的学院”。即使在每个学院内部女性都更优秀,总体录取率仍会被“报考了哪个学院”这一分布偏差大幅左右。
这种第三方因素(本例中是学院的选择)称为“混杂变量”。无视混杂变量、把整体简单合计,辛普森悖论就会现身。
真实发生过的案例
辛普森悖论绝非纸上谈兵,现实中出过不少问题。
1973 年加州大学伯克利分校的招生中,总体录取率男性 44%、女性 35%,被怀疑存在性别歧视。可按院系逐一分析后发现,绝大多数院系里女性的录取率与男性持平甚至更高。
原因在于,女性更倾向于报考录取率低、竞争激烈的院系。作为历史上的真实案例,它经常出现在统计学教科书里。
数据分析的教训
辛普森悖论给出的最重要教训是:数据的汇总层级不同,结论可能不同。
只看总体数字下判断,可能得出与真相截然相反的结论。但也不是分得越细越好——分割过细会让样本量太小,统计上失去可信度,这是另一个问题。
关键是时刻带着疑问:“这份数据里是否藏着混杂变量?”尤其在商业决策和政策判断中使用数据时,对简单汇总的结果照单全收是危险的。
在医疗领域,评估某种疗法的效果时辛普森悖论频频作祟。如果重症和轻症患者在疗法分配上存在偏差,总体统计中疗效可能看起来正好相反。这也是随机对照试验(RCT)被奉为医学研究金标准的原因之一。
该把群体分开,还是合起来
辛普森悖论最让人为难的,是分开算才对还是合起来算才对,光靠数据定不下来。
从同一串数字里,分开算得出A占优,合起来算得出B占优。两边作为计算都正确,所以在统计的内部分不出胜负。
作判断的材料,是因果的先后。
| 用来分组的变量所处的位置 | 例子 | 该看哪一边 |
|---|---|---|
| 在处置之前 | 患者的年龄、病情的轻重 | 看分开之后的结果 |
| 在处置之后 | 治疗所引发的副作用 | 看合起来的结果 |
| 与处置无关 | 患者的编号 | 看哪边都一样 |
看治疗效果时,患者的病情轻重在接受治疗之前就定了。病情越重的人越会被选去用强力的治疗,所以不分组去比,强力治疗就显得吃亏。这种情况下,分开看才是对的。
反过来,若拿治疗所引发的副作用去分组,那就等于把治疗效果的一部分抵消掉再看。这种情况下就不能分。
真的闹到打官司的例子
有名的是1973年加州大学伯克利分校的录取数据。
整体上男性录取率44%、女性35%,被怀疑存在性别歧视。可按院系分开来看,多数院系反而是女性的录取率更高。
机关在于报考去向的分布不同:女性大量报考录取率低的热门难考院系,男性则大量报考录取率高的院系。
- 整体来看:男性显得占优
- 按院系来看:女性略占优
- 实际发生的事:各院系的选拔并无偏袒,是报考去向的分布不同
在这个案例里,院系是在报考阶段由本人选的,处在处置之前,所以分开看更接近实况。
光盯着数字,是得不出哪边对的。教训是:得先想清楚“什么在影响什么”。我自己在分析之前也会先确认这个先后。
名字定下来的经过
它挂着辛普森的名字,可最先指出这个现象的并不是他。
- 卡尔·皮尔逊(1899年):报告过把群体混起来相关就会变的例子
- 尤尔(1903年):用列联表整理了同样的现象
- 爱德华·辛普森(1951年):在论文中作了体系性处理,名字就此定下
- 科林·布莱斯(1972年):把“辛普森悖论”这个称呼传开
因此它有时也被称作“尤尔-辛普森效应”。
辛普森本人并没有把这个现象叫作“悖论”,因为数学上什么也没矛盾。他的立场是:计算全都正确,吃惊的只有人的直觉。
即便叫法定下来之后,统计学家之间有时仍更偏好“逆转现象”这个中立的说法。
合并平均时的陷阱
这个现象的数学真身,在于把权重不同的平均简单相加了。
分母的大小按组而异时,整体的比率就会被人数多的组拖着走。就算在各组里都更优秀,只要优秀那一组的人数少,整体上也会输。
基本的注意点是:比率与比率之间不能相加,也不能求平均。
- 正确的处理:分子与分母各自相加之后再相除
- 不可以的处理:把各组的比率简单平均
- 比较时:把各组人数的偏斜对齐,或者干脆分着组比
命中率、开工率、达成率。处理分母会动的指标时,光是把这点放在心上,事故就能少很多。
违背概率直觉的相关悖论
以下是与辛普森悖论同样、数字的样子背叛直觉的相关悖论。
结语
本文解读了“辛普森悖论”。
统计用对了是强大的工具,用错了则会变成导出反向结论的凶器。看数据时,养成停下来想一想“这种汇总方式真的对吗”的习惯非常重要。
想返回悖论列表的读者请点击下方链接。
我们下一篇文章见。
📚 系列:世界经典悖论(31/81)
读者也常看这些



