大家好,我是 Senko。 本文将解读“辛普森悖论”。
数据的世界里潜藏着可怕的陷阱:把一个群体分成两组来比较,A 更优秀;可合在一起统计,B 反而更优秀——这种事真的会发生。在部分中成立的结论,未必在整体中成立。把这个事实拍在我们面前的,就是辛普森悖论。
用具体例子来看
假设某大学的入学考试引发了“是否存在性别歧视”的争议。
工学院
- 男性:800 人报考,480 人录取(录取率 60%)
- 女性:100 人报考,70 人录取(录取率 70%)
文学院
- 男性:200 人报考,40 人录取(录取率 20%)
- 女性:900 人报考,270 人录取(录取率 30%)
分学院来看,两个学院都是女性的录取率更高。
可是,合计一下……
- 男性总计:1000 人报考,520 人录取(录取率 52%)
- 女性总计:1000 人报考,340 人录取(录取率 34%)
咦?总体上反而是男性的录取率更高。
每个学院里都是女性更优秀,总体却是男性领先。数字没有说谎,结论却发生了逆转。这就是辛普森悖论。
逆转为什么会发生
机关藏在“报考者的分布”里。
在上面的例子中,男性大量报考录取率高的工学院(800 人),女性则大量报考录取率低的文学院(900 人)。
也就是说,男性集中在“容易考上的学院”,女性集中在“难考上的学院”。即使在每个学院内部女性都更优秀,总体录取率仍会被“报考了哪个学院”这一分布偏差大幅左右。
这种第三方因素(本例中是学院的选择)称为“混杂变量”。无视混杂变量、把整体简单合计,辛普森悖论就会现身。
真实发生过的案例
辛普森悖论绝非纸上谈兵,现实中出过不少问题。
1973 年加州大学伯克利分校的招生中,总体录取率男性 44%、女性 35%,被怀疑存在性别歧视。可按院系逐一分析后发现,绝大多数院系里女性的录取率与男性持平甚至更高。
原因在于,女性更倾向于报考录取率低、竞争激烈的院系。作为历史上的真实案例,它经常出现在统计学教科书里。
数据分析的教训
辛普森悖论给出的最重要教训是:数据的汇总层级不同,结论可能不同。
只看总体数字下判断,可能得出与真相截然相反的结论。但也不是分得越细越好——分割过细会让样本量太小,统计上失去可信度,这是另一个问题。
关键是时刻带着疑问:“这份数据里是否藏着混杂变量?”尤其在商业决策和政策判断中使用数据时,对简单汇总的结果照单全收是危险的。
在医疗领域,评估某种疗法的效果时辛普森悖论频频作祟。如果重症和轻症患者在疗法分配上存在偏差,总体统计中疗效可能看起来正好相反。这也是随机对照试验(RCT)被奉为医学研究金标准的原因之一。
结语
本文解读了“辛普森悖论”。
统计用对了是强大的工具,用错了则会变成导出反向结论的凶器。看数据时,养成停下来想一想“这种汇总方式真的对吗”的习惯非常重要。
想返回悖论列表的读者请点击下方链接。
我们下一篇文章见。
📚 系列:世界经典悖论(24/57)