大家好,我是 Senko。 本文将解读“检验悖论”。
在一个平均10分钟发一班车的站台,不看时刻表就去等。按常理想,平均等5分钟左右就该到了;可实际上要等得比这久。既不是车晚点,也不是运气差。是测量方式本身就会生出偏斜,而这个机制在日常各处都以同样的形状露脸。
去等平均10分钟一班的车
用一个简单的例子来看。
假设一小时来6班车。平均下来是10分钟一班,但并非精确等间隔,间隔是有起伏的。
比方说这一小时里,间隔依次是 2 分、2 分、2 分、2 分、2 分、50 分。合计60分钟,平均正好10分钟。
现在你不看时刻表,在一个随便的时刻到站。想一想自己会落进哪一段间隔里。
2 分钟的间隔有 5 段,可加起来也只有 10 分钟;而 50 分钟的间隔只有 1 段,却占了这一小时里的 50 分钟。
随便到站的话,约有83%的概率落进那段50分钟的间隔里,短的间隔极少撞上。
把平均等待时间算出来,大约是21分钟。说好10分钟一班的车,却要等两倍以上。
越长的区段越容易撞上
机关出在区段的挑法上。
若把车的间隔一段一段平等地数,平均确实是10分钟。可一旦采用“在随便的时刻到站”这种挑法,区段就不再平等了。
越长的区段,在时间轴上占的面积越大,撞上它的概率也就越高。50分钟的区段比2分钟的区段容易撞上25倍。
这与友谊悖论是完全相同的结构。那边的偏斜是“朋友越多的人,越会反复出现在别人的朋友名单里”;这边的偏斜是“区段越长,越容易被时刻挑中”。
两者都是按样本的大小成比例地更容易被选中,被称作按大小加权的抽样。
另外,若发车间隔毫无起伏、完全等间隔,这个效应就消失了。起伏越大,体感的等待时间越长,是这样一种关系。
等待时间只由起伏决定
刚才用的是极端的例子,其实等待时间能从发车的起伏直接算出来。
把起伏放进式子
设平均间隔为 m、间隔的起伏(方差)为 v,那么平均等待时间是:
(v + m×m)÷(2×m)
起伏为零时,它就是 m÷2,也就是平均间隔的一半。只要按时刻表跑,老老实实的“一半”就是对的。
对于平均10分钟一班的车,只改动起伏,结果如下。
| 发车的状态 | 起伏 | 平均等待时间 |
|---|---|---|
| 完全等间隔 | 0 | 5.0 分 |
| 略有起伏 | 25 | 6.3 分 |
| 完全随机 | 100 | 10.0 分 |
| 极端偏斜(2分×5 与 50分) | 320 | 21.0 分 |
完全随机时,要等的和平均间隔一样长
表里第三行有一点值得留意。车的到达若完全随机(与前一班无关地发生),平均等待时间正好等于平均间隔的10分钟。
不是一半,而是整整一份;而且不管已经等了多久,从那里起还得再等平均10分钟。哪怕已经等了20分钟,剩下的预期也不会减少。
这个性质叫作无记忆性,出现在电话来电、服务器访问这类彼此无关的事件叠加的场面。“该来了吧”这种感觉一次次落空,原来并不是错觉。
大学的班级人数也会出同样的事
再举一个更贴身的例子,常被提到的是课的规模。
假设某所大学宣布“本校平均班级人数为30人”。这个数字并没有撒谎,把所有班的人数加起来除以班数,确实是30人。
可若去问学生“你上的课平均多少人”,回来的数字要大得多。
理由是同一个。200人的大课上坐着200个人,5人的研讨课上只有5个人。以学生为准来数,大课就会被报告出几十倍之多。
校方的数字与学生的实感,两者都是对的,差别只在“数的是班,还是数的是学生”。我想这是读统计时最管用的着眼点。
拥挤与等待的实感为何会错位
弄懂这个结构,生活里的几处别扭就能解释了。
道路空着的时间段其实长得多,可绝大多数司机都经历过堵车。堵的时候路上跑着的车多,这是理所当然的。
餐馆的拥挤也一样。对店家来说冷清的时间更长,可作为顾客上门的人,大半都赶在了热闹的时段。
打听家庭人数的调查若不加处理,也会比实态偏大,因为孩子多的家庭,作为受访者登场的人数也多。
这些都不是谁在撒谎,无非是计数的单位不同,出来的数字就不同。
设计调查的一方要小心的坑
这种偏斜麻烦在于,就算没有恶意也会自己钻进来。列几个常见的形状。
- “用户问卷”:用得越勤的人回答机会越多,容易被汇总成重度用户的声音
- “等待时间的实测”:去问排队的人,等得越久的人越容易在调查期间被逮到
- “平均住院天数”:以在院患者为对象,长期住院的人会被过量收入
- “设备寿命调查”:只查还在运转的个体,短命的早就坏了,不会被选中
- “客户的持续时长”:只查现有签约者,很快就退订的人从数里漏掉了
它们共通的一点是都从“此刻还存在的东西”里取样。持续得越久的东西,在那个瞬间存在的可能性就越高。
三条避坑的做法
对付起来并不难。
第一,先把“什么算作一个”声明清楚。是班还是学生、是机会还是人,只要分开写明,读者的误解就能防掉不少。
第二,以起始时点为准去追踪。住院天数的话,从入院那天起把所有人追下去,偏斜就消失了。统计上把这种思路叫作队列研究。
第三,实在避不开的时候就用权重来校正。既然知道越长的区段越容易被选中,那就乘上与长度成反比的权重重新汇总,便能还原成原本的分布。
这些都不是什么特别的技术。只要养成一开始就确认“这个数字是从什么里取的”的习惯,大半都防得住。
名字的由来与实务上的处理
检验悖论这个叫法,来自品质检验与设备运转时间调查的语境。
想知道某台机器到故障为止的平均时间时,若随手挑某个时点还在运转的机器来查,捡到的就净是“撑得久的个体”;短命的早已坏掉,被选中的机会很少。
医疗领域也有同样的问题。以在院患者为对象去查平均住院天数,长期住院的人会被过量收入,结果比实际偏长。
对付的办法不难,一开始就定下是以个体为单位数,还是以时间或机会为单位数,并把它写明就好。知道这个区分之后,我一见到“平均”这个词,就先确认“把什么算作了一个”。
与概率直觉相悖的悖论
计算本身没错,答案却怎么也和直觉对不上——下面是与此相关的悖论。
结语
本文解读了“检验悖论”。
10分钟一班的车要等20分钟,平均30人的班感觉像100人,原因都在于数的单位在中途被掉了包。两个数字都是对的,只不过量的是不同的东西。
“平均”这个词很有让人自以为懂了的力量,所以这类坑大概还要与我们长久相处下去。
想返回悖论列表的读者请点击下方链接。
我们下一篇文章见。
📚 系列:世界经典悖论(37/81)
读者也常看这些



