大家好,我是 Senko。 本文将解读潜伏在数字世界里的奇妙规律“本福特定律”。
世上充斥着各种数字,比如河流的长度、国家的人口、股价、电费、建筑的高度。若把注意力放到这些数字最左边那一位(首位数字)上,会发现一个惊人的偏斜。看上去 1 到 9 应该均匀分散才对,可实际上首位是“1”的数字压倒性地多,约占 30%,而首位是“9”的连 5% 都不到。这个反直觉的现象就是本福特定律,而它竟然还被实际用作识破会计舞弊与选举舞弊的工具。
什么是本福特定律
本福特定律(英文 Benford’s law)是这样一条统计规律:“在自然界与社会中出现的许多数值数据里,首位数字为‘1’的概率最高,而数字越大,出现在首位的概率越低。”它也被称为“首位数字定律”。
看看具体数字,你会为这份偏斜之大而吃惊。在许多数据里,首位数字出现的概率大致如下。
| 首位数字 | 出现概率 |
|---|---|
| 1 | 约 30.1% |
| 2 | 约 17.6% |
| 3 | 约 12.5% |
| 4 | 约 9.7% |
| 5 | 约 7.9% |
| 6 到 9 | 合计约 22% |
光是首位为 1 和 2 的数字,就占了整体的将近一半(约 48%)。若 1 到 9 均等,每个该占约 11%,可见这个偏斜相当大。而且不可思议的是,无论河流长度、人口、物理常数,还是许多公司的会计数据,这份偏斜都共通地出现。把单位从米换成英里、把货币从元换成美元,这个分布依然保持。简直像是数字世界里藏着一张自然的设计图。
为什么“1”这么多
这份偏斜是怎么产生的?用“数在增长的样子”来想,直观的理由就好懂了。
比方说,请想象你的存款从 100 万开始一点点往上涨。要从 100 万这一档(首位是 1)走到 200 万这一档(首位是 2),你得把钱翻一倍涨到 200 万。可从 900 万这一档(首位是 9)走到 1000 万这一档(首位又是 1),只要从 900 万涨到 1000 万,也就多一成左右。
也就是说,首位为“1”的区间(100 万到 200 万)很宽,会在里面待很久;而首位为“9”的区间(900 万到 1000 万)很窄,一晃就穿过去了。在数字按倍数成长的世界里,首位越小的区间,停留的时间越长。所以在某个瞬间去观察数字,首位是 1 的概率就最高。
这背后是对数这门数学。本福特定律准确地说是指出首位数字的概率由对数决定。听着也许有点难,但要点只有一条:“在按比例成长的世界里,小的数字占据着更宽的区间。”只要抓住这份直觉,为什么 1 这么多就说得通了。许多自然现象与经济活动都具有“按一定比例增减”的性质,所以这条定律才广泛成立。
识破做假账的“数字指纹”
本福特定律出名的最大理由,是它作为识破舞弊的工具真的管用。这是它最实用、也稍微有点惊险的一面。
原理是这样:老老实实记录的真实会计数据,其首位数字会按本福特定律分布。可一旦由人去编造数字,就会偏离这个自然分布。人在编造虚构金额时,会无意识地想把各个数字用得均匀,或者多用 5、6 这类不上不下的数。要人为再现“1 占三成”这份自然偏斜,出乎意料地难。
于是,把企业的会计数据或税务申报的数字收集起来考察首位分布,若明显偏离本福特定律,就可判断“有数字被操纵的嫌疑”。实际上,会计审计、税务稽查、做假账的查处中都在使用这套手法。它还被应用到选举得票数、经济统计注水的验证上,起着“数字指纹”般的作用,用来分辨数据是自然产生的,还是人手造出来的。纯数学的规律成了揭发舞弊的侦探工具,这份出人意料的实用性,我觉得正是本福特定律招人喜爱的理由。
它并不适用于任何数字
为了正确理解这条定律,我们也要把不适用的情形好好按住。本福特定律并非万能。
它适用得好的,是数字分散在很宽范围内、自然产生的数据:从几十到几百万、混着各种位数的那种,比如人口、金额、面积、物理数据等。
而对下面这类数据就不适用。首先是范围很窄、集中在固定位数上的数据。比如成年人的身高多数落在 150 到 190 厘米之间,首位确实会偏向 1,但那与本福特定律是另一种偏法。其次是由人有意分配的号码:电话号码、工号、邮政编码等并非自然产生的数字,而是按既定规则编下去的,因此不服从这条定律。不具有“按比例成长”性质的数据,定律就不成立。
理解这个“适用条件”,在实务中使用这条定律时非常重要。什么数据都想拿本福特定律去判舞弊,就会把本来就不适用的数据误判成“有舞弊”。与一切经验法则一样,只有知道它在哪里成立、在哪里不成立,才能把它当工具用对。这与本站在海因里希法则里讲的“别把数字囫囵吞下”,也是同一份要紧的姿态。
围绕本福特定律的几个疑问
是谁发现的
名字来自物理学家弗兰克·本福特,可他并不是最早的发现者。其实早在半个多世纪前的 1881 年,天文学家西蒙·纽康就注意到了同样的现象。他留意到对数表(计算用的数值书)中靠前的那些页(以 1 开头的数字部分)被手汗磨得更脏更破,从“人们查以 1 开头之数字的次数更多”这个观察抵达了这条定律。后来在 1938 年,本福特用大量实际数据加以佐证并推广,于是冠上了他的名字。把名字冠给并非最早发现者的人在科学界屡见不鲜,这件事本身也算一段有趣的轶闻。
日常生活中能自己验证吗
很容易。把手边的数字收集起来,数一数首位就行。推荐用报刊上登的数字(人口、金额、面积等)、记账本上的金额,或者新闻里出现的统计数据。收集到一定数量(几十个以上)再数首位,你就会发现以 1 开头的数字比以 9 开头的多得多。尤其是位数散得比较开的数据,定律会显现得很干净。能靠自己的手发现藏在数字世界里的奇妙规律,我觉得这是个能轻松体验数学之趣的好玩法。
舞弊的人为什么再现不出这条定律
因为人的直觉与自然的数字分布是错开的。我们在编“随便的数字”时,有无意识地想把各个数字用得均匀的癖好:越想显得随机,反而越不自然地均匀。这与本站解读过的赌徒谬误里“人造的随机序列比真正的随机更规矩”是同一种心理。要有意再现“1 竟然要用到三成”这份真实的偏斜,是非常难的。所以本福特定律在识别舞弊上才有效。人没有自己以为的那么擅长伪造“自然”,这个事实撑起了那枚数字指纹。
相关的定律与偏差
以下是处理人造随机之不自然处的“赌徒谬误”、直觉被数字背叛的“生日悖论”,以及追踪数字规律的未解决问题“黎曼猜想”。
结语
本文解读了“本福特定律”。
世上的数字里,首位是“1”的约占 30%、为最多,而数字越大越不容易占到首位。这份反直觉的偏斜,出自对数的性质:“在按比例成长的世界里,小的数字占据着更宽的区间。”而纯数学的规律竟能作为揭发会计与选举舞弊的“数字指纹”真派上用场,这正是这条定律痛快的地方。
不过它并不适用于任何数字。知道定律成立的条件,才谈得上用对,这是一切经验法则共通的铁律。下次在报纸或新闻上看到一列数字时,请数数它们的首位。1 多得出乎意料这个发现,会让你切身感到:看惯了的数字世界,其实被一种奇妙的秩序支配着。
想返回定律列表的读者请点击下方链接。
我们下一篇文章见。
📚 系列:著名法则大全(20/25)


