著名法则

齐普夫定律——第二名是第一名的一半,第三名是三分之一

齐普夫定律——第二名是第一名的一半,第三名是三分之一

大家好,我是 Senko。 本文将解读潜伏在语言与世间数字里的奇妙规律“齐普夫定律”

把一篇文章里出现的词按使用次数从多到少排开,会浮出一条漂亮得惊人的规律:以最常用的词为基准,第二名约是它的一半,第三名约是三分之一,第四名约是四分之一,排名越往下,出现次数就越工整地递减。也就是说,把“排名”与“出现次数”相乘,得到的值大致相同。这就是齐普夫定律。而且这条规律不止出现在语言里,城市人口、收入分布等世间各处都能看到它的脸。本文介绍它的趣味所在,以及它为何如此。

图解

什么是齐普夫定律

齐普夫定律(英文 Zipf’s law)是这样一条经验法则:“把一批事物按频率从高到低排开时,其频率与排名成反比。”它最初由美国语言学家乔治·齐普夫在考察语言使用方式时发现。

“成反比”换成具体的话就是:第二名以第一名约二分之一的频率出现,第三名约三分之一,第十名约十分之一。换个说法,把“排名”乘上“频率”,无论第几名,得数都差不多。第一名的频率若是 1000,第二名约 500(2×500=1000),第十名约 100(10×100=1000),就是这个意思。

考察英语文章时可以看到,以最常用的 the 为首,词的出现次数与这条定律吻合得很漂亮。中文里把“的”“了”“是”这类高频词从上往下排,也能看到类似的倾向。一小部分词被用得格外多,剩下的绝大多数只出现寥寥几次,而这份偏斜的形状竟规整得惊人。

亲身体会“排名×频率=恒定”

这条定律有意思的地方在于,排在前面的东西所占比重超出想象。我们用数字感受一下。

比方说数一数某本书里出现的词:第一名的词占整体 7%,第二名占 3.5%,第三名占 2.3%……排名越往下越工整地减少。这里值得注意的是,区区一小撮词,就占掉了整篇文章相当大的一部分。光是排在前面的几个词就填满了文章的好几成,而绝大多数词只出现屈指可数的次数。

我们平日自以为在使用庞大的词汇量,可真正被反复使用的词,其实极为有限。这种“少数支配整体,多数薄薄地摊得很长”的形状画成图,就是一条先陡然下坠、之后平缓地长长拖尾的独特曲线。这条长长的尾巴(长尾),正是齐普夫定律外观上的特征。

这份偏斜之大,看具体比例就更惊人了。据说在英语文章里,常用的前 100 个词左右,就占掉了整篇文章的将近一半。明明有着数万词的词汇量,实际承担文章大半的却只是一小撮常客。“the”“的”这类意思稀薄的词被大量使用,而意涵丰富的词反倒出场很少。齐普夫定律就以一道漂亮的公式,潜伏在这份略带讽刺的偏斜之中。

不只语言——铺展到世间各处的规律

齐普夫定律真正不可思议之处,在于它也适用于语言之外、看似毫不相干的对象

有名的例子是城市人口。把一个国家的城市按人口从多到少排开,许多国家都能看到这样的倾向:第二大城市的人口约为第一的一半,第三约为三分之一。与词频完全相同的形状,出现在了城市规模上。

类似的偏斜还在收入与资产的分布、企业规模、网站访问量、书的销量等各种场合被报告过。极少数的庞然大物与无数的小东西,按规整的比例排开。领域完全不同,同一个数学形状却反复出现——这份普遍性吸引了许多研究者。

比方说,想想视频网站或电商。访问量集中在极少数大热的视频与商品上,而播放量或销量微乎其微的作品,多到令人发晕。这种“少许爆款加无数小众”的结构,正是齐普夫定律所描绘的形状。也可以说,网络给曾被埋没的那条“长尾”打上了光。一条从词频这样朴素的观察出发的定律,竟能连到解读当代商业的视角上,我觉得挺有意思。本站的本福特定律讲的也是跨越单位与领域、数字中共通的偏斜,而齐普夫定律则从“排名与规模的关系”这个另外的角度,照出了世间的偏斜。

这种规律为什么会产生

那么为什么同样的形状会如此广泛地出现呢?其实,关于原因,至今也没有一个明确的答案。这一点要如实按住。不过有几种被认为有力的说法。

齐普夫本人提出的是“最省力原理”。人在用语言时,同时抱着两种心情:尽量省事(用尽量少的词汇打发过去)与好好传达给对方(想把词用得有区分)。当“想省事”“想传准”这场拉锯取得平衡时,结果就生出了齐普夫定律那样的分布——这是他的解释。

另一方面也有人指出,从更简单的机制出发,这个形状也会自然浮现。比如有研究显示,不考虑意思、单纯胡乱敲出的“文章”,也会呈现类似齐普夫定律的分布。也就是说,这条规律有可能并非源自语言的意义本身,而是源自“对某物计数并排名”这一行为的性质。连原因都还没被完全弄清——包括这一点在内,齐普夫定律是个相当有深度的现象。

关于齐普夫定律常见的疑问

它和本福特定律有什么不同

两者都处理世间数字里潜藏的规律性偏斜,像是一对表亲,但关注的对象不同。本福特定律关注“数字的首位”,指出以 1 开头的数最多这份偏斜;而齐普夫定律关注“排名与规模(频率)的关系”,指出排名越往下,规模越工整地成反比缩小。着眼点不同,但“自然生成的数据里会出现共通的数学形状”这份发现的趣味,是两者共通的。配套知道,看数字世界的眼光就宽了。

它和帕累托法则有关系吗

关系很深。帕累托法则是表示“向少数集中”的经验法则:“整体成果的八成由前两成创造。”齐普夫定律在极少数占掉整体大部分这一点上,也是把同一种“偏斜结构”换个形式说出来。其实两者在数学上同属被称为“幂律”的一族,共有着少数庞然大物与多数小东西规律排布的骨架。把世间的偏斜按排名去看是齐普夫,按比例去看是帕累托——这样想大概好懂一些。

能自己验证吗

轻松就能做。推荐的是数一数手边文章里出现的词:找一篇长一点的文章,数每个词出现了几次,再按多到少排开。你会看到排在最前的几个词格外多,排名一往下就骤减。或者把自己所在国家的城市按人口排一排,也是个有趣的实验:若第二名城市大致是第一名的一半,那里就有齐普夫定律在起作用。能靠自己的手在身边的数字里找出隐藏的规律,我觉得这是这条定律最好玩的地方。

相关的定律与偏差

以下是处理数字首位偏斜的“本福特定律”,以及关于半导体指数级成长的“摩尔定律”。表示向少数集中的帕累托法则,也是同一脉络。

结语

本文解读了“齐普夫定律”。

把排名与频率相乘,结果大致恒定。第二名约是第一名的一半,第三名约是三分之一,这种漂亮得过分的偏斜,就出现在语言的使用方式里。而且同样的形状还在城市人口、收入、企业规模等看似毫不相干的地方冒头。极少数的庞然大物与无数小东西规律排布的“长尾”结构,正是这条定律的真身。

为什么会这样,至今仍未被完全弄清,但“最省力原理”等好几种耐人寻味的说法都被提了出来。连原因都带着谜团——包括这一点在内,齐普夫定律告诉我们:看惯了的数字世界,其实被一种奇妙的秩序贯穿着。下次看到长文章或城市名单时,请打量一下头部与尾部的落差。那里应该藏着静静起作用的数学规律。

想返回定律列表的读者请点击下方链接。

我们下一篇文章见。

著名法则大全——墨菲定律、帕金森定律等 24 个有趣法则zh.senkohome.com/law-list/