大家好,我是 Senko。 本文将解读“贝叶斯推断”。
它是每拿到新的信息,就更新概率估计的思考方式。它源自 18 世纪牧师托马斯·贝叶斯的遗稿,如今被广泛用于机器学习、医学诊断、垃圾邮件过滤与科学推理。
贝叶斯其人与定理的历史
贝叶斯定理之名来自托马斯·贝叶斯(1702~1761 年)。他是英国非国教会的牧师,同时对数学与哲学抱有强烈兴趣,钻研“概率是什么”这个问题。
贝叶斯生前没有发表论文,1763 年友人理查德·普赖斯从遗稿中发现了论文,并在伦敦皇家学会的会刊上发表。这就是《论有关机遇问题的求解》。
可当时这篇论文几乎没受到关注。几乎同一时期,皮埃尔–西蒙·拉普拉斯独立导出了同样的定理,在法国它长期被称为“拉普拉斯定理”。贝叶斯之名被广泛知晓,是在 20 世纪后半,尤其是计算机普及让贝叶斯计算变得可行之后。
贝叶斯定理的推导
贝叶斯定理可从条件概率的基本性质推导出来。
事件 A 与 B 的联合概率 P(A,B) 可用以下两种方式表示。
P(A,B) = P(A|B) × P(B)(在 B 之下 A 发生的概率 × B 发生的概率)
P(A,B) = P(B|A) × P(A)(在 A 之下 B 发生的概率 × A 发生的概率)
把右边两式用等号连起来、对 P(A|B) 求解:
P(A|B) = P(B|A) × P(A) / P(B)
这就是贝叶斯定理。
套进推断的语境:
- P(A):先验概率(Prior)——看到证据之前对假设 A 的信念程度
- P(B|A):似然(Likelihood)——假设 A 为真时得到证据 B 的概率
- P(B):边缘概率——得到证据 B 的概率(对全部假设的加权平均)
- P(A|B):后验概率(Posterior)——看到证据 B 之后对假设 A 的信念程度
把它表述得直白些,就是“后验概率 ∝ 先验概率 × 似然”(∝ 表示成比例)。
医学诊断的具体例
贝叶斯定理生出反直觉推理的典型例,是医学诊断。下面细算。
前提条件:
- 某疾病的患病率(人群中的患病比例):1%
- 检查的灵敏度(真有病的人呈阳性的概率):95%
- 检查的特异度(真健康的人呈阴性的概率):95%
检查呈阳性时,实际有病的概率(阳性预测值)是多少?
许多人会答“检查精度 95%,所以大概 90~95%”。下面算正解。
对 1 万人做检查:
- 有病的人:100 人(患病率 1%)
- 阳性(真阳性):100 × 0.95 = 95 人
- 阴性(假阴性):5 人
- 健康的人:9900 人
- 阴性(真阴性):9900 × 0.95 = 9405 人
- 阳性(假阳性):9900 × 0.05 = 495 人
呈阳性者合计:95 + 495 = 590 人 其中真有病的:95 人
阳性预测值 = 95 / 590 ≈ 16%
结果是:精度 95% 的检查即便呈阳性,实际有病的可能性也只有约 16%。
为什么会这样?因为疾病的患病率(先验概率)很低(1%),分母里绝大多数是健康人。即便灵敏度 95%,5% 的假阳性率也会从 9900 名健康人中产生 495 例假阳性,这远远超过为数不多的真阳性(95 人)。
从这个例子能得到的教训是:先验概率(患病率、基础率)低的处境下,即便是高精度的检查,阳性中的大半也会是假阳性。
这条原则直接连着“基础率忽视(Base Rate Neglect)”这个认知偏差问题。人容易无视先验概率,只盯着检查结果或证据。
多重证据下的贝叶斯更新
贝叶斯推断强大的性质,在于每叠加一份证据就“把后验概率当作下一次的先验概率”的逐次更新。
举例来看诊断工厂机器是否故障的情形。
初始状态:把“故障的概率 10%”作为先验概率。
第 1 份证据:检测到异响。设正常机器出异响的概率为 5%,故障机器出异响的概率为 80%。
贝叶斯更新:
- 后验 ∝ 0.10 × 0.80(故障×异响的似然)= 0.080
- ∝ 0.90 × 0.05(正常×异响的似然)= 0.045
- 合计:0.125
- 归一化后的故障概率:0.080 / 0.125 ≈ 64%
一份异响的证据,就把故障概率从 10% 拉到了 64%。
第 2 份证据:测得振动在正常范围内。设正常机器振动正常的概率为 90%,故障机器振动正常的概率为 30%。
贝叶斯更新(先验已更新为 64%):
- ∝ 0.64 × 0.30(故障×振动正常的似然)= 0.192
- ∝ 0.36 × 0.90(正常×振动正常的似然)= 0.324
- 合计:0.516
- 归一化后的故障概率:0.192 / 0.516 ≈ 37%
振动正常这份证据,又把故障概率从 64% 拉低到 37%。
像这样每来一份新证据就更新概率,最终逼近高精度的判断,就是贝叶斯推断的学习过程。
频率主义与贝叶斯主义的差别
统计学有两大主要学派。
频率主义(Frequentism):把概率定义为“在同一条件下无限次重复试验时频率的极限”。
- “这枚硬币出正面的概率是 0.5”这个主张,由无限次抛同一枚硬币的比例来定义
- 参数(总体均值等)是固定的真值,数据才是随机变量
- 主要推断手法:假设检验(p 值)、置信区间
贝叶斯主义(Bayesianism):把概率定义为“某个命题为真的信念程度(Degree of Belief)”。
- 认为参数本身带有概率分布
- 设定先验分布(Prior),看到数据后更新为后验分布(Posterior)
- 主要推断手法:贝叶斯因子、可信区间
两派的主要差别:
| 项目 | 频率主义 | 贝叶斯主义 |
|---|---|---|
| 概率的定义 | 长期频率 | 信念的程度 |
| 参数 | 固定的真值 | 带有概率分布 |
| 先验信息 | 不使用 | 作为先验分布明确纳入 |
| 解释 | 置信区间(长期看包含 95%) | 可信区间(后验概率 95%) |
| “一次性事件”的概率 | 无法定义 | 可以定义 |
“明天下雨的概率 40%”这样的气象预报概率是贝叶斯式的。“明天的天气”只发生一次,频率主义难以定义其概率,于是解释成“在给定大气数据下,会下雨的信念程度”。
垃圾邮件过滤与朴素贝叶斯
邮件的垃圾过滤,是贝叶斯推断最普及的实用例之一。
被称为“朴素贝叶斯分类器”(Naive Bayes Classifier)的手法,运作方式如下。
对每个词,事先学习“该词出现在垃圾邮件中的概率”与“出现在正常邮件中的概率”。
新邮件到达时,把邮件中所有词的出现当作彼此独立的证据(这就是“朴素”=独立假定的含义),反复做贝叶斯更新,算出“这封邮件是垃圾邮件的概率”。
- “免费”“立刻”“中奖”“点击”等在垃圾邮件中常出现 → 抬高垃圾概率
- “会议”“报告书”“麻烦您了”等在正常邮件中常出现 → 拉低垃圾概率
朴素贝叶斯计算简单、易于实现,至今仍是文本分类、情感分析、医学诊断等许多机器学习任务中在用的基础算法。
贝叶斯式思考在认知偏差上的应用
贝叶斯推断可作为识别人常犯之认知偏差的框架来使用。
基础率忽视(Base Rate Neglect):无视先验概率(基础率)、只凭眼前证据判断的倾向。正如医学诊断的例子所示,不考虑患病率就会大幅误解阳性的含义。
确认偏误(Confirmation Bias):积极收集支持自己信念的证据(把似然评得很高),而无视或轻视反证的倾向。按贝叶斯的做法,否定自己假设的证据也必须如实反映进似然。
锚定偏差(Anchoring):最先被给出的信息像先验概率那样被固定下来,此后的证据也不足以充分更新它的倾向。
后见之明偏误(Hindsight Bias):事后觉得“我一开始就知道会这样”的倾向。事前持有的概率分布,在结果揭晓后被追溯性地当成“那才是对的”而在记忆中改写。
这些偏差,都能被解释成没有正确执行贝叶斯更新(无视先验、扭曲似然、更新不足)的结果。
贝叶斯式决策的实践
下面给出把贝叶斯推断用于决策时的实践步骤。
步骤 1:设定先验概率 把“这个假设(候选、原因、风险)大概有多大可能”明确地数值化。历史数据、行业统计与专家见解都可以拿来用。
步骤 2:评估似然 评估“若这个假设为真,观察到的证据有多容易出现”。检查的灵敏度、预测模型的精度、专家证言的可信度等,都相当于似然。
步骤 3:计算(或估算)后验概率 按先验 × 似然的相对大小去估计后验概率。不必严格计算,把“A 假设的先验 × 似然”与“B 假设的先验 × 似然”相比,就能做相对判断。
步骤 4:收集追加证据并更新 不要把算过一次的后验概率固定住,每来新证据就更新。“一旦定了就不改”不是贝叶斯式的,“看到证据就一点点更新”才是理性的态度。
步骤 5:持有决策基准 明确“概率到多少就行动”的阈值。医疗上比如“阳性概率 50% 以上就做精密检查”,投资上比如“期望回报超过成本的概率 60% 以上就执行”。
结语
本文解读了“贝叶斯推断”。
贝叶斯推断并不只是一种统计手法,而是“新证据一来就把它反映进去、更新想法”这样一套理性的认识论框架。明确地持有先验概率、每看到证据就更新、最终把信念表达为后验概率,这个过程在科学、医疗与决策的一切场面都有效。
频率主义的假设检验追问的是“数据是否可能出现”,贝叶斯推断则直接追问“这个假设有多可信”。这份提问方式的差别,正是贝叶斯推断在实践决策上好用的源头。
另外,贝叶斯推断也是在存在信息不对称的处境(对方类型不明的谈判、保险、拍卖)中理性更新信念的基础。
框架一览与博弈论概论请从下方进入。
我们下一篇文章见。
📚 系列:战略思维框架(11/16)




