50大数定律与中心极限定理(LLN & CLT)

LLN & CLT通用性 4 · 解释力 4 · 决策价值 3 · 总分 11证据 硬

费曼学习法:讲给十二岁的孩子听

抛一次硬币,正面朝上——你不会觉得这枚硬币有问题。

抛十次,七次正面——你可能开始怀疑了。

一千次,结果会怎样?正面朝上的比例,会非常接近 50%。 抛得越多,越接近。

这就是大数定律样本越多,频率越接近真实概率。

再看另一件事。你去测全班同学的身高,把结果画成图:矮的少、高的少、中间的多——一条钟形曲线。

为什么?因为身高是几百个因素叠加的结果:几十个基因、营养、睡眠、运动……每个因素影响一点,加起来就成了中间高、两头低的形状。

这就是中心极限定理大量独立的随机因素相加,结果会趋近正态分布——不管那些因素本身是什么分布。

这两条定理合在一起,撑起了整个统计推断:前者保证"多试几次就能看到真相",后者保证"加总起来的东西可以预测"。

但它们有一个共同的前提:独立、可加。 一旦这个前提被破坏(相乘、传染、正反馈),两条定理同时失效。→ 见 #17 正态分布与幂律分布

定义

大数定律(Law of Large Numbers):在独立重复试验中,随着试验次数增加,样本均值收敛于期望值。小样本的频率不可靠,大样本的频率才稳定。

中心极限定理(Central Limit Theorem):大量独立同分布的随机变量之和(或均值),其分布趋近正态分布——无论原始变量服从什么分布

这两个定理共同构成了统计推断的地基,也解释了几件事:

关键约束(也是最容易出错的地方):它们要求独立、可加、方差有限。

三条中任何一条破坏,大数定律要么失效,要么收敛得极慢。→ 见 #21 肥尾风险

一句话

样本越多,频率越接近真实概率;大量独立因素相加,结果趋近钟形曲线——但这两个定理都要求"独立、可加、方差有限",一旦出现相乘、传染或正反馈,它们同时失效,小样本和大样本都救不了你。

例子

为什么"再试一次"在有些领域有效,在有些领域是灾难?

在赌场里,再玩一万次是安全的——对赌场而言。因为每一局的期望值是确定的,玩得越多,实际结果越接近期望值。这就是赌场永远不拒绝你继续玩的原因。

但对你个人而言,同样的"多玩几次"是通往破产的路——因为你只有有限的本金,而破产是吸收壁:一旦归零,就没有"下一次"了。大数定律在集合层面成立,在个体时间序列层面可能永远无法兑现。 → 见 #60 遍历性

另一类失效来自分布的形状。如果收益是相乘的(今年赚 50%、明年亏 40%),那么"平均收益率"就不是一个有意义的量:

50% 和 −40% 的算术平均是 +5%,但实际结果是 1.5 × 0.6 = 0.9,亏了 10%。

这就是为什么投资界必须用几何平均(对数收益)而不是算术平均。当变量是相乘而非相加时,中心极限定理作用于对数,而不是原值。

常见误用

  1. 不要把"大数"理解成"几十个"。 需要的样本量取决于方差大小。方差越大,收敛越慢;在肥尾分布里,可能需要几万甚至更多样本才能让均值稳定。→ 见 #21 肥尾风险
  2. 小样本结论不可信,但大样本也不自动可信。 如果抽样有偏(样本不是随机的),再大的样本也只是在精确地测量一个错误的群体。样本量解决的是随机误差,不解决系统偏差。 → 见 #33 幸存者偏差
  3. 赌徒谬误是最常见的误读。 大数定律意味着"开了五次红,下次该开黑",也不意味着"运气会自我修正"。它的机制是稀释——随着次数增加,早期的偏差被摊薄,而不是被抵消。硬币没有记忆。 → 见 #34 回归均值
  4. 别在相关事件上套用。 金融危机时,所有资产同时下跌,相关性趋近于 1——此时分散化失效,大数定律的前提(独立性)被破坏。 这正是"平时看着很分散、危机时一起跌"的原因。
  5. 中心极限定理描述的是"和",不是"最大值"。 极端值(最大单日跌幅、最高的那栋楼)不服从正态分布,而服从极值分布。用正态分布去估计极端事件,是风险管理里最经典的致命错误。 → 见 #21 肥尾风险

交叉引用

→ 见 #17 正态分布与幂律分布 · → 见 #21 肥尾风险 · → 见 #60 遍历性 · → 见 #26 控制变量与随机对照 · → 见 #33 幸存者偏差