50大数定律与中心极限定理(LLN & CLT)
费曼学习法:讲给十二岁的孩子听
抛一次硬币,正面朝上——你不会觉得这枚硬币有问题。
抛十次,七次正面——你可能开始怀疑了。
抛一千次,结果会怎样?正面朝上的比例,会非常接近 50%。 抛得越多,越接近。
这就是大数定律:样本越多,频率越接近真实概率。
再看另一件事。你去测全班同学的身高,把结果画成图:矮的少、高的少、中间的多——一条钟形曲线。
为什么?因为身高是几百个因素叠加的结果:几十个基因、营养、睡眠、运动……每个因素影响一点,加起来就成了中间高、两头低的形状。
这就是中心极限定理:大量独立的随机因素相加,结果会趋近正态分布——不管那些因素本身是什么分布。
这两条定理合在一起,撑起了整个统计推断:前者保证"多试几次就能看到真相",后者保证"加总起来的东西可以预测"。
但它们有一个共同的前提:独立、可加。 一旦这个前提被破坏(相乘、传染、正反馈),两条定理同时失效。→ 见 #17 正态分布与幂律分布
定义
大数定律(Law of Large Numbers):在独立重复试验中,随着试验次数增加,样本均值收敛于期望值。小样本的频率不可靠,大样本的频率才稳定。
中心极限定理(Central Limit Theorem):大量独立同分布的随机变量之和(或均值),其分布趋近正态分布——无论原始变量服从什么分布。
这两个定理共同构成了统计推断的地基,也解释了几件事:
- 为什么赌场稳赚:它不在乎你这一把输赢,只在乎玩了几百万把之后的平均结果;
- 为什么保险可行:单个人是否出险无法预测,但一万个人的出险比例高度可预测;
- 为什么民意调查能奏效:几千人的样本就能推断上亿人的倾向(前提是随机抽样);
- 为什么质量抽检有意义:一部分产品的合格率能代表整批。
关键约束(也是最容易出错的地方):它们要求独立、可加、方差有限。
- 如果变量相互关联(羊群、挤兑、传染)→ 独立性破坏;
- 如果变量是相乘的(复合收益、病毒传播)→ 可加性破坏,结果趋向对数正态或幂律;
- 如果分布方差无限(某些极端肥尾)→ 均值本身不收敛。
三条中任何一条破坏,大数定律要么失效,要么收敛得极慢。→ 见 #21 肥尾风险
一句话
样本越多,频率越接近真实概率;大量独立因素相加,结果趋近钟形曲线——但这两个定理都要求"独立、可加、方差有限",一旦出现相乘、传染或正反馈,它们同时失效,小样本和大样本都救不了你。
例子
为什么"再试一次"在有些领域有效,在有些领域是灾难?
在赌场里,再玩一万次是安全的——对赌场而言。因为每一局的期望值是确定的,玩得越多,实际结果越接近期望值。这就是赌场永远不拒绝你继续玩的原因。
但对你个人而言,同样的"多玩几次"是通往破产的路——因为你只有有限的本金,而破产是吸收壁:一旦归零,就没有"下一次"了。大数定律在集合层面成立,在个体时间序列层面可能永远无法兑现。 → 见 #60 遍历性
另一类失效来自分布的形状。如果收益是相乘的(今年赚 50%、明年亏 40%),那么"平均收益率"就不是一个有意义的量:
50% 和 −40% 的算术平均是 +5%,但实际结果是 1.5 × 0.6 = 0.9,亏了 10%。
这就是为什么投资界必须用几何平均(对数收益)而不是算术平均。当变量是相乘而非相加时,中心极限定理作用于对数,而不是原值。
常见误用
- 不要把"大数"理解成"几十个"。 需要的样本量取决于方差大小。方差越大,收敛越慢;在肥尾分布里,可能需要几万甚至更多样本才能让均值稳定。→ 见 #21 肥尾风险
- 小样本结论不可信,但大样本也不自动可信。 如果抽样有偏(样本不是随机的),再大的样本也只是在精确地测量一个错误的群体。样本量解决的是随机误差,不解决系统偏差。 → 见 #33 幸存者偏差
- 赌徒谬误是最常见的误读。 大数定律不意味着"开了五次红,下次该开黑",也不意味着"运气会自我修正"。它的机制是稀释——随着次数增加,早期的偏差被摊薄,而不是被抵消。硬币没有记忆。 → 见 #34 回归均值
- 别在相关事件上套用。 金融危机时,所有资产同时下跌,相关性趋近于 1——此时分散化失效,大数定律的前提(独立性)被破坏。 这正是"平时看着很分散、危机时一起跌"的原因。
- 中心极限定理描述的是"和",不是"最大值"。 极端值(最大单日跌幅、最高的那栋楼)不服从正态分布,而服从极值分布。用正态分布去估计极端事件,是风险管理里最经典的致命错误。 → 见 #21 肥尾风险
交叉引用
→ 见 #17 正态分布与幂律分布 · → 见 #21 肥尾风险 · → 见 #60 遍历性 · → 见 #26 控制变量与随机对照 · → 见 #33 幸存者偏差