34回归均值(Regression to the Mean)

Regression to the Mean通用性 4 · 解释力 4 · 决策价值 4 · 总分 12证据 硬

费曼学习法:讲给十二岁的孩子听

一个班考完试,老师把考得最好的五个学生叫上台表扬,把考得最差的五个叫去谈话。

下一次考试,发生了什么?

被表扬的五个,分数普遍下降了;被谈话的五个,分数普遍上升了。

老师于是得出了两个结论:表扬让人骄傲退步,批评让人知耻后勇。

但这两个结论都是错的。

真正的原因是:第一次考试的成绩里,有很大一部分是运气。 那五个考得最好的,不只是"水平高",也是"这次运气好";那五个最差的,也不只是"水平差",也是"这次运气差"。

第二次考试,运气回归正常——于是水平高的人回到他应有的高分(比上次的极高分会低一点),水平差的人回到他应有的低分(比上次的极低分会高一点)。

跟表扬和批评毫无关系。 这就是回归均值:极端表现之后,下一次通常会更接近平均水平。

定义

回归均值(Regression to the Mean)指:当一个测量结果同时受"真实水平"和"随机波动"影响时,一次极端的测量结果之后,下一次测量通常会更接近平均值。

数学上不需要任何"纠正机制"——它纯粹是统计现象:

任何一次测量 = 真实水平 + 运气

极端值之所以极端,往往是因为运气那一格特别高(或特别低)。而运气是不可持续的,所以下一次自然会回落。

由此得到一条重要推论:极端表现本身就暗示了"这次的运气成分很大",所以下一次回归几乎是必然的。

它的现实形态无处不在:

一句话

极端表现里总有一部分是运气,而运气不可持续——所以高峰之后往往回落、低谷之后往往反弹;看到"干预之后变好了",先问一句:不干预的话,它本来会不会也变好?

例子

这是所有"XX 方法让我一个月内 XX"式宣传的最大漏洞。

一个人处于极度糟糕的状态(疼痛最强、体重最高、业绩最差、情绪最低),此时他尝试任何一种方法——吃药、健身、参加培训、换个环境。过一段时间,他的状况几乎必然改善——因为他的起点是一个包含了大量"负向运气"的极端值,而运气会回归。

于是他得出结论:"这个方法真有效。"

但这个结论在统计上站不住脚,因为缺少对照组:如果不做这件事,他会不会也改善?大多数情况下,答案是"会"。

这正是为什么 #26 随机对照实验如此重要只有把"自然回归"的效应通过对照组扣除掉,你才能知道干预本身有没有用。

同样的机制也解释了管理中的经典误判:对业绩最差的员工严厉批评后,下个季度他往往表现变好——管理者以为是批评起了作用,其实很可能只是回归均值。 反过来,对最优秀的员工大加表扬后他下滑了,管理者以为是表扬让他骄傲——同样错了。

常见误用

  1. 不要用它把一切变化都说成"统计假象"。 回归均值解释的是随机波动的回落,不能解释真实水平的变化。如果一个人的水平真的提升了(学会了新技能),那不是回归,是进步。区分方法:看变化是否持续,看是否能在不同场景下复现。
  2. 回归的方向是"趋向该个体的平均水平",不是"趋向群体的平均"。 一个顶尖高手的糟糕一天之后,他会回到他自己的高水平,而不是回到所有人的平均值。别把"回归"理解成"变平庸"。
  3. 反复测量可以减少它的干扰。 单次测量运气成分大;多次测量的平均值更接近真实水平。这也是为什么评估要看长期、看多次,而不是看一次的峰值或谷值。 → 见 #50 大数定律与中心极限定理
  4. 它和"赌徒谬误"是两回事。 回归均值说的是"极端之后会趋于平常";赌徒谬误说的是"连续开了五次红,下次该开黑了"——后者是错的,因为硬币没有记忆。 回归均值针对的是"水平 + 运气"的复合测量,不适用于独立随机事件。
  5. 警惕用它来否定真实的效果。 有些管理者反过来滥用:任何改善都被说成"回归均值"。检验标准仍然是:有没有对照组,效果能不能持续。 → 见 #8 相关性≠因果性

交叉引用

→ 见 #26 控制变量与随机对照 · → 见 #8 相关性≠因果性 · → 见 #50 大数定律与中心极限定理 · → 见 #23 基础概率 · → 见 #90 自利偏差