33幸存者偏差(Survivorship Bias)

Survivorship Bias通用性 4 · 解释力 4 · 决策价值 4 · 总分 12证据 硬

费曼学习法:讲给十二岁的孩子听

二战时,盟军的飞机经常被打得满身弹孔回来。军方想给飞机加装甲,于是统计了返航飞机上的弹孔分布:

机翼和机身弹孔最多,引擎和驾驶舱几乎没有。

军方的第一反应是:给弹孔多的地方加装甲。

一位统计学家(亚伯拉罕·瓦尔德)说:恰恰相反,应该给弹孔少的地方加。

为什么?因为这份统计只包含了活着飞回来的飞机

那些引擎中弹的飞机,根本没能回来——它们不在你的数据里。机翼中弹还能飞回来,说明机翼中弹不致命;引擎几乎没有弹孔,不是因为引擎不会被打中,而是因为打中引擎的都没回来。

看不见的样本,往往才是最关键的样本。 这就是幸存者偏差:你只看到了"成功通过筛选"的那部分,而筛选掉的部分恰恰藏着最重要的信息。

定义

幸存者偏差指:由于样本经过了某种筛选(通常是"存活"或"成功"),导致基于该样本得出的结论系统性偏离真实情况。

它的结构是一个隐藏的过滤器:

全部样本 → [筛选:只有某种特征的能通过] → 你看到的样本
                    ↓
              被筛掉的部分,永远沉默

关键洞察:被筛掉的部分不是随机的,而是与你要研究的东西相关。 返航飞机不是随机样本——"能返航"这个条件,恰恰与"哪里中弹会致命"高度相关。

常见的幸存者偏差来源:

一句话

你看到的样本已经过筛选,而被筛掉的那部分往往最关键——引擎上没有弹孔,不是因为打不中,是因为打中的都没回来;所以看到任何"成功经验"之前,先问一句:那些没活下来的,去哪了?

例子

"名校退学、创业成功"的故事,是幸存者偏差最经典的温床。

比尔·盖茨、乔布斯、扎克伯格都从名校退学然后取得了巨大成功。于是"退学创业"被反复讲述,成了一种被浪漫化的路径。

但这个样本被筛选过两次:

  1. 只有成功的退学者会被报道,而绝大多数退学者并没有成为亿万富翁——他们根本不会出现在故事里;
  2. 退学这个变量,可能与成功无关,而与"已经有足够把握"有关——这些人是在有了可验证的进展之后才退学的,不是先退学再等待奇迹。

换句话说:退学可能是结果,不是原因。 而幸存者偏差让我们把结果误读成了原因。

同样的结构出现在"这些成功公司都做了 X,所以我们也该做 X"这类推理里——你只研究了活下来的公司,而那些做了同样的事却死掉的公司,不在你的样本里。 → 见 #8 相关性≠因果性

常见误用

  1. 不要把它当成"所有成功学都不可信"的万能标签。 幸存者偏差说明样本有偏,但不等于被观察对象的经验毫无价值。正确做法是补上对照组:去研究那些做了同样事情却失败的案例,看看差别在哪。
  2. 警惕"反向幸存者偏差"。 有时候被筛掉的是成功者而非失败者。比如统计"某项政策的效果"时,如果最成功的案例因为某些原因未被纳入统计,结论同样会偏。方向不重要,重要的是搞清楚筛选机制是什么。
  3. 主动去寻找沉默的样本。 这是最实用的对策:看创业故事时去读失败复盘;看投资业绩时问"清盘的基金去哪了";评估团队时去听离职员工的意见;分析用户时去看流失用户,而不只是活跃用户。沉默的那部分通常信息量最大。
  4. 它是许多其他偏误的共同来源。 可得性偏差(容易想起的才被想起)、确认偏误(支持自己的才被记住)都会制造类似的选择性样本。看到样本时,多问一句"它是怎么被选出来的"。 → 见 #51 可得性偏差

交叉引用

→ 见 #8 相关性≠因果性 · → 见 #51 可得性偏差 · → 见 #23 基础概率 · → 见 #26 控制变量与随机对照 · → 见 #30 过度自信