33幸存者偏差(Survivorship Bias)
费曼学习法:讲给十二岁的孩子听
二战时,盟军的飞机经常被打得满身弹孔回来。军方想给飞机加装甲,于是统计了返航飞机上的弹孔分布:
机翼和机身弹孔最多,引擎和驾驶舱几乎没有。
军方的第一反应是:给弹孔多的地方加装甲。
一位统计学家(亚伯拉罕·瓦尔德)说:恰恰相反,应该给弹孔少的地方加。
为什么?因为这份统计只包含了活着飞回来的飞机。
那些引擎中弹的飞机,根本没能回来——它们不在你的数据里。机翼中弹还能飞回来,说明机翼中弹不致命;引擎几乎没有弹孔,不是因为引擎不会被打中,而是因为打中引擎的都没回来。
看不见的样本,往往才是最关键的样本。 这就是幸存者偏差:你只看到了"成功通过筛选"的那部分,而筛选掉的部分恰恰藏着最重要的信息。
定义
幸存者偏差指:由于样本经过了某种筛选(通常是"存活"或"成功"),导致基于该样本得出的结论系统性偏离真实情况。
它的结构是一个隐藏的过滤器:
全部样本 → [筛选:只有某种特征的能通过] → 你看到的样本
↓
被筛掉的部分,永远沉默
关键洞察:被筛掉的部分不是随机的,而是与你要研究的东西相关。 返航飞机不是随机样本——"能返航"这个条件,恰恰与"哪里中弹会致命"高度相关。
常见的幸存者偏差来源:
- 成功者才会被报道:创业成功者的故事铺天盖地,失败者无人书写;
- 现存者才能被观察到:百年老店的经营之道,但同一时期倒闭的九十九家没留下经验;
- 留下来的才被统计:员工满意度调查只覆盖在职者,离职者的意见消失了;
- 被看见的才算数:社交媒体上的光鲜生活,是发布者主动筛选过的切片。
一句话
你看到的样本已经过筛选,而被筛掉的那部分往往最关键——引擎上没有弹孔,不是因为打不中,是因为打中的都没回来;所以看到任何"成功经验"之前,先问一句:那些没活下来的,去哪了?
例子
"名校退学、创业成功"的故事,是幸存者偏差最经典的温床。
比尔·盖茨、乔布斯、扎克伯格都从名校退学然后取得了巨大成功。于是"退学创业"被反复讲述,成了一种被浪漫化的路径。
但这个样本被筛选过两次:
- 只有成功的退学者会被报道,而绝大多数退学者并没有成为亿万富翁——他们根本不会出现在故事里;
- 退学这个变量,可能与成功无关,而与"已经有足够把握"有关——这些人是在有了可验证的进展之后才退学的,不是先退学再等待奇迹。
换句话说:退学可能是结果,不是原因。 而幸存者偏差让我们把结果误读成了原因。
同样的结构出现在"这些成功公司都做了 X,所以我们也该做 X"这类推理里——你只研究了活下来的公司,而那些做了同样的事却死掉的公司,不在你的样本里。 → 见 #8 相关性≠因果性
常见误用
- 不要把它当成"所有成功学都不可信"的万能标签。 幸存者偏差说明样本有偏,但不等于被观察对象的经验毫无价值。正确做法是补上对照组:去研究那些做了同样事情却失败的案例,看看差别在哪。
- 警惕"反向幸存者偏差"。 有时候被筛掉的是成功者而非失败者。比如统计"某项政策的效果"时,如果最成功的案例因为某些原因未被纳入统计,结论同样会偏。方向不重要,重要的是搞清楚筛选机制是什么。
- 主动去寻找沉默的样本。 这是最实用的对策:看创业故事时去读失败复盘;看投资业绩时问"清盘的基金去哪了";评估团队时去听离职员工的意见;分析用户时去看流失用户,而不只是活跃用户。沉默的那部分通常信息量最大。
- 它是许多其他偏误的共同来源。 可得性偏差(容易想起的才被想起)、确认偏误(支持自己的才被记住)都会制造类似的选择性样本。看到样本时,多问一句"它是怎么被选出来的"。 → 见 #51 可得性偏差
交叉引用
→ 见 #8 相关性≠因果性 · → 见 #51 可得性偏差 · → 见 #23 基础概率 · → 见 #26 控制变量与随机对照 · → 见 #30 过度自信