26控制变量与随机对照(Controlled Experiments / RCT)
费曼学习法:讲给十二岁的孩子听
你想知道"每天喝牛奶能不能长高"。
最简单的办法:找个爱喝牛奶的孩子,量一下;再找个不喝的,量一下。谁高?
这个办法完全没用。 因为喝牛奶的孩子和不喝的孩子,可能家境不同、运动量不同、睡眠不同、基因不同——你量到的差别,很可能是这些别的东西造成的,跟牛奶没关系。
正确的做法是这样的:找一大群差不多的孩子,然后抛硬币决定谁喝谁不喝。硬币是随机的,于是两组人在所有方面——家境、运动、睡眠、基因——平均起来都一样。
唯一系统性的差别,只有"喝不喝牛奶"。
这时候两组的身高差,才能归因到牛奶上。
随机这一下,是整个科学方法里最重要的一下。 它把"所有你没想到会干扰结果的因素"平均分给了两组,于是你不需要知道它们是什么,也能把它们控制住。
定义
控制变量指:在比较两种处理时,让除了研究因素以外的所有条件保持一致。随机对照实验(RCT)指:通过随机分配把受试者分入实验组与对照组,从而消除选择偏差与混淆变量的影响。
它之所以是因果推断的黄金标准,是因为它解决了 #8 里那个最难的问题——排除其他解释:
- 控制:让其他条件相同;
- 随机:让那些你没想到、无法测量的因素也平均分布;
- 对照:提供一个反事实基准("如果不做,会怎样")。
三者齐备,A 与 B 的差别才能被可靠地归因于处理本身。缺了随机,你得到的只是相关。 → 见 #8 相关性≠因果性
一句话
想知道"是不是它起了作用",就抛硬币分组、让两组只有这一点不同——随机这一下把你想得到和想不到的干扰因素平均分给了两边;没有随机的对比,无论数据多漂亮,得出的都只是相关。
例子
医学史上最著名的案例之一:坏血病。
18 世纪,长期航海的水手会得坏血病,大批死亡。当时有各种各样的"理论"和疗法。1747 年,英国海军医官詹姆斯·林德做了一件前所未有的事:他找了 12 名症状相似的患病水手,分成六组,吃同样的基础伙食,每组额外加一样不同的东西——苹果酒、稀硫酸、醋、海水、橙子和柠檬、大蒜芥末膏。
结果非常清楚:吃橙子和柠檬的那组迅速康复。
关键在于他的设计:六组人其他条件相同,只有添加的那一味不同。这不是巧合——这是有记载的最早的对照实验之一。 此后英国海军才逐步推广柠檬汁,坏血病在海上的肆虐就此终结(比维生素 C 的发现早了近两个世纪)。
同样的逻辑今天用在 A/B 测试上:把用户随机分成两组,一组看到旧版本、一组看到新版本,其他一切相同。这是 RCT 在商业中的形态,也是唯一能可靠回答"这个改动到底有没有用"的方法。
常见误用
- 样本太小,看到的是噪声。 随机分组只在样本足够大时才真正平衡了干扰因素。几十个用户的 A/B 测试,结论基本不可信。 判断方法:看置信区间,看效应量是否稳定,看能不能重复。
- "随机"被破坏。 最常见的问题是中途剔除样本(把不好看的数据拿掉)、分组后两组做了不同处理、或者用户自己选择进入哪一组。任何破坏随机的操作,都会把 RCT 降格为观察性研究。
- 别把 RCT 神化。 它有内部效度,但外部效度另说:在一群人身上有效,不等于在你的场景、你的用户身上有效。而且很多重要问题(宏观政策、人生选择、长期健康)根本无法做实验。→ 见 #7 地图≠疆域
- 伦理边界。 当处理可能造成伤害时(药物副作用、糟糕的用户体验、有害的政策),随机对照是不道德的。此时只能依靠观察性研究加机制论证,并接受结论的不确定性。
交叉引用
→ 见 #8 相关性≠因果性 · → 见 #23 基础概率 · → 见 #50 大数定律与中心极限定理 · → 见 #40 证伪原则