53囚徒困境(Prisoner's Dilemma)
费曼学习法:一句话讲明白
两个嫌疑人被分开审讯。警察给每人同样的条件:
- 你招、他沉默 → 你释放,他判十年;
- 都沉默 → 各判一年(证据不足);
- 都招 → 各判五年。
你怎么办?
算一下就知道:无论他招不招,你招都是更优的(他沉默你获释,他招你判五年而非十年)。他也算出同样的结论。
结果两个人都招,各判五年。 而如果都保持沉默,各判一年——对双方都更好的结果,却没有发生。
这就是囚徒困境:个体理性导致集体非理性。
定义
囚徒困境是博弈论中最基本的结构,指:当每个参与者都选择对自己最优的策略时,达成的结果却比双方合作的结果更差。
它成立的三个条件:
- 背叛的收益高于合作(无论对方怎么做);
- 双方合作的结果优于互相背叛;
- 双方无法达成有约束力的协议(或者博弈是一次性的)。
它的价值在于揭示了一类普遍困境——个人理性与集体理性之间的张力:军备竞赛、价格战、公共资源透支、广告大战、团队里的推诿,都是它的变体。→ 见 #72 公地悲剧
破解之道也有规律,核心是把"一次性"变成"重复"、把"看不见"变成"看得见":
- 重复博弈:在未来还要继续打交道时,合作的长期收益会超过一次背叛的短期收益("以牙还牙"策略在实验中表现最优);
- 改变收益结构:引入惩罚机制(对背叛者施加代价)或奖励机制;
- 增强信息透明:让行为可被观察,声誉才能起作用;
- 建立有约束力的承诺:合同、制度、第三方执行。
边界
- 它不预言"人一定会背叛"。 现实中人会合作,尤其在重复互动、有社会规范、有声誉顾虑时。模型描述的是激励结构,不是人性。
- 它假设完全理性与自利。 人还受公平感、信任、利他、报复欲驱动——这些会显著改变结果(最后通牒博弈中,人们会拒绝"不公平"的分钱方案,尽管拿了钱更"理性")。
- 别把它当成"合作不可能"的证据。 恰恰相反——理解它才能设计出让合作成为最优解的机制。→ 见 #1 激励机制
- 单次博弈与重复博弈的解完全不同。 用重复博弈的直觉去处理一次性交易,或用一次性的思维去经营长期关系,都会出错。
交叉引用
→ 见 #72 公地悲剧 · → 见 #20 反馈回路 · → 见 #1 激励机制 · → 见 #77 红皇后效应 · → 见 #62 互惠原则