博弈论 / 激励 / 纳什

两人都想少坐牢,为什么一起判得更重?

每个囚徒都想缩短自己的刑期。当双方各自私下推理时,仍可能停在对双方都差于一起沉默的格子——除非重复见面或可信惩罚改写博弈。

两个理性选择,也能把两人锁进更差的格子

囚徒困境是一个 2×2 博弈:每人独立选择合作或背叛。这里的支付是坐牢年数——对个人来说数字越小越好。

两人一起沉默(合作)时,各判较短刑期;一人招供(背叛)而另一人沉默时,招供者可能当场释放,沉默者吃最长刑期;两人一起招供时,各判中等刑期——对两人合计来说,比一起沉默更差。

先记住三点

  • 先看支付矩阵

    整条故事线就在四个格子里:CC、CD、DC、DD。

  • 优势策略

    给定对方选择,背叛常常能缩短你自己的刑期。

  • 纳什 ≠ 集体最优

    双方背叛可以很稳定,即使双方合作对两人都更好。

先读支付矩阵,再谈谁坏谁傻

行是你的行动,列是同伴的行动。每个格子写着(你的年数,同伴的年数)。数字把冲突写清楚:背叛对个人有诱惑,合作对两人合计更仁慈。

这一步还没有神秘心理——只是一张激励地图。后面再问:当无法约束对方时,自利选择者会怎么动。

注意这些

  • 越小越好

    这里的支付是坐牢年数,不是「越大越好」的效用分。

  • 诱惑不对称

    对方合作时,单方面背叛对你更划算。

  • 对称陷阱

    对方也背叛时,你背叛仍比继续合作少坐一点。

固定对方行动——再选能缩短你刑期的那一步

把同伴的选择钉住,只比较你的两个选项。对方合作时,背叛把你的刑期从 1 压到 0;对方背叛时,背叛把 3 压到 2。

这就是优势策略:无论对方怎么做,背叛在私人账本上都压过合作。这里的「理性」是「尽量少坐牢」,不是「尽量让两人一起舒服」。

这一步在变什么

  • 条件比较

    优势策略是按对方的每一列(或每一行)逐格核对的。

  • 不必读心

    你甚至不需要知道对方选什么,也会偏向背叛。

  • 仍是单次

    这一步没有下一局,也没有惩罚条款。

双方用同一套推理,就会在更差的格子碰头

若背叛对你是优势策略,对对方也是,则单次博弈的预测落点是双方背叛:各 2 年。谁也不想单独改口——单独改成合作,会把你的刑期从 2 抬到 3。

这就是纳什均衡:策略组合里,没有人能靠单方面偏离变得更好。稳定,不等于两人一起更开心。

这一步在变什么

  • 纳什=单方面逃不掉

    从 DD 出发,独自改成合作只会让改口者更惨。

  • CC 独自不稳

    从 CC 出发,独自背叛能拿到诱惑——所以 CC 需要信任或约束。

  • 对称推理

    双方都用优势策略逻辑时,陷阱收得更紧。

把年数加总:稳定的格子并不是最仁慈的合计

把两人的刑期加在一起。CC 合计 2 年;DD 合计 4 年。纳什结果浪费了若一起沉默本可保住的两年自由。

这就是系统的 punchline:个体理性的最优反应,可以叠成集体更差的账本。差额不是算术错误——是私人目标与联合目标冲突的结果。

这一步在变什么

  • 福利 ≠ 纳什

    按合计年数,CC 优于 DD,即便 DD 更稳定。

  • 帕累托直觉

    从 DD 挪到 CC,可以让两人都变好、不让任何一方变差。

  • 需要机制

    走到 CC 通常要靠承诺、声誉或惩罚——不是靠愿望。

把博弈重复下去——可信惩罚可以护住合作

单次博弈里,背叛占优。若会再见面,以牙还牙(模仿对方上一步)或冷酷触发(一次背叛后永久惩罚)一类策略,可以让合作变得激励相容。

关键是可信:威胁的惩罚必须是你真的会执行的;未来的影子也要够长,让今天的诱惑不值得明天的惩罚。

这一步在变什么

  • 未来的影子

    后续回合的价值,可以压过单轮诱惑。

  • 以牙还牙直觉

    先示好;镜像上一步;惩罚保持克制。

  • 不是魔法

    已知终点、噪声、弱监督,都可能让陷阱重新打开。

私人最优反应可以叠成共同损失——除非未来(或规则)改写矩阵

囚徒困境不是「选手很蠢」的故事。它是一张支付矩阵:在单次见面里背叛对私人更稳,于是双方背叛成为稳定预测——即便双方合作浪费的年数更少。

机制很重要:重复、声誉、合约与可信惩罚会改写有效博弈。这些变弱时,纳什陷阱仍在。

阅读清单

  1. 说出四个格子,以及谁的年数写在哪里。
  2. 核对优势:对方两种行动下,背叛是否都压过合作?
  3. 把纳什稳定性与合计福利分开看。
  4. 问清互动是单次还是重复。
  5. 若出现合作,指出支撑它的执行装置或「未来的影子」。

陷阱的四步

  • 矩阵数字是什么?

    四个格子定义诱惑、奖励、傻瓜与惩罚。

  • 优势私下谁更稳?

    经典单次囚徒困境里,背叛双向压过合作。

  • 纳什最优反应在哪碰头?

    双方背叛可以稳定,即便集体更差。

  • 重复什么改写激励?

    未来回合与可信惩罚可以护住合作。

困境不在于人们想伤害别人——而在于各自说得通的选择,可以合成共同伤害。

教学说明:支付为示意坐牢年数(CC 1,1;DC 0,3;CD 3,0;DD 2,2)。真实司法、噪声与不完全监督会改细节;私人优势与联合效率的冲突才是重点。