囚徒困境
囚徒困境 (英语:Prisoner’s Dilemma) 是博弈论的非零和博弈中具代表性的例子,反映个人最佳选择并非团体最佳选择。或者说在一个群体中,个人做出理性选择却往往导致集体的非理性。虽然困境本身只属模型性质,但现实中的价格竞争、环境保护等方面,也会频繁出现类似情况。
单次发生的囚徒困境,和多次重复的囚徒困境结果不会一样。
在重复的囚徒困境中,博弈被反复地进行。因而每个参与者都有机会去“惩罚”另一个参与者前一回合的不合作行为。这时,合作可能会作为均衡的结果出现。欺骗的动机这时可能被受到惩罚的威胁所克服,从而可能导向一个较好的、合作的结果。作为反复接近无限的数量,纳什均衡趋向于帕累托最优。
囚徒困境的主旨为,囚徒们彼此合作,坚不吐实,可为全体带来最佳利益(缩短刑期),但在无法沟通的情况下,因为出卖同伙可为自己带来利益(无罪开释),也因为同伙把自己招出来可为他带来利益,因此彼此出卖虽违反最佳共同利益,反而是自己最大利益所在。但实际上,执法机构不可能设立如此情境来诱使所有囚徒招供,因为囚徒们必须考虑刑期以外之因素(出卖同伙会受到报复等),而无法完全以执法者所设立之利益(刑期)作考量,所以这是一个参考性的学术问题。
经典的囚徒困境
1950年,由就职于兰德公司的梅里尔·弗勒德和梅尔文·德雷希尔拟定出相关困境的理论,后来由顾问艾伯特·塔克以囚徒方式阐述,并命名为“囚徒困境”。经典的囚徒困境如下:
警方逮捕甲、乙两名嫌疑犯,但没有足够证据指控二人有罪。于是警方分开囚禁嫌疑犯,分别和二人见面,并向双方提供以下相同的选择:
若一人认罪并作证检控对方(相关术语称“背叛”对方),而对方保持沉默,此人将即时获释,沉默者将判监10年。
若二人都保持沉默(相关术语称互相“合作”),则二人同样判监半年。
若二人都互相检举(互相“背叛”),则二人同样判监5年。
用表格概述如下:
| 乙沉默(合作) | 乙认罪(背叛) | |
|---|---|---|
| 甲沉默(合作) | 二人同服刑半年 | 甲服刑10年;乙即时获释 |
| 甲认罪(背叛) | 甲即时获释;乙服刑10年 | 二人同服刑5年 |
解说
如同博弈论的其他例证,囚徒困境假定每个参与者(即“囚徒”)都是利己的,即都寻求最大自身利益,而不关心另一参与者的利益。参与者某一策略所得利益,如果在任何情况下都比其他策略要低的话,此策略称为“严格劣势”,理性的参与者绝不会选择。另外,没有任何其他力量干预个人决策,参与者可完全按照自己意愿选择策略。
囚徒到底应该选择哪一项策略,才能将自己个人的刑期缩至最短?两名囚徒由于隔绝监禁,并不知道对方选择;而即使他们能交谈,还是未必能够尽信对方不会反口。就个人的理性选择而言,检举背叛对方所得刑期,总比沉默要来得低。试设想困境中两名理性囚徒会如何作出选择:
- 若对方沉默、我背叛会让我获释,所以会选择背叛。
- 若对方背叛指控我,我也要指控对方才能得到较低的刑期,所以也是会选择背叛。
二人面对的情况一样,所以二人的理性思考都会得出相同的结论——选择背叛。背叛是两种策略之中的支配性策略。因此,这场博弈中唯一可能达到的纳什均衡,就是双方参与者都背叛对方,结果二人同样服刑5年。
这场博弈的纳什均衡,显然不是顾及团体利益的帕累托最优解决方案。以全体利益而言,如果两个参与者都合作保持沉默,两人都只会被判刑半年,总体利益更高,结果也比两人背叛对方、判刑5年的情况较佳。但根据以上假设,二人均为理性的个人,且只追求自己个人利益。均衡状况会是两个囚徒都选择背叛,结果二人判监均比合作为高,总体利益较合作为低。这就是“困境”所在。例子有效地证明了:非零和博弈中,帕累托最优和纳什均衡是互相冲突的。
固定局数的囚徒困境
概括而言囚徒困境进行第一次后会出现以下两种情况:
- 甲在第一次中被乙指控,即会在第二次指控乙,最终导致,甲即时获释,乙服刑10年或二人同服刑5年这两种情况。
- 双方均保持沉默,即会建立互信的关系,最终导致,二人同服刑半年。
但互信的关系并非牢不可破,这一点也可以被利用,即甲,乙在第一次中共同选择沉默而赢得对方的信任,但甲或乙中的一人在获得对方的信任后指控对方而获得自身最大的利益即自身即时获释,但对方将服刑10年。这是一个以牺牲对方利益而获得自身最大利益的一种策略。
假设,两个囚徒均欲利用此策略,并将局数推演为十次,那么就会出现如下的情况:在第一局到第九局的过程中双方均会保持沉默,以期望建立互信关系,并在第十局指控对方,这将最终导致,二人同服刑5年。
再一次假设,双方都明确对方会使用与自己同样的策略,即知道对方会在第十局中指控自己,这样,在第九局时两者间的信任关系的建立即是没有意义的,如此类推,第八局到第一局中信任关系的建立也是没有意义的,即是十局都会互相背叛,也就是纳什均衡。也可推论,在如此的情况下,只有在囚徒困境的局数在不肯定的情况下(即双方均不知道进行的局数),才会出现互相保持沉默以获得信任关系的现象。