博弈论10 均衡概念比较与PBNE的再精炼
表10. 1 参与人2
L
U (1-p ) 参与人1 D(p)
10,0
10,1
R
5,2
2 ,0
在表 10.4.1 中, (D , L) 是一个纳什均衡 ( 弱劣 战略均衡 ) ;只要参与人 2 不选择 R , D 就是参 与人1的最优选择;同样,只要参与人1不选择 U,L就是参与人2的最优选择。但是,如果参与 人2有可能错误地选择R,那么,不论这个错误 发生的概率是多么小,参与人 1 的最优选择就 是U而不是D;预测到这一点,参与人2将选择 R。就是说, (D, L) 不是一个颤抖手均衡。对 比之下,(U,R)是—个颤抖手均衡:不论参与 人2犯错误的概率多大,参与人1没有兴趣选样 D;另一方面,只要参与人1犯错误的概率小于 2/3 ( 2×(1-p)+0×p>0×(1-p)+1×p , 即 p<2/3),参与人2就没有兴趣选择L.
L
R
(0,0)
R
(0,1)
(3,1)
显然
( p, q) lim( p , q )
m m m
所以,(L, L),
1 1, q q 序贯均衡 2 (1,0)
10.4 泽尔腾的颤抖手均衡
泽尔腾 (1975) 使用战略式博弈引入颤抖手均衡的概 念。颤抖手均衡的基本思想是,任何一个博弈中, 每一个参与人都有一定的可能性犯错误(类似一个人 用手抓东西时,手一颤抖,他就可能抓不住他想抓 的东的);一个战略组合,只有当它在允许所有参与 人都可能犯错误时仍是每一个参与人的最优战略的 组合时,才是一个均衡。
To 1,任意的混合策略 p1 (s, u, v) , 都有 U1 (L, L) 3 U1 ( p1, L) 3s u v
To 2,任意的混合策略 p2 (h, k ) , 都有
U 2 ( L, L) 1 U 2 ( L, p2 ) k
构造序列
设参与人1的一个混合策略为:
1
L (2,2)
M
R
2 B U
~
U
~ 1
B
(3,1)
(0,0)
(1,0)
(0,1)
~ ~ +0*(1- ~ ) ≤ 0* ~ ~), 1* + 1*(1- ≤1/2,,如果博弈进 入参与人 2 的信息集,他将选择 B 。显然, R 弱劣于 M 。因 此,在博弈开始,参与人2不应该认为参与人1会以任何正 的概率选择R;如果博弈进入参与人 2的信息集,他应该认 ~ 为参与人1选择~ M的概率是1(即 =1)。在这个要求下,均 1/2)被剔除,只有(M,U; =1)是满足这个 衡(L,B; ≤ 要求的精炼贝叶斯均衡。
10.2 直观标准(更适用信号博弈)
在均衡中,至少有一个类型的参与人1想 偏离均衡。“直观标准”剔除所有这些 不合理的精炼贝叶斯均衡。 “直观标准”将劣战略扩展到相对于均 衡战略的劣战略,从而通过剔除更多的 劣战略的办法缩小均衡数量,进一步改 进了精炼贝叶斯均衡概念。
10.2 直观标准
如果设想不论参与人1在最初选择什么,如果 博弈进入他的第二个信息集,他更可能选择 R’而不是L‘ (因为前者优于后者)。 那么,如果参与人 1 最初选择 R ,参与人 2 应 该选择D. 可见RR’只包含参与人1的一个错误, RL‘包含参与人1的两个错误。
表2参与人2 Nhomakorabea参 与 人 1 P U D
颤抖手均衡定义 : 在 n 人战略式表述博弈 中,纳什均衡( σ1 , …σn ,)是一个颤 抖手均衡,如果对于每一个参与人 i,存 在一个严格混合战略序列 {σm1},使得下 列条件满足: lim (1)对于每一个i, ; ( 2 )对于每一个 i 和 m=1,2, …σi 是对战 略组合σm-i =(σmi,…, σmi-1, σmi+1,…, σmn) 的最优反应,即:对任何可选择的混合 战略σiˊ∈Σi, ui(σi, σm-i)≥ui(σiˊ,σm-i)
图1 不完美信息博弈
剔除劣战略方法正式定义: 令 a 1′ 和 a 1″ 是 参 与 人 1 的 两 个 行 动 , a 1′ , a1″∈A1 。 对 于 参 与 人 2 的 所 有 行 动 a2′ , a2″∈A2 ,如果下列条件成立,我们说对类型 θ1∈θ1的参与人1,a1′弱劣于a1″:
定义:假定(a1*,a2*;μ)是一个精炼贝叶斯 均衡。令 u1* ( θ1 )是类型为 θ1 的参与人 1 的均 衡效用水平。那么, a1′ 是参与人 1 相对于均衡 的劣战略( a1* , a2* ; μ ),如果对参与人 2 的 所有行动,下列条件成立: u1(a1′, a2,θ1)≤u1*(θ1) (至少有一个严格不等式对某些成立。) 进一步,令 Θ1∈Θ是所有满足上述不等式 θ1的 集合,如果Θ1≠Θ,那么,参与人2的非均衡路 径上的合理的后验概率是: (1 a1 ) 0
L
RL'
1-2/m
4/m*m
0,1
-1,2
0,1
1,0
RR'
(2/m)*(1-2/m)
m m i i
在定义中,隐含地假定任何一个参与人 犯错误的机会与其他参与人犯错误的机 会无关 (或者说,颤抖在参与人之间是独 立发生的)。 但是,如上定义的颤抖手均衡并不排除 在重复剔除弱战略过程中被剔除的战略。 这一点可以用表1说明。
表1
参与人2
参 与 人 1
P L RL' RR' 1-2/m 1/m 1/m U 0,1 -1,2 -1,2 D 0,1 1,0 2,3
例、不完全信息动态博弈如下: 1 R (2,2) L M [q] [1-q] R’ R’ L’ L’ (0,0)
(3,1)
(1,0)
(0,1)
求序贯均衡
1 1, q 2 (1,0) 该博弈的PBNE是 (L, L), q 对1来说,最优的混合混合策略是p1=(1,0,0), 对2来说,最优的混合混合策略是p2=(1,0), 均衡战略(L,L’)生成的最优混合策略组合 p=(p1,p2)=((1,0,0),(1,0)), (q 1 , q 2 ) (1,(1,0)) 贝叶斯后验推断 q
尽管精炼贝叶斯均衡的精炼条件剔除了不可 置信的战略 ( 行动 ) ,促它没有剔除不可置信 的信念(后验概率)。 非均衡战略上后验概率的任意性导致了均衡 战略的任意性;当我们把某个行动从潜在均 衡战略中排除掉时,我们同时就将另一些行 动转化为均衡战略。 出现多重均衡是很自然的。
10.1剔除劣战略
10.4 泽尔腾的颤抖手均衡
泽尔腾将非均衡事件的发生解释为“颤抖”: 当一个参与人突然发现一个不该发生的事件发生时 ( 即博弈偏离均衡路径 ) ,他把这个不该发生的事件 的发生归结为某一个其他参与人的非蓄意错误。 通过引入“颤抖”,博弈树上的每个决策结出现的 概率都为正,从而每一个决策结上的最优反应都有 定义,原博弈的均衡可以理解为被颤抖扰动后的博 弈的均衡的极限。
构造序列
设参与人2的一个混合策略为:
p2 m (1 m , m ), 0 m 1. lim m 0
m
1 m 2m
1 1 2m
m 2m
A
1
m
2m
B L (1,0)
C
m
(2,2)
m 1 2m
1 m
第十章 精炼贝叶斯均衡的再精炼 及其他均衡概念
不完全信息博弈可能存在多重精炼贝叶斯均衡,究 竟哪一个均衡实际上出现,依赖于我们如何规定非 均衡路径上的后验概率。 什么是参与人1的均衡战略,依赖于参与人2认为什 么不是他 ( 参与人 1) 的均衡战略,或者说,参与人 2 认为什么是参与人 l的均衡战略,什么就是参与人 1 的均衡战略,均衡是自动实现的。
p1m (1 m 2 m , 2 m , m ), 0 2 m 1, 0 m 1. lim m 0
m
由Bayes公式得到,参与人2的两个结点的概率为:
m 2m m 1 m q = , 2m 2m 1 1
可见,RL‘弱劣于RR’;剔除RL‘后,D弱优于U, 因此,重复剔除弱劣战略得到的纳什均衡是 (RR’ , D),但是,被剔除掉的 (L, U)是一个颤抖手均衡, 这是因为:如果参与人 2 选择 U 的概率非常大 ( 大 于2/3),参与人1的最优选择是L; 另一方面,如果参与人1以1-2/m选择L,1/m的概 率选择 RL‘ 或 RR’( 因此, 2/m 是参与人 1 犯错误的 概 率 ) , 参 与 人 2 选 择 U 的 期 望 效 用 是 (1)(1 - 2/m)+(2)(1/m)+(2 ) (1/m)=1+2/m ,选择 D 的期望 效用是 (1)(1-2/m)+(0)(1/m) 十 (3)(1/m) = 1+1/m , 所以U优于D;令m趋于无穷,我们得到(L,U)是 一个颤抖手均衡。
定义(σ,μ)是一个序贯均衡,如果它满足下列 两个条件: ( 1 ) (σ , μ) 是一个序贯性的:在所有的信息 集 h上,给定后续概率 μ(h) ,没有任何参与人 i 想偏离σi(h);对于所有可行战略σ′i(h),
u i ( h ) ( h, (h)) u i ( h ) ( i( h ) , i ( h ) ) h, (h))
博弈论和纳什均衡
博弈论和纳什均衡Revised on July 13, 2021 at 16:25 pm关于博弈论和纳什均衡你应该知道这些美股腾讯财经微博2015-05-25 10:05我要分享139摘要纳什在与命运的博弈中找到均衡;纪念大师最好的方式就是尝试了解博弈论..腾讯财经综合报道风生奥斯卡获奖电影美丽心灵主角原型、诺贝尔奖得主、美国数学家约翰-纳什日前与妻子在美国新泽西州乘搭的士时遇上车祸;两人均不幸遇难..事发当时;这辆出租车失控撞向栏杆;两人均被抛出车外..约翰-纳什因发表两篇关于非合作博弈论的重要论文;彻底改变了人们对竞争和市场的看法..他证明了非合作博弈及其均衡解;并证明了均衡解的存在性;即着名的纳什均衡..不均衡人生中孕育出均衡论纳什于1928年在美国西弗吉尼亚州出生;曾在麻省理工学院任教;晚年为普林斯顿大学担任数学系教授;死前与82岁妻子艾丽西亚在普林斯顿居住..纳什以研究博弈论闻名;1994年获颁诺贝尔经济学奖..他的理论被运用在市场经济、计算、演化生物学、人工智能、会计、政策和军事理论等多个领域..纳什在数学领域上取得多项突破;但他同时深受精神分裂症困扰;其生平故事在2001年被改编成电影美丽心灵;赢得包括最佳电影在内的4项奥斯卡奖项..尽管西维亚-纳萨斯Sylvia Nasars广为人知的小说美丽心灵A Beautiful Mind和改编自该书的、由拉塞尔-克罗Russell Crowe主演的同名奥斯卡电影探究了纳什错综复杂的生平;但都没有深入挖掘他的数学思想..他的数学成果依然不被大众所熟知..在当今科学界;人们普遍认为;与牛顿和爱因斯坦的数学理论相比;纳什的数学理论触及到的学科更多..牛顿和爱因斯坦的数学旨在处理物理问题;而纳什的数学却可以应用在生物学和社会学领域..如若不是精神疾病的困扰;纳什今天可能已与那些科学伟人齐名..尽管如此;他在几个数学领域的重要贡献大家有目共睹..他最大的成就来自于经济学方面..由于他在博弈论上的开创性成就;他与约翰海萨尼John Harsanyi和莱茵哈德-泽尔腾Reinhard Selten一起获得了1994年诺贝尔经济学奖..什么是博弈论与纳什均衡博弈论 :亦名“对策论”、“赛局理论”;属应用数学的一个分支;主要研究公式化了的激励结构间的相互作用..是研究决策主体的行为发生直接相互作用时候的决策以及这种决策的均衡问题;具有斗争或竞争性质现象的数学理论和方法..也是运筹学的一个重要学科..博弈论考虑游戏中的个体的预测行为和实际行为;并研究它们的优化策略..纳什均衡:又称为非合作博弈均衡;是博弈论的一个重要术语;以约翰-纳什命名..假设有n人局中人参与博弈;给定其他人策略的条件下;每个局中人选择自己的最优策略个人最优策略可能依赖于也可能不依赖于他人的战略;从而使自己利益最大化..所有局中人策略构成一个策略组合..纳什均衡指的是这样一种战略组合;这种策略组合由所有参与人最优策略组成..即在给定别人策略的情况下;没有人有足够理由打破这种均衡..纳什均衡;从实质上说;是一种非合作博弈状态..近代对于博弈论的研究;开始于策墨咯;波雷尔及冯-诺伊曼..1928年;冯-诺依曼证明了博弈论的基本原理;从而宣告了博弈论的正式诞生..1944年;冯-诺依曼和摩根斯坦共着的划时代巨着博弈论与经济行为将二人博弈推广到n人博弈结构并将博弈论系统的应用于经济领域;从而奠定了这一学科的基础和理论体系..1950~1951年;约翰-福布斯-纳什利用不动点定理证明了均衡点的存在;为博弈论的一般化奠定了坚实的基础..纳什的开创性论文n人博弈的均衡点1950;非合作博弈1951等等;给出了纳什均衡的概念和均衡存在定理..此外;塞尔顿、哈桑尼的研究也对博弈论发展起到推动作用..今天博弈论已发展成一门较完善的学科..博弈论起源于研究人们玩扑克poker、象棋chess等室内游戏时的行为决策;后来作为一种研究人类经济行为的数学工具得到了充分的发展..从根本上讲;博弈论涉及到从打网球到指挥战争的任何牵扯策略的情景..博弈论提供了一种计算各种可能决策所产生效益的数学方法;该理论为在各种竞赛性场合做出最佳决定建立了一套具体的数学公式..正如经济学家赫伯特-金迪斯Herbert Gintis所说;博弈论是我们“研究世界的一种工具”..但它不仅仅是一种工具;“它不仅研究人们如何合作;而且研究人们如何竞争”..同时;“博弈论还研究行为方式的产生、转变、散播和稳定..”博弈论与纳什均衡的发展和应用博弈论不是纳什发明的;但他扩大了该理论的范围;为之提供了解决实际问题的更有力工具..在一开始;他的研究成果并没有受到人们的重视..他的文章发表在20世纪50年代;在当时博弈论仅在冷战分析家之间流传;这些分析家认为国际侵略和利益最大化之间有一些相似之处..在经济学界;博弈论还被视为一种新奇事物..经济学家萨缪-鲍尔斯Samuel Bowles告诉我说:“在当时博弈论羽翼未丰;如同经济学中其它许多优秀的思想一样;它还没有受到人们的关注..”然而在20世纪70年代时情况发生了改变;进化论学派的生物学家开始采用博弈论研究动植物中的生存竞争现象..紧接着在20世纪80年代;经济学家终于开始以各种不同方式将博弈论应用于经济学中;尤其是将它用在设计真实试验以验证经济学理论方面..到80年代末博弈论在经济学领域已经充分显示了它的作用; 这最终促成了纳什等1994年诺贝尔经济学奖的获得..早在此之前;博弈论就已经出现在许多学科的课程中..数学系、经济学系、生物学系、还有政治科学系、心理学系和社会科学系的课程中都含有博弈论的内容..到了21世纪初;博弈论的应用更为广泛;涉及到从人类学到神经生物学等多个领域..现今;经济学家继续使用博弈论分析人们如何做出有关金钱的决策;生物学家用它来建立假说以解释适者生存原理和利他主义的起源;人类学家使用它来研究原始文化;从而说明人性的多样化;神经科学者也加入了博弈论研究的行列;通过研究博弈者的大脑;试图发现决策如何反映人们的动机和情感..简言之;纳什的数学理论连同在其在其基础上建立起来的现代博弈论已经成为科学家研究众多与人类行为相关课题时的首选方法..博弈论和纳什均衡的几个经典案例智猪博弈Pigs’payoffs猪圈里有两头猪;一头大猪;一头小猪..猪圈的一边有个踏板;每踩一下踏板;在远离踏板的猪圈的另一边的投食口就会落下少量的食物..如果有一只猪去踩踏板;另一只猪就有机会抢先吃到另一边落下的食物..当小猪踩动踏板时;大猪会在小猪跑到食槽之前刚好吃光所有的食物;若是大猪踩动了踏板;则还有机会在小猪吃完落下的食物之前跑到食槽;争吃到另一半残羹..那么;两只猪各会采取什么策略答案是:小猪将选择“搭便车”策略;也就是舒舒服服地等在食槽边;而大猪则为一点残羹不知疲倦地奔忙于踏板和食槽之间..原因何在因为;小猪踩踏板将一无所获;不踩踏板反而能吃上食物..对小猪而言;无论大猪是否踩动踏板;不踩踏板总是好的选择..反观大猪;已明知小猪是不会去踩动踏板的;自己亲自去踩踏板总比不踩强吧;所以只好亲力亲为了..枪手博弈王者的悲哀..三人对枪自决;甲乙丙枪法优劣递减..最后无奈而神奇的结局;将不取决于同时开枪还是先后开枪;最优良的枪手;倒下的概率将最高;而最蹩脚的枪手;存活的希望却最大..因为没有人会把威胁最小的枪手列为一号清楚目标..在这里;后发制人的弱势者将胜出..以弱胜强;绝不是神话..囚徒困境假设有两个小偷A和B联合犯事、私入民宅被警察抓住..警方将两人分别置于不同的两个房间内进行审讯;对每一个犯罪嫌疑人;警方给出的政策是:如果一个犯罪嫌疑人坦白了罪行;交出了赃物;于是证据确凿;两人都被判有罪..如果另一个犯罪嫌疑人也作了坦白;则两人各被判刑8年;如果另一个犯罪嫌人没有坦白而是抵赖;则以妨碍公务罪因已有证据表明其有罪再加刑2年;而坦白者有功被减刑8年;立即释放..如果两人都抵赖;则警方因证据不足不能判两人的偷窃罪;但可以私入民宅的罪名将两人各判入狱1年..关于这个案例;显然最好的策略是双方都抵赖;结果是大家都只被判1年..但是由于两人处于隔离的情况;首先应该是从心理学的角度来看;当事双方都会怀疑对方会出卖自己以求自保、其次才是亚当-斯密的理论;假设每个人都是“理性的经济人”;都会从利己的目的出发进行选择..这两个人都会有这样一个盘算过程:假如A坦白;B抵赖;B得坐10年监狱;B坦白最多才8年;B要是抵赖;A就可以被释放;而B会坐10年牢..综合以上几种情况考虑;不管A坦白与否;对B而言都是坦白了划算..两个人都会动这样的脑筋;最终;两个人都选择了坦白;结果都被判8年刑期..博弈论和纳什均衡的重要影响博弈论所研究的是理性的决策者之间冲突及合作的理论;可以为实际决策提供理论基础和方向指导..其最终追求结果是使博弈方达到利益最大化的均衡..在生活中;博弈仍然无处不在..博弈论代表着一种全新的分析方法和全新的思想..诺贝尔经济学奖获得者保罗-萨缪尔逊如是说:要想在现代社会做个有价值的人;你就必须对博弈论有个大致的了解也可以这样说;要想赢得生意;不可不学博弈论;要想赢得生活;同样不可不学博弈论..纳什均衡理论奠定了现代主流博弈理论和经济理论的根本基础;正如克瑞普斯Kreps;1990在博弈论和经济建模一书的引言中所说;“在过去的一二十年内;经济学在方法论以及语言、概念等方面;经历了一场温和的革命;非合作博弈理论已经成为范式的中心;在经济学或者与经济学原理相关的金融、会计、营销和政治科学等学科中;现在人们已经很难找到不懂纳什均衡能够‘消费’近期文献的领域..”腾讯财经综合。
博弈均衡模型及其举例
博弈联均衡模型博弈论模型图示博弈可划分为合作博弈和非合作博弈,1人们一般讲到的都是指非合作博弈,它有四种不同类型的博弈,即完全信息静态博弈、完全信息动态博弈、不完全信息静态博弈、不完全信息动态博弈,与上述相对应的是纳什均衡、子博弈精炼纳什均衡、贝叶斯纳什均衡、精炼贝叶斯纳什均衡。
这四种均衡中最为基本的是纳什均衡。
2完全信息静态博弈——纳什均衡、完全信息动态博弈——子博弈精炼纳什均衡不完全信息静态博弈——贝叶斯纳什均衡、、不完全信息动态博弈——精炼贝叶斯纳什均衡,与上述相对应的是、、、。
这四种均衡中最为基本的是纳什均衡。
完全信息静态博弈(纳什均衡)债务人强硬妥协1这两者的区别主要在于人们的行为相互作用时,当事人能否达成一个有约束力的协议:如能达成就是合作博弈;反之就是非合作博弈。
合作博弈强调团体理性,强调效率和公平,非合作博弈强调理性个人的最优决策,其结果是否有效率则是不确定的。
2所谓纳什均衡,指的是所有参与人最优选择的一种组合,在这种组合下,给定其他人的选择,没有任何人有积极性做出新的选择。
纳什均衡的哲学思想是:给定别人遵守协议的情况下,没有人有积极性偏离协议规定的自己的行为规则。
换言之,如果一个协议不构成纳什均衡,它就不可能自动实施,因为至少有一个参与人会违背这个协议,不满足纳什均衡要求的协议是没有意义的。
当博弈中的所有参与人事先达成一项协议,给出每个人的行为规则。
在没有外在强制力约束时,当事人是否会自觉地遵守这个协议?或者说这个协议是否可以自动实施?如果当事人会自觉遵守这个协议,等于说这个协议构成一个纳什均衡。
参见张维迎:“经济学家看法律、文化与历史”,载张维迎《产权、政府与信誉》,三联书店2001年版。
囚徒困境□ 文/柯华庆“囚徒困境”最早是由美国普林斯顿大学数学家曾克1950年提出来的。
他当时编了一个故事向斯坦福大学的一群心理学家们解释什么是博弈论。
这个故事后来成为博弈论最经典的案例。
故事的内容如下:两个犯罪嫌疑人被捕并受到指控,但除非至少其中至少有一个人供认犯罪,警方缺乏足够的证据指证他们所犯的罪行,从而将他们按罪判刑。
博弈论10-均衡概念比较与PBNE的再精炼
表10. 1
参与人2
U (1-p )
参与人1
D(p)
L
10,0 10,1
R
5,2 2,0
在表10.4.1中,(D,L) 是一个纳什均衡(弱劣 战略均衡);只要参与人2不选择R,D就是参 与人1的最优选择;同样,只要参与人1不选择 U,L就是参与人2的最优选择。但是,如果参与 人2有可能错误地选择R,那么,不论这个错误 发生的概率是多么小,参与人1的最优选择就 是U而不是D;预测到这一点,参与人2将选择 R。就是说,(D,L)不是一个颤抖手均衡。对 比之下,(U,R)是—个颤抖手均衡:不论参与
如果设想不论参与人1在最初选择什么,如果 博弈进入他的第二个信息集,他更可能选择 R’而不是L‘ (因为前者优于后者)。
那么,如果参与人1最初选择R,参与人2应 该选择D. 可见RR’只包含参与人1的一个错误, RL‘包含参与人1的两个错误。
表2
参与人2
参
P
U
D
与
人
1
L
1-2/m
0,1
( p, q) lim( pm, qm ) m
所以,(L, L), q1 1, q序2 贯(1均,0衡)
10.4 泽尔腾的颤抖手均衡
泽尔腾(1975)使用战略式博弈引入颤抖手均衡的概 念。颤抖手均衡的基本思想是,任何一个博弈中, 每一个参与人都有一定的可能性犯错误(类似一个人 用手抓东西时,手一颤抖,他就可能抓不住他想抓 的东的);一个战略组合,只有当它在允许所有参与 人都可能犯错误时仍是每一个参与人的最优战略的 组合时,才是一个均衡。
另一方面,如果参与人1以1-2/m选择L,1/m的概 率选择RL‘或RR’(因此,2/m是参与人1犯错误的 概 率 ) , 参 与 人 2 选 择 U 的 期 望 效 用 是 (1)(1 - 2/m)+(2)(1/m)+(2)(1/m)=1+2/m,选择D的期望 效用是(1)(1-2/m)+(0)(1/m)十(3)(1/m)=1+1/m, 所以U优于D;令m趋于无穷,我们得到(L,U)是 一个颤抖手均衡。
第十章 纳什均衡
纳什均衡
甲:不合作是最优的,此时不会改变自己的策略。 条件策略组合(不合作,合作),(不合作,不合
作) 乙:条件策略在不同情况下分别为合作和不合作,
都不会单独改变自己的策略。 (合作,合作)(不合作,不合作)
甲乙都不改变自己的策略,就要求他们的条件策略 应当相同 (不合作,不合作)
嫌犯A
坦白
嫌犯B
坦白
-10 -10
不坦白
-12 -1
不坦白
-1 -12 -2 -2
• 如果两个疑犯都能够选择不坦白的话,他们 将明显地得到一个更大的收益,但由于两人 的信息无法沟通,选择不坦白并不是两人的 理性选择。对于两人而言,不管对方坦白或 是不坦白,自己选择坦白都是更优的选择, 因而,(坦白,坦白)就是均衡战略。
坦白
嫌犯A
坦白
-10 -10
不坦白
-12 -1
不坦白
-1 -12 -2 -2
囚犯困境的占优策略均衡反应了个人理性与团体理性的冲突
(2)囚犯困境模型的扩展应用:寡头厂商合作的不稳定性
卡特尔
寡头A
违约
寡头B
违约
守约
1024 1024
1296 864
守约
864 1296
1152 1152
(3)重复博弈:走出囚徒困境
博弈:多人决策过程
博奕论的基本要素
参与者(博奕方、局中人、对局者):即有哪 些人参与博弈。一般至少有两个参与者。
策略与策略空间:什么人在什么时候行动;当 他行动时,他具有什么样的信息;他能做什么, 不能做什么。
报酬(支付):博弈的结果给参与人带来的好 处。
博弈的类型
(1)合作博弈与不合作博弈 (2)完全信息博弈和不完全信息博弈 (3)静态博弈和动态博弈
策略博弈与纳什均衡
结果
构模者在博弈进行了以后从 行动、收益与别的变量的数 值中取到的一组感兴趣的要 素的集合。
结果代表了的是博弈可能发 生的结局。
囚犯B
不揭发 揭发
囚 犯
不揭发 5,5 -1,6
A
揭发 6,-1 0,0
均衡
博弈中的均衡,记为 s* (s1* , s2* , , sn* ) ,是博弈中 n 个参与者各自都采
博弈里参与者是作出决策的个人。每个决策者 通过选择行动使自己效用极大化。
OPEC组织中,沙特和科威特是参与者,而中 国老百姓并不是参与者。
行动集与行动组合
行 动 集:参与者i 的行动集(action set),记为 Ai ai,是该参与者可能采取 的全部行动之集合。 行动组合:一个行动组合是一个有序集 a ai(i 1,2, n) ,是由一人博弈中 n 个 游戏者各取一个行动而组合成的。
行动是你采取的某种行动方式,只要可能,你都 可以采取;策略是一种有条件的应对行动方案;
行动是一种客观可能性,是可以观察到的。策略 是一种主观的、心理上的应变对策,你不可能观 察到对手心中的策略,并不能见到他心中会设计 好的应对的行动方案。
收益(payoff)
收益就是博弈后给参与者的效用。 参与者与别的参与者选择的策略的函数带给参与者的预期 效用。 收益只是博弈带给参与者的效用,收益不等同于结果。
第三讲 策略博弈与纳什均衡
第一节 基本概念
博弈是对许多人一个策略相互依存的构架中相互作用这 种情况的正式表述。 一个博弈的基本要素:
参与者players 行动actions 信息information 策略strategies 收益payoffs 结果outcomes 均衡equilibrium
博弈论原理与方法-关于均衡的分析
同时自己又要尽可能猜出对方的策略。
在一次博弈中结果取决于机会,在多次重复
中,如果双方决策都正确,则我们可求得平
均的双方收益。彼此得益相同。
绪论-博弈基本要素
参与人players
又称“局中人”或”博弈方”,是指博弈中独
立决策、独立承担后果、以自身利益最大化来
选择行动的决策主体(可以是个人、也可以是
策略,假设寡头2采用低价策略,那么寡头1采用高
价策略得益20,采用低价策略得益60,它也应采用
低价策略。用同样方法可得寡头2也应采用低价策略。
低价-低价对双方不是理想的结果,但因为双方均无
法信任,所以均坚持采用低价策略。
绪论-几个典型模型
猜方
正面
猜硬币游戏
反面
正面
盖方
反面
分析:
在本博弈什均衡动态化,加入了
接近实际的不完全信息条件。他们的工作为后
人继续发展博弈论,提供了基本思路和模型
绪论-博弈论的历史沿革
博弈论根据其所采用的假设不同而分为合作博
弈理论和非合作博弈理论。两者的区别在于参
与人在博弈过程中是否能够达成一个具有约束
力的协议(binding agreement) 。倘若不能,则
博弈理论开始于1944年由冯·诺依曼(Von
Neumann)和摩根斯坦恩(Oskar Morgenstern)合
作的《博弈论和经济行为》(The Theory of
Games and Economic Behaviour)一书由Princeton
University Press出版。
20世纪50年代以来,纳什(Nash)、泽尔腾
纳什均衡的扩展与精炼博弈理论及其应用.ppt
贝叶斯纳什均衡与一般纳什均衡的不同点
• (1)贝叶斯纳什均衡用贝叶斯公式得到的,以概率分布作
为依据,考虑自己的期望收益。贝叶斯静态博弈中的期望收
益是对其它局中人不同类型下的期望收益,而不是自己类型
下的期望收益。 • (2)贝叶斯纳什均衡研究的是局中人的策略选择,并且这 种策略选择依赖于自身的类型,当类型不同时,它们选择的 策略就不一样。
海萨尼转换
(1)引入一个虚拟的局中人——“自然”(nature) 或者说是“上帝”(God),他不用考虑自己的得失,他 的唯一作用就是赋予博弈中各局中人的类型向量 Ti t (t1 ,, t n ) ti 其中 属于可行类型空间 ( Ti 为局中人的特征的完备描述); • (2)自然只把局中人 i 的真实的类型 t i 告诉局中人i 本人,却不让其他局中人知道。但“自然”将把在 t (t1 ,, t n ) 概率分布 p(t1 , , t 上的 告诉每一个局中人; n)
t i T i
则称混合策略组合
个混合 x t , x t ,, x t ,, x t是一
* 1 1 * 2 2 * i 1 * n n
策略贝叶斯纳什均衡。 这里的 E 是指对混合策略 中人 i 的收益u i 期望。
x t , x t ,, x t ,, x t下局
§3.1.3 贝叶斯静态博弈的典型模型
§3.1.1 不完全信息博弈与海萨尼转换
不完全信息的含义与形式
海萨尼转换 例 3.1.1 不完全信息的行业博弈
不完全信息的含义
不完全信息博弈中的不完全信息具有特定含义,它
专指一种博弈局势中局中人对其他局中人与该种博弈局
势有关的事前信息了解不充分,而不是博弈中产生的与
对博弈学习理论的阐述与分析--分析博弈演变及其均衡的重要方法
比重和其得益超过平均得益的幅度成正比。因此,在上述问题中采用
策略1的博弈方比例 的变化速度,可以用微分方程来表示:
(6)
若限定
的数值, 的一元函数,该复制动态最多可
能有三个稳定点,分别是
和
,其中前两
个稳定点意味着群体成员趋向于采用相同的策略(1或2),后一
个稳定点意味着群体成员以一定比例采用不同策略,前者对应完
一、研究背景
绝大多数非合作博弈理论集中研究博弈中的均衡问题,尤其
是纳什均衡及其精炼,比如精炼纳什均衡。这就引发一个问题:
什么时候以及为什么我们可以预期在一个博弈中观察到的行动与
这些均衡中的一个相对应。对均衡的传统解释是,均衡是在博弈
的规则、参与人的理性以及参与人的支付函数都是共同知识的情
况下,由参与人的分析和自省所得出的结果。不论是在概念还是
是对特定的估价可能有不止一个最优反应,所以并没有唯一的虚拟行动
准则。和“近视调整过程”中的更新规则相比,虚拟行动的优点在于只
要所有的初始权重为正值,则不存在分配概率为0的有限样本。
(三)模仿者(复制)动态与进化稳定性
当参与者理性层次较低,理性意识、分析推理能力、识别判断能
力、记忆能力等多方面非完美,将这种参与者组成的大群体成员的随
度也存在差异。有限理性意味着博弈方只有在博弈过程中通过试
博弈论最全完整-讲解课件
• 王则柯、李杰编著,《博弈论教程》,中国人民大学 出版社,2004年版。
• 艾里克.拉斯缪森(Eric Rasmusen)著,《博弈与信 息:博弈论概论》,北京大学出版社,2003年版。
• 因内思·马可-斯达德勒,J.大卫·佩雷斯-卡斯特里罗著, 《信息经济学引论:激励与合约》,上海财经大学出版 社,2004年版。
学习交流PPT
17
约翰· 海萨尼 1920年 生于美 国
约翰·纳什 1928年生于美国
莱因哈 德·泽尔 腾, 1930 年生于 德国
学习交流PPT
18
1996年诺贝尔经济学奖获得者
英国人詹姆斯·莫里斯 (James A. Mirrlees)和 美国人威廉-维克瑞(William Vickrey)
托马斯·谢林
学习交流PPT
24
导论
三、博弈论的基本类型
学习交流PPT
25
合作博弈与非合作博弈
• 合作博弈(cooperative game) 达成有约束力的协议(binding
agreement),强调团体理性,强调效率、公 正、公平 • 非合作博弈(non-cooperative game)
强调个人理性,其结果可能有效率,也可能 无效率。
三位美国学者乔治-阿克尔洛夫(George A. Akerlof)、迈克尔-斯彭斯(A. Michael Spence)和约瑟夫-斯蒂格利茨(Joseph E. Stiglitz)
获奖理由:在“对充满不对称信息市场进行分 析”领域做出了重要贡献。
学习交流PPT
21
迈克尔·斯彭斯 1948年生于美国的 新泽西,1972年获 美国哈佛大学博士 头衔,现兼任美国 哈佛和斯坦福两所
• 也就是说,需要的是对这样的情况下该选什么 的预期的收敛。这一使得参与者能够成功合作 的共同预期的策略被称为焦点。心有灵犀一点 通。
博弈论与纳什均衡
第22卷哈尔滨师范大学自然科学学报Vol .22,No .42006第4期NAT URAL SC I E NCES JOURNAL OF HARB I N NOR MAL UN I V ERSI TY博弈论与纳什均衡郭 鹏(中国矿业大学)杨晓琴(鸡西大学)【摘要】 纳什均衡的提出和不断完善,为博弈论广泛应用于经济学、管理学、社会学、政治学、军事科学等领域奠定了坚实的理论基础.关键词:博弈论;纳什均衡;非合作博弈收稿日期:2006-02-150 引言博弈论又称对策论,是使用严谨的数学模型研究现实世界中冲突对抗条件下最优决策问题的理论.两千多年前,孙膑利用博弈论原理帮助田忌赛马取胜,就是早期博弈论的萌芽.作为一门正式学科,博弈论是在20世纪40年代形成并发展起来的,合作型博弈在20世纪50年代达到了巅峰期.然而,它过于抽象,实用性不强,其局限性日益暴露出来.50年代以来,纳什(Nash )、泽尔腾(Selten )、海萨尼(Harsanyi )等人使博弈论成熟并最终进入实用.最近三四十年,经济学经历了一场“博弈论革命”,引入博弈论的概念和方法改造经济学的思维,推进经济学的研究.1994年诺贝尔经济学奖授予3位博弈论专家纳什、泽尔腾和海萨尼,可以看作是一个标志,这也激发了人们了解博弈论的热情.博弈论作为现代经济学的前沿领域,已成为占据主流地位的基本分析工具.简单地说,博弈论研究决策主体在给定信息结构下如何决策以最大化自己的效用,以及不同决策主体之间决策的均衡.博弈论由3个基本要素组成:一是决策主体(Player ),又可以译为参与人或局中人;二是给定的信息结构,可以理解为参与人可选择的策略和行动空间,又叫策略集;三是效用(U tility ),是可以定义或量化的参与人的利益,也是所有参与人真正关心的东西,又称偏好或支付函数.参与人、策略集和效用构成了一个基本的博弈.1 博弈论的主要思想一个完整的博弈应当包括五个方面的内容:第一,博弈的参加者,即博弈过程中独立决策、独立承担后果的个人和组织:第二,博弈信息,即博弈者所掌握的对选择策略有帮助的情报资料;第三,博弈方可选择的全部行为或策略的集合;第四,博弈的次序,即博弈参加者做出策略选择的先后;第五,博弈方的收益,即各博弈方做出决策选择后的所得和所失.博弈论模型可以用五个方面来描述:G ={P,A,S,I,U )P:为局中人,博弈的参与者,也称为“博弈方”,局中人是能够独立决策,独立承担责任的个人或组织,局中人以最终实现自身利益最大化为目标.A:为各局中人的所有可能的策略或行动的集合.根据该集合是有限还是无限,可分为有限博弈和无限博弈,后者表现为连续对策、重复博弈和微分对策等.S:博弈的进程,也是博弈进行的次序.局中人同时行动的一次性决策的博弈,称为静态博弈;局中人行动有先后次序,称为动态博弈.I:博弈信息,能够影响最后博弈结局的所有局中人的情报.信息在博弈中占重要的地位,博弈的赢得很大程度上依赖于信息的准确度与多寡.得益信息是博弈中的重要信息,如果博弈各方对各种局势下所有局中人的得益状况完全清楚,称之为完全信息博弈.反之为不完全信息博弈.在动态博弈中还有一类信息:轮到行动的博弈方是否完全了解此前对方的行动.如果完全了解则称之为“具有完美信息”的博弈.反之称为“不完美信息的动态博弈”.由于信息不完美,博弈的结果只能是概率期望,而不能像完美信息博弈那样有确定的结果.U:为局中人获得利益,也是博弈各方追求的最终目标.根据各方得益的不同情况,分为零和博弈与变和博弈.零和博弈中各方利益之间是完全对立的.变和博弈有可能存在合作关系,争取双赢的局面.博弈论根据其所采用的假设不同而分为合作博弈理论和非合作博弈理论.前者主要强调的是团体理性;而后者主要研究人们在利益相互影响的局势中如何选择策略使得自己的收益最大,即策略选择问题,强调的是个人理性.两者的区别在于参与人在博弈过程中是否能够达成一个具有约束力的协议.倘若不能,则称非合作博弈,非合作博弈是现代博弈论的研究重点.博弈的划分可以从参与人行动的次序和参与人对其他参与人的特征、战略空间和支付的知识(信息)是否了解两个角度进行.把两个角度结合就得到了4种博弈:完全信息静态博弈,完全信息动态博弈,不完全信息静态博弈,不完全信息动态博弈.严格地讲,博弈论并不是经济学的一个分支,它只是一种方法,这也是为什么许多人将其看成数学的一个分支的缘故.博弈论已经在政治、经济、外交和社会学领域有了广泛的应用,它为解决不同实体的冲突和合作提供了一个宝贵的方法.目前谈到博弈论主要指的是非合作博弈,也就是各方在给定的约束条件下如何追求各自利益最大化,最后达到力量均衡.在这一点上,博弈论和经济学家的研究模式是完全一样的.经济学越来越转向人与人关系的研究,特别是人与人之间行为的相互影响和相互作用,人与人之间利益和中突、竞争与合作,而这正是博弈论的研究对象.2 博弈论的代表人物博弈论主要是由冯・诺依曼(1903~1957)所创立的.他是一位出生于匈牙利的天才的数学家.他不仅创立了经济博弈论,而且发明了计算机.早在20世纪初,塞梅鲁(Zer mel o)、鲍罗(Borel)和冯・诺伊曼(Von Neumann)已经开始研究博弈的准确的数学表达,直到1939年,冯・诺依曼遇到经济学家奥斯卡・摩根斯坦思(O skar Morgenstern)并与其合作才使博弈论进入经济学的广阔领域.1944年他与奥斯卡・摩根斯坦恩合著的巨作《博弈论与经济行为》出版,标志着现代系统博弈理论的初步形成.书中提出的标准型、扩展型和合作型博弈模型解的概念和分析方法,奠定了这门学科的理论基础.合作型博弈在20世纪50年代达到了巅峰期.然而,诺依曼博弈论的局限性也日益暴露出来,它过于抽象,应用范围受到很大限制,在很长时间里,人们对博弈论的研究知之甚少,只是少数数学家的专利,影响力很有限.正是在这个时候,非合作博弈———“纳什均衡”应运而生了,它标志着博弈论的新时代的开始.纳什是一位天才式的人物,上大学时就开始从事纯数学的博弈论研究,特别是在经济博弈论领域,他做出了划时代的贡献,是继冯・诺依曼之后最伟大的博弈论大师之一.他提出的著名的纳什均衡的概念在非合作博弈理论中起着核心的作用.后续的研究者对博弈论的贡献,都是建立在这一概念之上的.由于纳什均衡的提出和不断完善,为博弈论广泛应用于经济学、管理学、社会学、政治学、军事科学等领域奠定了坚实的理论基础.纳什博士1950年11月刊登在美国全国科学院每月公报上的两篇论文将冯・诺依曼的“最小最大原理”推广到非合作博弈领域,找到了普遍化的方法和均衡点,比冯・诺伊曼的合作博弈理论更能反映现实的情况.20世纪50年代以后,泽尔腾、海萨尼等人对博弈论作了进一步的完善,使之更为实用.近20年来,博弈论作为分析和解决冲突和合作的工具,在管理科学、国际政治、生态学等领域得到广泛的应用.3 纳什均衡与博弈论的应用“囚徒困境”(Pris oner’s D ile mma)至今仍然是博弈研究的重要课题.两个嫌疑犯作案后被警察62哈尔滨师范大学自然科学学报 2006年逮捕,分别关在不同的屋子里审讯,警察告诉他们,如果两个人都坦白,那么每人判刑8年;如果两个人都抵赖,每人各判刑1年;如果其中一人坦白,另一人抵赖的话,坦白的人释放,抵赖的人判刑10年.这里每个囚徒都有两种战略:坦白或抵赖;在这个博弈中,纳什均衡是(坦白,坦白),尽管从总体上看,(抵赖、抵赖)是对两个人都有益的结果,但由于不构成纳什均衡,所以不是该博弈的解,给定B坦白的情况下,A的最优战略是坦白;同样,A坦白的前提下,B的最优战略是坦白, AU最优战略的组合却不是总体最优的选择,有没有可能其中一个选:择抵赖呢?按照人是理性的假设,没有人会积极地这么做,因为如果对方坦白的话,自己就可能判刑10年,理性的人是不会冒这种险的。
