据雷锋网《AI技术评论》报道,随着AI系统在现实生活中变得越来越重要,我们探索不同系统之间的交互是很自然的。这些多智能体使用了哪些独特的方式?
在DeepMind的最新论文中,研究人员利用博弈论来阐明这个问题。雷锋。com了解到,具体来说,他们研究了两组智能系统在不对称游戏游戏中的反应和表现,包括Leduc扑克和一些图表游戏。

在现实生活中,我们会遇到很多类似于非对称博弈的场景,自动拍卖就是其中之一。在这个过程中,会有很多AI扮演的买家或者卖家混入其中,而真正参与其中的人类买家和卖家也都有自己的小算盘。最终的测试结果让研究人员对这种奇怪的情况有了深刻的理解,他们也想出了一个相当简单的分析方法。
虽然DeepMind的主要目标是如何将博弈论应用于多个AI系统的交互,但研究人员获得的结果也可以用于经济学、生物进化和经验博弈论等学科。
众所周知,博弈论是数学领域的重量级理论。研究者通常用它来研究决策者在竞争情境中的策略。这个理论几乎可以普遍应用于人类、动物和计算机世界。但在AI研究中,一般用于“多智能体”环境的研究。比如几个家用机器人协同打扫房间就是应用场景之一。
一般来说,多智能体系统的演化动力学是用简单的对称博弈理论来分析的,比如经典的囚徒困境理论。虽然这类游戏可以帮助我们了解多智能体系统的工作模式,告诉我们如何达到“你好,爱,爱,爱,爱”的理想结果,但它并不能模拟所有的情况。
DeepMind的新技术使研究人员能够在更复杂的不对称游戏中快速轻松地找到实现纳什均衡的策略,在这些游戏中,玩家通常有不同的策略、目标和奖励。如果想知道DeepMind是如何用新技术“破解”这类游戏的,可以试着了解一下“性别游戏”,这也是博弈论研究的经典案例之一。

在“性别游戏”中,两个玩家要协调晚上去哪里玩,是去看歌剧还是看电影?可惜他们一个更喜欢歌剧,一个更喜欢电影。在这样的情况下,不对称就出现了,因为即使两个人都同意,其中一个也会不高兴。所以为了维持两者之间的友谊或者平衡,队员之间应该共进退。
这个游戏中有三个“接近”的均衡:
两个玩家都决定去看歌剧,两个玩家都选择去看电影,这是一个混合选项,即每个玩家都在五分之三的夜晚享受自己的心灵。
第三个选项是一个“不稳定”的选项,用DeepMind的方法很容易简化或分解,不对称的博弈会转化为对称的对应物。该方法将两个局中人的奖励表看作独立的两人对称博弈,从而很容易找到原非对称博弈的纳什均衡点。

下图中,图B和图C的纳什均衡点很容易找到。在他们的帮助下,我们可以找到不对称博弈中图A中的最佳策略。当然,我们也可以通过非对称博弈在对应方找到均衡点。
红点代表纳什均衡。对于非对称博弈,纳什均衡可以从两个具有代表性的对应图中找到。如图,X轴和Y轴分别代表玩家1和2选择看歌剧的可能性。
这种方法也可以应用到其他游戏中,比如Leduc Poker,研究人员在本文中对此进行了详细的解读。无论如何,这个方法足够简单。可以帮助玩家快速直观地分析不对称博弈,进而帮助我们了解不同的动态系统,包括多话题环境下的系统交互。
Via。深度思维
地址:https://www.nature.com/articles/s41598-018-19194-4,雷锋网编译


