博弈论思想

核心提示雷锋网AI科技评论按:博弈论在现代人工智能解决方案中正扮演着至关重要的角色,深度强化学习正是积极拥抱博弈论的头等公民。从单智能体程序到复杂的多智能体深度强化学习环境,博弈论原理贯穿了 AI 程序的整个生命周期。而反过来,DRL 的快速演化也

雷科技评论出版社:博弈论在现代人工智能解决方案中发挥着至关重要的作用,深度强化学习是积极拥抱博弈论的一等公民。

从单智能体程序到复杂的多智能体深度强化学习环境,博弈论的原理贯穿了AI程序的整个生命周期。另一方面,DRL的快速演变引起了人们对博弈论研究的关注。

目前,大多数DRL模型仍处于传统的博弈论中,如纳什均衡或零和博弈。然而,随着DRL的发展,传统的博弈论方法逐渐显示出其不足,同时一些新的博弈论方法被纳入到人工智能程序中。

所以对于我们来说,如果要进一步优化深度强化学习的模型,融入新的博弈论方法是一个值得考虑的方向。

以下三种是对DRL有深远影响的“新”博弈论方法,也许可以用在你的模型中,大大提高模型的性能。

第一,一般的场地游戏

在博弈论家族中,平均场博弈还是一个比较新的领域。

平均博弈论诞生于2006年。这个理论是由两个团队独立提出的,一个是蒙特利尔的黄敏仪、罗兰·马尔罕和彼得·盖恩斯,另一个是巴黎的让-米歇尔·拉斯里和菲尔兹奖获得者皮埃尔-路易·莱昂斯。

从概念上讲,平均场博弈论是一种方法和技术的结合,用于研究一大群“理性玩家”中的微分博弈。这些代理不仅对自己的状态有偏好,还会关注其他代理在整个样本分布中的位置。场博弈理论研究这些系统的广义纳什均衡。

平均游戏的经典案例是如何训练鱼向同一个方向游或者以合作的方式游。

这种现象理论上很难解释,但其本质是鱼会根据最近鱼群的行为做出反应。更具体地说,每条鱼并不关心其他个体鱼的行为,而是关注附近作为一个整体移动的鱼群的行为。

如果用数学方程来表达这个原理,一方面可以用Hamilton-Jacobi-Bellman方程来描述鱼对周围鱼群的反应,另一方面可以用Fokker-Planck-Kolmogoroy方程来表达所有鱼的决定整个鱼群行动的行为集合。

平均博弈论就是这两个方程的结合。

从深度强化学习的角度来看,平均场博弈理论在研究大量智能体在广泛环境中的表现方面具有重要作用。

并且已经被实验和理论证明,现有的DRL方法在“逼近无限个智能体,假设不精确的概率模型进行运算”的环境下,不具备实际的可用性。

然而,MFG是一种模拟这种DRL环境的有趣方法,值得一试。

一家名为Prowler的创业公司最近对大型多智能体环境中平均场博弈论的性能进行了研究。

第二,随机游戏

随机博弈最早可以追溯到20世纪50年代,由诺贝尔经济学奖获得者劳埃德·沙普利提出。

理论上,随机游戏的规则是,允许有限数量的玩家在有限数量的状态空下进行游戏,每个玩家在每个状态空下从有限数量的行为中选择一个行为。这些行为的综合结果将决定玩家获得的奖励,并得到下一个状态空的概率分布。

随机博弈的经典案例是哲学家的晚餐问题:n+1个哲学家围坐在一张圆桌旁,中间放一碗米饭。一根筷子将被放在两个相邻的哲学家之间,供他们使用。因为桌子是圆的,有多少哲学家就有多少筷子。为了从碗里拿东西吃,哲学家需要同时从两边拿一双筷子。因此,当一个哲学家吃饭时,他的两个邻居不能同时吃饭。哲学家的生活是如此简单,他们只需要吃饭和思考,但为了生存,哲学家需要不停地思考和吃饭。这个游戏的任务是设计一个能让所有哲学家都活下去的系统。

DRL已经开始应用随机博弈理论来解决多人游戏问题。在许多多人游戏中,AI代理团队需要评估如何通过与其他代理合作和竞争来最大化积极结果。

这个问题通常被称为探索-利用困境。在DRL agent中构建随机博弈的动力机制,可以有效平衡DRL agent在探索能力和利用能力上的发展。在训练AI掌握雷神之锤III游戏的工作中,DeepMind已经融合了随机博弈论中的一些概念。

第三,进化博弈

进化博弈论的灵感来自达尔文的进化论。

EGT的起源可以追溯到1973年,John Maynard Smith和George R.Price采用“策略”分析将进化竞争形式化,并建立了数学标准来预测不同竞争策略的结果。

从概念上讲,EGT是博弈论在进化场景中的应用。在这个博弈中,一群智能体通过反复选择的进化过程,不断地与多样化的策略互动,从而创造出稳定的解。

其背后的思想是,许多行为涉及一个群体中多个主体之间的交互,而某个主体的成功与否取决于其策略如何与其他主体的策略交互。

经典博弈论关注的是静态策略,即参与者采取的策略不会随着时间而改变。与经典博弈论不同,进化博弈关注的是策略如何随时间进化,以及在进化过程中哪种动态策略是最成功的。

EGT的经典案例是老鹰和鸽子的博弈,模拟了老鹰和鸽子对可分享资源的竞争。游戏中的每个竞争者遵循以下两种策略之一:

鹰:天生强壮好斗,除非受重伤,否则绝不会退缩。鸽子:面对强大的攻击会立刻逃跑。假设:

1)两只攻击力一样强的老鹰打架,难免会发生冲突,两人都有受伤的可能;

2)冲突的代价是每个人都受到一定程度的损失,这个损失用一个常数C来表示;

3)如果老鹰遇到鸽子,鸽子会立刻逃跑,而老鹰会占有资源;

4)两只鸽子相遇,会公平分享资源。鸽子游戏的相应好处可以用下面的矩阵来概括:

EGT似乎是专门为DRL环境设计的。

在多智能体DRL环境中,智能体在相互交互的过程中会周期性地调整自己的策略。EGT是模拟这些相互作用的有效方法。最近,OpenAI演示了这种动态训练的代理在玩捉迷藏游戏时的性能。

 
友情链接
鄂ICP备19019357号-22