智能体也“囚徒困境”设置强迫机制要求合作

核心提示大数据文摘出品来源:venturebeat编译:赵吉克最近DeepMind提出了一种新的强化学习技术,这种技术以一种全新方式来模拟人类行为。它可能会比之前发布的人工智能决策系统更强大,这对希望通过自动化提高生产率的企业来说可能是个福音。如何

由大数据文摘制作

来源:venturebeat

赵编译

最近,DeepMind提出了一种新的强化学习技术,它以一种新的方式模拟人类的行为。它可能比之前发布的人工智能决策系统更强大,对于希望通过自动化提高生产力的企业来说,这可能是一个福音。

如何解决多方零和博弈中的合作困境?

DeepMind使用强化学习来最大化AI的好处。这是一个基于互惠契约机制的经济竞争模型,允许多方博弈中的联盟。这篇论文的作者之一说,这种联盟具有单枪匹马所不具备的特殊优势。

长期以来,零和博弈以其丰富的策略选择空和清晰的策略评估指导着人工智能的研究。更重要的是,这种竞争广泛存在于生物界、市场经济乃至AlphaZero。

DeepMind科学家首先寻求从数学上定义形成联盟的挑战,并注意到联盟形成多人零和游戏的事实——即在数学表示的情况下,每个玩家的收益或损失的效用是其他玩家完全平衡损失或收益的效用。

什么是多方零和博弈?

DeepMind将其定义为,每个玩家的得失完全由其他玩家的得失提供。在一个对称的多方零和博弈中,每个参与者的行为模式都是一样的,这往往会导致社交困难。

零和博弈引入了合作,事情变得很复杂。在紧急情况下,团队必须内部协调,以便在游戏中有效竞争。形成合作的过程本身就是一个社会困境——直觉上,玩家应该合作去打败别人,但又要求个人为了合作团队内部更广泛的利益做出妥协,但这种牺牲未必与自身利益一致。此外,决定加入或离开哪个团队以及团队策略都是重要的问题。

DeepMind尝试了一个“礼物游戏”,由AI扮演的玩家从一堆标有自己代表颜色的数字芯片开始。在每个玩家的回合中,他们必须拿出自己相应颜色的筹码给另一个玩家,或者丢弃它们。当所有玩家失去相应颜色的数字筹码时,游戏结束。此时,拥有最多彩色筹码的玩家获胜,获胜者平分价值为“1”的筹码,其他玩家平分价值为“0”的筹码。

发现玩家往往很自私,他们囤积筹码,以至于出现了三方平局。但实际上,如果两个玩家交换筹码,回报会更好。DeepMind是这样解释这个过程的:虽然合作可以带来更好的结果,但是每个人都想从欺骗中获利,也就是说,说服对方交换,然后食言。

也就是说,如果存在维持合作行为的机制,那么强化学习就可以适应这个博弈。这个机制就是契约——在游戏中,每个玩家必须提交一个提议,首先选择一个伙伴,然后为那个伙伴提出一个动作,最后是玩家承诺要采取的动作。如果两个玩家提供相同的契约,那么这些契约是有约束力的,也就是说,环境强制执行承诺的操作。

这种强制性机制是合作形成的基础。

这个模型允许我们在更广泛的应用环境中考虑契约的作用。如果一个没有强制执行机制的契约系统能够在多方动态博弈中持续运行,最终会产生一个有价值的反馈回路,将AI的应用引向社会学和经济学。

 
友情链接
鄂ICP备19019357号-22