璧岀寰锋墤

核心提示乾明 发自 凹非寺量子位 出品 | 公众号 QbitAI还记得那个玩德扑的AI吗?没错,就是Libratus,中文名冷扑大师,在2017年举办的德扑人机大战中,一举成名。在2017年的比赛中,它历时20天,战胜四位顶级人类德扑玩家,赢得17

法明由奥菲斯量子比特出品|微信官方账号QbitAI

还记得扮演德普的AI吗?

没错,就是Libratus,冷机器人大师的中文名,在2017年举办的德国机器人大战中一举成名。

在2017年的比赛中,历时20天,击败了4名顶级人类机器人选手,赢得了176万美元的奖金,引起了众多关注。

很多人都很好奇,这个AI可以通过打牌来实现吗?

但它并没有继续它的“赌神”之路,而是把钱花在了军事领域:它获得了美军两年1000万美元的合同。

对此,它的开发者Tuomas Sandholm教授没有透露太多细节,只说它可以在模拟战争中做出军事决策,比如在哪里部署军事单位。

另有一些研究人员表示,冷扑大师背后的技术可以更好地让战争游戏和模拟演习发挥应有的作用,有助于提高军队的作战水平。

美军看中了什么?

冷大师是在游戏的基础上诞生的。和其他棋类AI相比,差别很大。

在围棋、象棋等棋类游戏中,双方可以共享所有信息。在博弈论中,这被称为“完全信息博弈”。

在德州扑克中,并不是所有的牌都发,每个人的牌对其他玩家都是隐藏的。任何时候,任何玩家都只能观察一部分情况,然后做出相应的决策。

这是一个“不完全信息”的博弈。在现实世界中,不完全信息是常态,各种看不见的隐藏信息产生了大量的不确定性。

尤其是在军事场景中,各种间谍和反间谍工作错综复杂,如何做出最正确的决定始终是个难题。

能够在德普这种信息不完善的场景下打败人类顶尖高手,证明了冷普大师的价值。

那么,它是怎么做到的呢?

原则背后

冷大师的核心概念是纳什均衡,他应用的是反事实后悔最小化算法,类似于强化学习,但效率更高。

早期版本主要由三个模块组成。一个是赛前用的,另外两个是比赛时用的。

赛前模块是纳什均衡逼近,利用蒙特卡罗CFR算法提取最重要的博弈信息,比如针对某手牌对应的策略,应用强化学习等方法寻求改进和提高。

竞赛过程中的模块是残局解和持续自我强化。

前者是针对对手的。对手出新招后,冷普大师会解残局,找到最佳应对策略。这个过程会在比赛中继续。

后者是针对自己的,用来找出自己的漏洞,找到更多的细节进行自我强化,进而得到更好的纳什均衡。

更多细节由桑德霍尔姆教授写在相关论文中。这篇论文获得了2017年NIPS最佳论文奖。

这样,实时求解的过程耗费了大量的计算能力。您需要至少50台笔记本电脑来运行冷泵大师。

但一对一无限德比比赛,每手需要50个CPU进行计算,响应速度无法保证。

不断进化

2018年5月,桑德霍尔姆教授的团队提交了一篇新论文。

本文介绍了一种有限深度的求解方法,允许对手在有限深度的情况下为剩余的博弈选择多种策略。

每个策略将为叶节点生成一组不同的值,从而使代理对对手可能采用的不同策略具有鲁棒性。

这样利用一个4核CPU和16G内存提供的计算能力,就可以打败之前的两个顶级代理。

一个是2016年电脑扑克大赛冠军宝贝Tartanian8,一个是2018年电脑扑克大赛冠军Slumbot。

而且反应速度堪比人类高手,平均每手只有20秒。

11月,桑德霍尔姆教授的团队提交了另一篇论文。

这一次,他们介绍了一些优化CFR算法的方法。它们是:

在迭代初期采用各种策略降低后悔值,在某些情况下对正负后悔值采用不同的方式。采用各种策略再次迭代,得到更好的输出策略。采取非标准化的方式,把后悔值降到最低。使用乐观后悔值匹配。这些方法可以帮助CFR算法在许多环境中提高性能。

在测试中发现,与传统蒙特卡罗CFR算法相比,采用这些策略的蒙特卡罗CFR算法在德州扑克中具有更好的性能。

更多细节,你可以看报纸。

越来越多的军事人工智能

2018年初,桑德霍尔姆教授创办了一家名为“战略机器人”的公司,将冷普大师的技术军事化。

8月下旬,该公司与美国军方签署了一份为期两年、价值1000万美元的合同。这份合同被认为是对国防创新部门的支持。

这是一个成立于2015年的组织,在五角大楼工作,旨在帮助美国军方更快地利用新兴商业技术。

在军事化的道路上,冷普大师并不孤单。

2017年,时任美国国防部长的詹姆斯·马蒂斯(James Mattis)表示,国防部在采用机器学习等技术方面远远落后于科技公司。

同年,五角大楼启动了一项名为Project Maven的计划,旨在通过商业AI技术改变军事行动的方式。

在最初的项目中,机器学习技术被用于标记无人机监控视频中的对象。参与者包括人工智能初创公司和包括谷歌在内的大公司。

军方对AI越来越大的兴趣让所有推进基础技术的人感到不安。

2018年,在数千名谷歌员工联合抵制,学术大牛联合反对后,谷歌退出了五角大楼的Project Maven计划,并发布了使用AI的七项原则。

其中包括不将AI技术应用于开发武器等等。

不过,谷歌也表示,将继续与政府和军方在AI方面进行合作,比如网络安全、培训和征兵等。

在桑德霍尔姆教授看来,对军方使用AI的担忧被夸大了。他认为这项技术对于保护国家安全和提高作战效率非常重要。

“我认为这将使世界更加安全,”他说。

 
友情链接
鄂ICP备19019357号-22