启元世界获多智能体竞赛组冠军,决策智能平台价值凸显

核心提示八千多位来自全世界的人工智能研究人员齐聚加拿大蒙特利尔,讨论分享过去一年全世界在人工智能的各个领域的最新进展,该会议举办了一系列竞赛来鼓励学术界和工业界一起解决最有挑战性的人工智能难题。作为人工智能领域历史最悠久的学术会议之一,会议成果被视

来自世界各地的8000多名AI研究人员齐聚加拿大蒙特利尔,共同探讨和分享过去一年AI各领域的最新进展。大会举办了一系列比赛,鼓励学术界和工业界共同解决最具挑战性的AI问题。作为人工智能领域最古老的学术会议之一,会议成果被视为人工智能领域研究的“风向标”。

其中,在游戏AI领域久负盛名的谷歌大脑、脸书、牛津大学和纽约大学联合举办的多智能体竞赛——投弹手团队竞赛尤为引人注目。由启源世界鹏鹏博士、中科院计算所庞亮助理研究员、北师大袁宇峰博士组成的团队与来自美、欧、日、中的24支一流团队展开激烈角逐。最终,基于启元决策智能平台培养的Navocado双代理能力稳步提升,获得学习组冠军,展示了来自中国的决策智能团队的世界级技术实力。

凯世界是一家成立于2017年的公司,以认知决策智能技术为核心。它由来自阿里、网飞和IBM的前科学家和高管发起,并有来自柏克莱和CMU等知名机构的特别顾问。团队的核心能力基于深度学习、强化学习和大规模并行计算,在互联网、游戏等多个领域拥有成功经验。

目前,智力是世界级的技术难题,决策过程也是人脑中最复杂的功能。决策智能因其在游戏、交通、电力等领域的巨大应用前景,近年来也成为全球人工智能研究的热点。DeepMind、脸书、OpenAI、微软、亚马逊等科技巨头都成立了实验室进行相关研究。与单个智能体相比,多智能体游戏的难度成倍增加。NeurIPS多智能体竞赛是NeurIPS大会上首次举办的多智能体竞赛,将多智能体合作、不完全信息博弈、持续学习等关键问题集中到炸弹人博弈中,鼓励来自世界各地的优秀RD人员参与解决技术挑战。

NeurIPS多智能体比赛采用激烈的双淘汰机制,避免设置炸弹杀死队友。在整个过程中,对智能体有效信息的有效识别和提取、未知信息的推理和假设、多智能体的协作都提出了很高的技术要求。

每个团队有2个月的线下模特培训。最终,在启元决策智能平台上训练的Navocado击败来自加拿大的天网,获得学习组冠军。天网的团队来自加拿大近百人的科技公司Borealis.ai。从战斗过程来看,启源的Navocado代理主动攻击能力明显强于对手。根据天网在官网公开的实现方案,天网模型在决策过程中增加了大量的人工干预,与Navocado模型在整个训练和决策过程中不需要人工干预就能独立学习各种技能的方式相差甚远。

图2:持续训练期间2:Navocado药剂的效果改善曲线

启源从2017年开始搭建的决策智能平台,对本次比赛中代理人训练夺冠起到了关键作用。强化学习作为决策智能的核心技术,也是一种极具挑战性的机器学习方法。由于强化学习涉及的环节比较长,而且强化学习算法本身对超参数非常敏感,学术界不同的实现或配置很容易导致训练结果无法重现的现象。强化学习技术在可再现性、可重用性和健壮性方面存在挑战。

启源决策智能平台借助平台化,利用强化学习解决复杂的决策问题,证明了强化学习的可行性。元决策智能平台构建了支持多智能体博弈的基本框架,并能通过竞争的方式实现多智能体的持续学习能力。该平台还支持元学习,包括自动资源调度和自动参数调整,使模型训练更加高效。

启源世界的鹏鹏博士介绍说:“启源团队对强化学习领域充满热情。这次赢得NeurIPS多智能体竞赛的智能体,在训练的各个阶段都没有人工干预,学习曲线非常漂亮,进一步验证了这套系统的有效性和鲁棒性,以及强化学习技术的价值。”

从平台架构设计到底层实现,启元做了大量细致的工作,力求在决策智能相关的各个方面都尽善尽美,包括环境模拟、模型预测、训练等。开球队基于决策智能平台,设计了奖励机制,分阶段调整超参。在使用智能平台进行决策的过程中,团队可以快速调度任务部署所需资源,配置战斗所需代理,并在训练过程中实时观察不同机型的战况和胜率曲线,从而做出最快的调整。

图3:开元决策智能平台框架

在本次NeurIPS多智能体比赛中,启元决策智能平台提供了三大动力:

第一,支持代理不断学习的能力。

持续学习能力是代理人培训的关键环节。在训练阶段,炸弹人比赛中的特工需要在学习新技能的过程中,保留过去所学的技能,从而达到较高的水平。初始决策智能平台通过智能体群体匹配竞争的方式实现“自然选择”,从而达到不断学习的效果。在竞争的过程中,强者留下,弱者被淘汰。弱者被淘汰后空的位置被强者的克隆体取代,而强者的克隆体则按照新的超级参数设定继续进化。在计算资源预算固定的情况下,启元决策智能平台可以通过该机制在发掘新强和挖掘旧强之间平衡计算资源的使用。

其次,支持复杂场景下的多智能体联合训练。

在多智能体博弈问题中,不同智能体之间的相互牵制是普遍存在的,其收敛可能性极其复杂。在轰炸机比赛中,不同的队伍有不同风格的特工,有的擅长进攻,有的擅长防守。启源决策智能平台基于“鲶鱼效应”的思想,在训练初期引入基于规则的高水平对手,在与强者的对抗中,刺激初级阶段的弱者学习各种基本功,从而快速提升变强;随着训练阶段的深入,启元决策的智能平台同时训练多个智能体,使他们在彼此激烈的对抗中完善自我。

第三,支持基于私有云集群的大规模、高并发仿真和大规模训练。

元决策智能平台将架构图中显示的几个模块组件化,并封装到容器中。通过云端自动化,管理数百个CPU和GPU资源,实现容器排列,降低了调度数十个轰炸机训练任务的成本。大规模、高并发的仿真计算和大规模训练同时在私有云集群中进行。此外,开源决策智能平台提供分布式存储方案,并配置为共享模型池,为轰炸机代理模型组的持久化和共享提供支持。

目前智能决策平台v0.8版本已经在游戏、网络智能、仿真中使用。基于为客户提供的高附加值服务,启源世界在2018年进行了商业化的小试牛刀,即取得了不错的营收。2019年,启元世界计划发布第一版启元决策智能平台产品,为更多行业客户和终端用户带来高体验服务。

 
友情链接
鄂ICP备19019357号-22