星际选手司令

核心提示继AlphaGo之后,AI在世界人机大战中再一次获胜。6月21日,在启元世界举办的国内首届《星际AI顶级职业选手挑战赛》中,启元“AI星际指挥官”以2:0的成绩战胜《星际争霸I/II》全国冠军黄慧明和黄金总决赛冠军、最强人族选手李培楠。与围

继AlphaGo之后,AI在世界人机大战中再次获胜。

6月21日,在启元世界举办的首届国内明星AI顶级职业选手挑战赛中,启元“AI明星指挥官”以2:0的比分战胜了星际争霸I/II全国冠军黄慧明和黄金总决赛冠军、最强人族选手李沛南。

与围棋相比,星际争霸是一种不完全信息博弈,战争迷雾对AI的战略规划、布局和决策提出了更高的要求。而且在决策室空里,围棋只有361种,星际争霸2大概有1026种。因此,更具挑战性的星际争霸成为了AI与人类竞争的下一个竞技场。

第一场人族比赛,AI星官让全国冠军TooDming打GG只用了11分钟。这场比赛,AI星官相当自信,进攻干净利落,直击心脏。

但是TooDming在赛后毫不犹豫的表扬了AI的策略和打法,让他学到了很多。而且在游戏过程中,他并没有感觉到自己是在和一个虚拟机器人对抗。

如果说TooDming更擅长打虫族的话,AI和最强人族玩家Time的对决可以说是精彩绝伦。双方交手20分钟,现场解说员无不惊叹。时间展现了韩服6500最强人族的实力,AI星官的宏观策略和微观操作也毫不逊色。但是,最后时间没能让AI星官打GG。

赛后微博说“不如别人,就甘心跪拜。”。

对于这个结果,AI星官创始人兼陪练官也表示惊讶。虽然最近AI星官的决策能力呈指数级增长,他们有信心战胜TooDming,但对时间没有完全把握。而AI星官的适应能力和独立决策能力,显然已经超出了所有人的预期。

那么,AI星官在本次比赛中表现如何呢?下面我们一起来回顾一下亮点。

AI星指挥官:2:0胜利!

启源世界开发的智能体AI星际指挥官是一个具有自我学习和独立决策能力的AI。在虚拟世界表现为数字人,在物理世界表现为机器人。类似的代理还有AlphaGo和AlphaStar。

这款游戏采用三回合制,以人族为战场。第一位职业选手黄慧明,绰号土豆明,效力于动物园电子竞技俱乐部,擅长虫族。自2006年成为职业星际选手以来,已经获得了11次冠军,最高成就是星际争霸I/II的全国冠军。

Round 1首回合TooDming打法保守,AI星官率先发动两波攻击,TooDming成功防守。在人族对抗中,谁先占据场外控制权,谁就获得了游戏的主导权。但是在TooDming平行开采的过程中,出现了一点小失误。AI星官没有给对手任何机会,瞬间抓住漏洞,直击要害。比赛结束用了11分钟。

Round 2 TooDming调整了扩张模式,更加注重防守策略,而AI也及时调整,循序渐进,层层推进,而不是像上一局那样猛烈进攻。最后TooDming还是逃不过AI星官的压制。

据了解,AI星官已经掌握了260种玩法,而这些玩法都趋于通用。他们也会根据真实的战斗场景做出相应的战略调整,这部分人类无法预测。后来在与时间的决战中,艾把这出意料之外的戏发挥到了极致。

第二位选手李佩楠,效力于凯子加明电子竞技俱乐部,是韩服阶梯成绩超过6500分的世界顶级职业选手。2018年获得星际争霸I/II黄金总决赛冠军,曾在暴雪黄金总决赛击败TooDming。

对抗AI Time的战斗可以说是世界上最强的直播挑战。

Round 1在这场比赛中,AI星官以维京为主战和控制单位,让所有人惊叹不已。从来没见过这样的战术,这也让时间直接输了。解说员说这种战术对人类玩家很有启发。

值得一提的是,在激怒了TooDming之后,面对更强的时间,AI星官发出了“爱与和平”的对话框。不得不感叹它的实时感知能力。

Round 2Time是最后一站,但是AI星官的打法让他感觉很迷茫,还要因为多线程的左右夹击而不停防守,最后资源储备明显不足。整个活动结束后,看直播的网友表示,只有时间才能抵挡住AI这样的强攻。

有网友建议可以持续20min,非常适合AI陪练官,肯定会长得更快。......

对于赛事的最终结果,AI星官的陪练官表示2:0击败TooDming是意料之中的,但最终2:0击败Time却是他始料未及的。毕竟时间的力量众所周知。另外这也是AI星官连续20分钟的操作,顶住了长盘的压力,做出了更好的反应和执行力。

AGI的杠杆-星际争霸

但是,AI星官,或者说AlphaGo、AlphaStar等智能体的出现,背后的意图并不是为了打败人类,而是通过与人类的对抗训练,让AI获得更好的自主学习和决策能力。由此获得的通用技术可以帮助更复杂、更广泛的现实世界应用场景,实现终极的通用人工智能。

这也是启元世界、DeepMind、OpenAI等科技公司选择在这里发力的重要原因。但在AI训练最好的地方,他们共同选择即时战略游戏。

为什么要赌星际争霸?在AlphaGo以3:0击败围棋顶级职业棋手李世石之后,DeepMind的研究人员开始对以不完全信息博弈为代表的即时战略博弈进行攻击。

与围棋/德州扑克中玩家可以观察对方的战略进攻相比,不完全信息博弈意味着玩家只能“察觉”或“猜测”敌人的情况。这给决策带来很大的不确定性。

星际争霸具有典型的不完全信息的特点。同时,作为一款经典的即时战略游戏,其复杂度也在呈指数级增长。

首先,从游戏角度来说,星际争霸没有最佳策略。它需要根据实际情况随时调整策略,拓展资源,在宏观经济和微观运作之间找到最佳平衡点。所以在这次比赛中,我们也看到了AI Star打出了人类前所未见的战术。

另外星际争霸的决策时间空更大,可以达到每分钟3000-4000次。尤其是和Dota这种同样是即时战略类的游戏相比,星际空间中有很多可控的单位,比如采矿、造兵、探测敌军、发动攻击等。不同单位在时间和数量上的不同组合,会对整个局势产生决定性的影响。

更重要的是,它的即时性要求棋手做出毫秒级的反应,这是与传统棋艺最大的区别。

研究人员认为,星际争霸是对AI综合能力的极大考验。其不完全信息决策、长时间部署、实时对抗等特点与现实世界的环境和要求非常相似。同时,这要求AI不仅要实时感知和识别环境,还要适应环境,做出数以千计的连续决策。因此可以作为AI训练的最佳虚拟场景。

AI星际指挥官的创始人

然而,《星际争霸》确实是一块难啃的硬骨头。直到最近几年,AI星际争霸取得了一些突出的成绩。

在本次AI Star挑战赛之前,该领域最突出的成果是DeepMind推出的AlphaStar。经过15年的技术研发,AlphaStar在2018年以5:0的比分击败了Team Liquid的职业星2选手TLO和最强神族选手马纳。但在后来的表演赛中,马纳成功扳回一局,干掉了AlphaStar。

这一次,AI星官以2:0的战绩击败了世界顶级职业选手Time,达到了与DeepMind相同的水平。不过不同的是,启源世界只用了三年时间就出了这么厉害的AI星舰官,计算能力只占DeepMind的1%。

据研究人员介绍,工程和算法是AI星官的核心优势。他们通过自己独创的“数据生成-传输-消费”一体化计算框架,将agent训练的数据吞吐率提高了10倍以上。此外,在算法方面,启元自主研发的指挥官神经网络结构,结合高效的群体进化训练方法,不仅能增强智能体的鲁棒性,还能在计算能力有限的情况下实现智能体的快速进化。

短短三年取得这样的成绩,这家人工智能领域的创业公司不容小觑。

据了解,该公司自成立以来就围绕星际争霸展开代理研究,其创始人袁泉曾是原阿里认知计算实验室的核心成员。同时,公司核心成员为BAT、网飞、IBM、HKUST、柏克莱等国内外知名高科技企业和一流大学。

这一次AI星官的大获全胜,预示着其代理技术的初步成熟。据研究人员介绍,AI明星官背后的秘密的武器“智能体训练云平台”已经正式进入市场,目前已经广泛应用于交通调度、数字娱乐、公共科技、机器人等行业。

比如交通调度,智能体可以成为交通调度员,每隔几秒钟自动调度优化红绿灯,极大缓解交通拥堵,实现真正的智慧城市。

最后一个问题:如果通用人工智能技术能够实现,你最希望它能赋能哪个行业,解决什么问题?

雷锋。com雷锋网。com

有关此次活动的更多信息,请参考以下链接:

file/tupian/20220911/BV1Yi4y1G7Xb from = search seid = 11222559881555171335

 
友情链接
鄂ICP备19019357号-22