实战应用场景,年度服务器的巅峰对决

核心提示时至12月,又到了盘点、总结的时候了。遥记当年DIY最火的时代,年底都要做的是硬件产品横评与盘点等重要选题,从消费者到厂商都能通过对比来了解产品的性能与市场表现,从而为选择、研发下一代产品积累经验。我们再来看看企业级市场,近20年来它的变化

到了12月,又到了盘点总结的时候了。回到DIY最火的年代,硬件产品的横评、盘点等重要课题都要在年底做。从消费者到厂商,通过对比了解产品的性能和市场表现,为选择和开发下一代产品积累经验。

我们再来看看企业级市场。在过去的20年里,它发生了迅速的变化。x86服务器兴起以来,多算力、云计算、大数据、人工智能、容器等技术。取得了一次又一次的突破,也为数字化的未来写下了一页页色彩斑斓的传奇。

从企业级市场发展至今,可以看到无论是技术还是产品的整体趋势都是无一例外的走向应用。CPU、GPU、DPU和存储不再是单一的衡量标准。最重要的是,企业用户关注的应用,或者以什么样的成本,能提供我需要的性能。

2021 MLPerf人工智能测试大结局

正因为如此,MLPerf测试应运而生,成为新一代标杆。它衡量的是人工智能相关领域服务器的性能,具有很大的实用价值,因此备受业界关注。

MLPerf是最具影响力的国际AI性能基准,由图灵奖得主大卫·帕特森(David Patterson)和顶级学术机构发起。2020年,基于MLPerf的基准测试,成立了机器学习的非营利开放组织MLCommons。其成员包括谷歌、脸书、英伟达、英特尔、浪潮、哈佛大学、斯坦福大学、加州大学伯克利分校等50余家全球AI领军企业和顶级学术机构。他们致力于推动机器学习和人工智能的标准和测量指标。

目前,MLCommons每年组织两次MLPerf AI训练性能测试和两次MLPerf AI推理性能测试,为用户测量设备性能提供权威有效的数据指导。

MLPerf基准分为两个分区:固定任务和开放任务。

固定的任务是通过相同的模型、优化器和参数值来测试深度学习在不同服务器上的性能,类似于我们日常看到的硬件类的对比和评估。而开放任务并没有过多限制深度学习的模型和精度,专注于服务器厂商优化深度学习模型和算法的能力,推动ML模型和优化的创新。

固定任务强调AI计算系统的公平比较。大赛衡量同一深度学习模型在不同硬件上的表现,重点考察参赛厂商的硬件系统和软件优化能力。

由于MLPerf每年都会组织四次AI相关的测试,所以这一次当然是年底的重头戏,业界关注度很高。12月1日,MLPerf公布了最新的培训名单V1.1这次有Google、微软云、英伟达、浪潮信息、戴尔等14家公司和科研机构。,参加MLPerf基准测试的,都是国际大公司。可谓是刀光剑影。总共提交了180个固定任务分数和6个开放任务分数。

单机测试的8项任务中,浪潮信息获得7项冠军,英伟达获得1项冠军;在集群测试的八项任务中,英伟达获得七项冠军,微软云获得一项冠军。

实际应用场景,利用计算能力推动深度学习

如上所述,本次MLPerf基准评测涵盖了八个具有代表性的机器学习任务,分别是图像分类、医学图像分割、目标对象检测、目标对象检测、语音识别、自然语言理解、智能推荐和强化学习。

为什么MLPerf的AI性能测试会引起这么多关注?

是因为它最贴近用户的使用场景!这一点尤为重要。

就像选择智能手机一样。市场上的机型成百上千,设计和定位千差万别。白领注重质量和可靠性,游戏玩家注重性能,年轻人喜欢拍照,学生更注重性价比,根据自身使用场景选择,做到精准定位。MLPerf的应用场景评估也是为了这个目的。

场景1:图像分类

ResNet是一个经典的深度学习模型,也被称为最典型的计算机视觉应用。对海量图像进行识别和标注,然后进行分类,非常方便高效。ResNet在这个模型训练中检查服务器的性能。

图像任务单机训练分数排名

从上图可以看出,浪潮信息的两款经典服务器获得了前两位,其中NF5488A5性能最高,NF5688M6排名第二。超微的8卡A100-SXM4-80GB型号比NF5488A5低1.6%,排名第三。

这里可能有人会问,为什么只有浪潮和超微用500W GPU?对其他厂商是否不公平?

事实上,这恰恰证明了他们强大的RD实力。因为浪潮是第一家在服务器中部署8个500W功耗GPU的厂商,并提供液冷和风冷两种型号,而同期其他品牌的产品大多只部署了4个500W GPU。在此次测试中,超微是第二家以8台500W GPU服务器参与竞争的厂商。

GPU从300W发展到400W,再到500W。当多张卡同时部署时,对服务器内有限的空间提出了更高的散热要求,电源和散热的设计难度很大。也正因为如此,在评测中,我们可以观察到各企事业单位的参赛产品的设计和RD能力。

场景2:医学图像分割

患者在医院拍过医学影像,包括x光、超声波、CT、MRI等。AI可以在短时间内对分割后的图像进行分析,给出合理的初步诊断、分析和预测,为诊断提供便利。

医学图像分割是医学图像智能分析的一个重要领域,也是计算机辅助诊断、监测、干预和治疗的必要组成部分。它的核心任务是分割医学图像中的器官或病变,这对于准确识别、详细分析、合理诊断、预测和预防疾病具有非常重要的意义和价值。

这个测试主要是数据训练,测试服务器的硬实力。

医学图像分割任务单机训练成绩排名

3D U-Net模型在医学图像分割任务中的性能比较。浪潮这次只提交了NF5688M6的结果,可以看出其性能领先第二千兆约4.7%。领先第三名超微约7.7%。相对来说,这个测试计算任务比较重,所以各种产品也拉开了比较明显的差距。

场景3:语音识别

在大型在线会议中,发言者所说的内容实时显示在屏幕上,清晰准确。现在这样的场景,不需要人力,只需要通过AI就可以实现。背后是语音识别的贡献。

RN-T模型是理论上比较完善的模型结构,它巧妙地整合了语言模型的声学模型,并对其进行了联合优化。它通过一个联合网络把语言模型和声学模型的状态结合起来,可以拼接,也可以直接叠加,所以更准确。

语音识别任务单机训练成绩排名

语音识别RNNT任务训练的性能比较。可以看出,NF5488A5的性能第一,领先第二名英伟达约2.6%,领先第三名微软约12.5%。这个测试可以说是考虑到了深度学习各种模型的整合,复杂程度很高。浪潮NF5488A5也凭借硬实力创造了新纪录。

这三个场景测试只是冰山一角。在MLPerf基准测试中,涵盖了八个最接近应用场景的机器学习相关任务,这也是其获得具有巨大实用价值美誉的关键。

浪潮服务器,2021年收获满满

作为业界最权威的AI基准测试,MLPerf每年组织两次AI推理和AI训练性能测试。12月1日结果的公布也意味着MLPerf 2021的四次测试正式结束。今年共有29家国际厂商和研究机构参与其中,不断突破AI系统在数据中心推理、边缘推理、集群训练、单机训练等各种AI场景的性能。其中浪潮信息获得44项冠军,位列MLPerf 2021第一,英伟达、戴尔、高通分别位列第二、第三、第四。

仔细观察,不难发现,参与的厂商和机构选择的硬件基本相似。要达到更高的性能,只能依靠系统设计和优化能力。这里没有捷径。浪潮信息深耕AI服务器设计和优化多年,所以有如此强大的硬实力。

硬件设计方面,针对AI任务中IO密集传输这一常见瓶颈,浪潮AI服务器以领先的设计大幅降低了通信延迟,大大提高了AI训练的效率。同时,针对高负载的多GPU协同任务调度,对NUMA节点与GPU之间的数据传输进行全面优化和深度调整,确保训练任务中的数据IO不被阻塞。此外,在散热方面,100 SXM-80GB的GPU耗电量很大。为此浪潮研发了先进的冷板液冷系统,保证GPU在满功率负载下依然稳定工作,这也是AI服务器在各项测试中表现出色的重要原因之一。

浪潮AI服务器产品方面,两款主力机型NF5488A5和NF5688M6在今年的MLPerf测试中分别获得18项和15项冠军。他们的成功不是一蹴而就的,而是众多RD设计师的共同努力,辅以多年的技术积累,取得的成果当然是无比强大的。

MLPerf的评价可以说是为整个2021年的it行业点亮了一盏明灯,引导大家关注AI实战,而不是硬件指标。1.1版榜单也可以看作是对AI服务器的盘点和总结,很有参考和实用价值。从MLPerf测试本身来看,很多优秀的硬件产品在测试的不同阶段都表现出了强大的实力,经过各种优化,一次次实现“刷榜”,这是行业用户最希望看到的。在测试中,不断强大的AI服务器可以帮助用户更高效地完成训练,并可以尝试以前无法完成的任务,为AI在不同领域的快速发展注入新的活力。

浪潮服务器连续五年中国市场份额第一,目前全球市场份额也是第一。浪潮信息能在MLPerf取得优异成绩,再次证明了其RD实力,在实战应用场景中获得了更深刻的洞察和理解。此外,浪潮信息在MLPerf测试方面的探索和创新,也进一步帮助浪潮在实际应用中更好地回馈行业客户,助力其业务发展,推动AI快速发展。

 
友情链接
鄂ICP备19019357号-22