作者|心缘
编辑|沙漠阴影

东西8月9日报道。今天下午,上海GPU独角兽公司碧湖科技推出首款面向云人工智能训练和推理的通用GPU计算产品BR100系列。其旗舰产品的峰值计算能力超过英伟达目前在售的旗舰计算产品A100 GPU的3倍。
▲张文展示BR100芯片
“全球通用GPU计算能力纪录首次由中国公司创造。”发布会上,富弼科技创始人、董事长兼CEO张文宣布“中国通用GPU芯片进入每秒10亿次计算的新时代。”
富弼科技成立于2019年9月9日,再过一个月,就是三周年的纪念日。经过团队总共1065个日日夜夜的努力,这个大计算芯片诞生了。借此机会,张文也宣布了自己的下一个小目标:“百年基业长青”。
BR100芯片采用7nm工艺和独创的“墙对墙”芯片架构,容纳近800亿个晶体管,搭载超300MB片内高速SRAM,应用Chiplet和2.5D CoWoS封装技术,突破了大尺寸芯片制造和封装中的掩膜尺寸限制问题,实现了高成品率和高性能的双重提升。
也是创纪录互连带宽的国产芯片。BR100还首次引入了最初由富弼技术定义的TF32+数据精度,可以提供比英伟达TF32更高的数据精度和吞吐性能。同时,BiHu提供了支撑性的原创异构计算平台BIRENSUPA,提供端到端的全栈覆盖。
此外,富弼科技与浪潮领域联合发布了OAM服务器“海选”,拥有全球性能纪录。其峰值浮点运算能力为8PFLOPS,最大功耗为7KW。它还提供了高能效、低总拥有成本的数据中心集群解决方案。
“我见过很多豪华的创业团队失败,但我没见过有信仰的团队失败。”张文分享说,他的创业理念是“做一件困难的事,做对的事,真正为社会创造价值”。
目前,富弼有900多名科技人员,预计今年年底将达到1000名,其中85%以上具有硕士以上学位。除了通用GPU,碧湖科技还推出了图形GPU产品线。
围绕BR100芯片更多的技术细节和落地进度,芯东采访了多位富弼科技高层。碧湖科技联合创始人兼总裁徐凌杰告诉Core,BR100系列芯片和相应的硬件计算产品将于今年年底量产。
1.全球最强通用GPU的八大核心特性
比虎科技的BR100系列通用GPU计算产品,专为AI训练、推理,以及更广泛的通用计算场景而设计。主要用于数据中心部署场景,具有高计算能力、高能效、高通用性的特点。
▲比尔BR100芯片与英伟达H100/A100芯片基本规格对比
整体而言,其旗舰产品BR100具有八大核心特性:
先进的制造和封装技术:采用7nm工艺技术,在1074mm芯片面积上集成了770亿个晶体管,并应用了尖端的小芯片和2.5D CoWoS封装技术,可以兼顾高成品率和高性能。
高性能高能效比:核心性能堪比英伟达最新旗舰计算产品H100 GPU,计算能力比英伟达A100高出3倍以上。
多数据精度支持:除FP32、BF16、FP16、INT8等主流数据精度外。,它还支持最初由Wall House定义的TF32+数据精度。与TF32相比,TF32+在满足相同动态表示范围的前提下,增加了5个尾数,可以实现比TF32更高的数据精度和吞吐性能,适用于大量的乘加运算。
先进的存储系统:64GB HBM2e片外存储器,数据速率高达3.2Gbps,带宽高达1.64TB/s,总位宽4096bit。
先进的互联系统:独创Blink高速GPU互联技术,采用最新高速serDes技术,支持8卡点对点全互联,聚合带宽达到512GB/s,创下国内互联带宽纪录;采用最新一代主机接口PCIe 5.0,率先支持CXL 2.0通信协议。双向带宽高达128GB/s。
虚拟实例:最多支持8个独立实例,每个实例物理隔离,配备独立硬件资源,可以独立运行。
国家安全规范:专用硬件加密解密IP,支持AES等常用安全加密算法,符合一级国家安全规范。
OCP规范硬件系统:符合OCP规范的OAM模块,最高支持550W TDP风冷散热,在通用UBB主板上实现8卡点对点全互联。
BR100系列还包括另一款主流数据中心加速计算芯片BR104,可以适应成熟且广泛部署的PCIe卡形式。
BR104安装在BILI 104 PCIe卡上,这是一款集训练和推送于一体的主流产品。采用标准PCIe形式,全卡峰值功耗300W。它适用于各种2-4U PCIe GPU服务器。它与现有的基础设施高度兼容,并已开放测试。
▲碧秀BR100系列产品与NVIDIA H100/A100规格对比
第二,独创训推一体化架构,自主研发异构计算平台
针对通用大功率GPU面临的内存墙、电源墙、并行、互连、指令集架构等挑战,BiHuTechnology独创设计了一种训练-推送一体化的芯片架构“BiLiHu”,为其通用GPU搭建了完整的BIRENSUPA软件开发平台。
富弼科技CTO洪洲负责领导其首款通用GPU芯片BR100的原始架构研发。他将在今年8月26日举行的GTIC 2022全球AI芯片峰会暨高峰论坛上发表题为《大计算力通用GPU使能超级模型训练》的主题演讲。据他介绍,在微架构上,碧宇团队以通用计算核心的设计为中心,配合强大的张量计算引擎,加快计算速度;同时,采用自主开发的指令集,更高效地实现各功能的操作。
具体来说,BR100有32个SPC流处理器集群,每个SPC有16个EU执行单元,每4个EU可以配置为一个CU计算单元,每个SPC共有4,096个线程。每个EU有16个通用流处理器,包括一个具有脉动3D GEMM架构的专用张量引擎。

BR100共有8192个通用流处理器,512组专用张量加速引擎,共有128K个线程,并配备256MB分布式共享L2缓存,支持多个SPC之间的数据共享,可配置为大容量暂存,也可支持不同级别的近内存计算。
其自主研发的GPGPU架构和多级缓存架构的指令集,可以实现大模型训练下的数据重用;基于NoC的通信架构支持共享数据组播机制,可以配合分布式缓存实现高效通信,大大降低对片外带宽和功耗的需求。
如前所述,除了架构设计,BR100还采用了许多业界领先的芯片技术,包括越来越流行的小芯片。周红向东溪解释说,对于可以明确划分功能模块的芯片,或者公司产品线非常丰富,产品线之间可以复用特定模块的情况下,自主研发的复用SoC功能模块的小芯片方案可以缩短设计周期,降低设计成本,大幅提高良品率。这就要求芯片设计团队在高速接口和大芯片封装方面有丰富的经验。
需要说明的是,富弼科技此次推出的通用GPU产品,重点是面向云数据中心场景的AI计算和通用科学计算,不能等同于图形GPU。
富弼科技联席CEO李欣荣告诉Core,通用GPU为了增强计算能力,往往会弱化图形渲染,往往没有显示和输出接口,因此无法直接用于游戏等应用。这是由其应用场景和设计特点决定的。
另外,有人认为专用AI芯片的能效比一定要高于通用GPU,可以替代通用GPU。但李欣荣特别表示,这种观点并不准确,因为不同芯片的能效比受架构、工艺等诸多因素影响。即使某些专用芯片在特定场景下能效比很高,也不一定能解决实际应用场景下计算能力大的问题。尤其是在训练场景中,GPU芯片凭借其绝对计算能力大、通用性强、软件栈易用、软件生态丰富等优势,依然占据数据中心加速计算的主导地位。
“在数据中心场景中,事实证明,所谓的专用人工智能芯片很难取代GPU。”李欣荣说。
与BR100系列芯片配对,BiHuTechnology还开发了异构计算平台BIRENSUPA及其支持的软件开发工具,支持业界主流的深度学习框架和模型,从而为数据中心场景中的用户提供灵活安全的计算部署,有效降低数据中心的总拥有成本。
BIRENSUPA平台是在碧湖科技的硬件设备上开发深度学习和通用计算应用的编程模型和软件平台。它为应用程序提供了轻松访问高性能并行处理硬件的能力,并具有开源和可扩展性的特点。
其完整的软件栈包括固件、驱动、编译器、工具、编程模型、库、机器学习框架和端到端应用SDK,并兼容TensorFlow、PyTorch、Flying Paddle等主流深度学习框架。BIRENSUPA还支持自主研发的高性能推理机和第三方推理机,支持现有GPU代码的平滑迁移。
三。已经开始与重点客户进行产品适配,进入测试阶段。
“今年3月底,还处于上海疫情的风控期,富弼BR100系列芯片率先退片。通过团队的努力,一次性亮灯工作顺利完成。”
李欣荣透露,经过4个多月的开发,BR100系列在硬件和软件两方面都取得了进步。不仅芯片顺利完成了工程样片的研制,与服务器设备的适配也取得了阶段性成果。整个系统在最短的时间内进入生产阶段,取得了稳定优异的性能数据。
“作为国内初创企业,我们第一次在极短的时间内完成这样的工作是非常难得的,这足以证明我们前期的设计工作是扎实的、可靠的、经得起考验的。”他感慨道。
据徐凌杰分享,富弼科技已与互联网、云计算、金融、通信、数据中心等行业头部客户签署战略协议,其中已与重点客户开始产品适配,并已进入测试阶段,获得客户积极反馈。
目前BR100应用的重点领域主要是互联网、通信运营商、行业AI等领域。
现场,富弼与浪潮联合发布了面向数据中心云培训的“海选”OAM服务器及集群解决方案。
“海选”OAM服务器可实现8PFLOPS浮点运算能力,最大功耗7KW。徐凌杰表示,“海选”OAM服务器创下了全球单个GPU服务器的计算能力纪录,将于2022年第四季度开放测试。
基于海轩OAM服务器,富弼向市场提供了一套高性能、高性价比的集群计算基础设施解决方案。与国际厂商的数据中心方案相比,富弼的数据中心集群方案仅使用了1/3的服务器数量,实现了更高的浮点运算能力、更低的峰值能耗和占地面积空,同时减少了64%的标准煤发电量。它具有高能效、实用性、经济性和环境协调性的特点。
富弼科技还宣布参与飞桨硬件生态创造计划。BR100产品和飞桨已完成I级兼容性测试,满足兼容性要求。
此外,为了更好地服务全球开发者,碧仙科技开发者云已经上线。
第四,AI芯片进入落地期
在李欣荣看来,高素质人才团队的能力、前沿的产品定位、微架构的创新能力、软硬件的高效实现和交付能力,构成了碧玺科技的护城河。
“富弼提供的GPU芯片,不仅解决了国产芯片有无的问题,还解决了‘性能好而优’的问题。BR100是针对客户需求的超级计算能力的通用国产产品方案,竞争力遥遥领先国内同行。”徐凌杰说。
就认知而言,他认为富弼团队非常清楚,只有追求更高的性能和更低的TCO,才能获得商业落地的优势。最重要的是,产品竞争力必须得到商业客户的认可,才能最终做大做强。
据徐凌杰观察,近两年AI芯片和GPU芯片行业已经过了单纯讲PPT的时期,更多的是考验企业在特定场景的实践。市场也更关注芯片公司实际应用在客户端的反馈。
在他看来,当前AI芯片竞争的关键在于打造差异化产品,深入了解客户需求和应用场景痛点,为客户解决实际业务问题,以创新架构和突破性能为目标打造产品,而不是仅仅对标现有产品,长期处于追赶状态。
“GPU芯片作为大国重器,是目前集成电路领域需要突破的关键环节。需要政府、企业、高校在技术、人才、资金上长期投入。”

展望未来,他判断未来国内通用GPU行业会有发展,最好的结果是产生1-2家芯片公司,真正超越国际巨头在加速计算芯片领域的市场地位;最坏的结果是,建立国产芯片的技术壁垒需要更长的时间,尤其是在集成电路全球产业链不断分割的趋势下,需要政府和国家投入更多的资源。
5.结论:用系统思维解决一般GPU落地问题。
在大规模商用的道路上,国产通用GPU还有很多困难。李欣荣举例说,这包括软件栈的成熟度、客户基础设施的兼容性、产品的性价比、支持的应用类型等,都需要不断优化。
目前通用GPU面临的一个关键技术瓶颈是提高能效比。现有的计算架构仍然存在内存墙、电源墙等问题,计算资源规模在现有技术下难以继续快速翻倍。这就需要GPU企业系统地解决问题,包括封装技术、稀疏性、精度类型、光互连、近存储计算等等。
为了迎接这些挑战,李欣荣表示,“未来,富弼将继续大力布局数据中心计算产品,不断优化软硬件,不断拓展富弼在智能计算领域的能力和产业触角,推动产品落地和后续迭代。”


