性能提升超越摩尔定律!浪潮 AI 服务器再创 MLPerf V2.0 训练评测最佳成绩
6 月 30 日,全球权威 AI 基准评测 MLPerf™最新 V2.0 训练评测成绩榜单公布。浪潮 AI 服务器表现优异,继两月前在 MLPerf™V2.0 数据中心推理评测中斩获全部冠军后,本次又在 MLPerf™V2.0 单机训练性能继续保持领先。
本次 MLPerf™评测吸引了包括谷歌、NVIDIA、浪潮信息、百度、Intel-Habana、Graphcore 等全球 21 家厂商和研究机构参与,共有 264 项评测成绩提交,是上一轮基准评测的 1.5 倍。评测任务涵盖了当下主流 AI 场景,包括自然语言处理(BERT)、智能推荐(DLRM)、图像分类(ResNet)、医学影像分割(3D U-Net)、轻量级目标物体检测(RetinaNet)、重量级目标物体检测(Mask R-CNN)、语音识别(RNN-T)以及强化学习(Minigo)8 类 AI 任务。
在单机训练评测的固定任务中,浪潮信息以高端 AI 服务器斩获自然语言理解(BERT)、智能推荐(DLRM)、语音识别(RNN-T)三项性能成绩第一,位列单机冠军榜首。在本次配置 8 颗 NVIDIA A100 Tensor Core GPU 的主流高端 AI 服务器中,浪潮 AI 服务器斩获 5 项任务最佳成绩(BERT、DLRM、RNN-T、ResNet、Mask R-CNN)。
超越摩尔定律,持续领跑 AI 计算性能提升
MLPerfTM 评测组织机构 MLCommons 执行主任 David Kanter 在此次成绩发布会上表示,自首次公布评测基准以来,MLPerf 性能提升速度远超过摩尔定律。考虑到业界对计算和 AI 的需求正以惊人的速度增长,这让人非常振奋。
自参加 MLPerf™AI 性能评测以来,浪潮 AI 服务器通过软硬件全面优化,持续实现 AI 性能突破。相较于 2018 年 12 月 MLPerf™初始版本 V0.5 的典型配置 8 卡机型的性能数据,浪潮 AI 服务器的性能显示出大幅提升,提升比例最高达 789%,2.35 倍于摩尔定律增速。
浪潮 AI 服务器在 MLPerf™基准评测中的卓越表现,得益于浪潮信息在 AI 计算系统上优异的设计创新能力和全栈优化能力。浪潮 AI 服务器针对 AI 训练中常见的密集 I / O 传输瓶颈,通过 PCIe retimer-free 设计实现了 CPU-GPU 间通道免中继高速互联,大幅降低通信延迟;并针对高负载多 GPU 协同任务调度,以及 NUMA 节点与 GPU 之间的数据传输性能进行了深度优化,确保训练任务中的数据 I / O 通路处于最高性能状态;在散热层面,率先实现 4U 空间内部署 8 颗 500W 的高端 NVIDIA A100 Tensor Core GPU,并支持风冷、液冷两种散热方式。同时,在模型训练全流程中,浪潮 AI 服务器持续通过优化预训练数据处理、GPU 之间高速通信、GPU 核心加速等关键模块,最大化提升了 AI 模型的训练性能。
大幅提升 Transformer 训练性能
当前,基于 Transformer 神经网络的预训练大模型正引领新一代 AI 算法发展,并逐步从自然语言处理走向计算机视觉、多模态等领域。MLPerfTM 评测任务中的 BERT 模型即是基于 Transformer 架构的模型。Transformer 简洁、可堆叠的架构使得开发极大参数量、基于极大数据集的预训练大模型成为可能,这带来了模型算法能力的大幅提升,但同时也对 AI 计算系统的处理性能、通信互联、I / O 性能、并行扩展、拓扑路径及散热能力提出了更高的要求。
在本次 BERT 评测任务中,浪潮 AI 服务器通过优化数据预处理、GPU 之间密集参数通信、超参数自动寻优等,进一步提升了 BERT 训练性能,在 15.869 分钟内即在 Wikipedia 数据集的 2850176 条数据上完成了 3.3 亿参数的 BERT 模型训练,相较于 V0.7 版本的最佳成绩 49.01 分钟的性能提升达到 309%。至此,浪潮 AI 服务器已经连续三次获得 MLPerfTM 训练 BERT 任务性能冠军。
浪潮信息在 MLPerf™V2.0 训练评测中取得佳绩的 2 款 AI 服务器分别是 NF5488A5 及 NF5688M6。NF5488A5 是全球首批上市的 NVIDIA A100 Tensor Core GPU 服务器,在 4U 空间支持 8 颗由 NVIDIA NVLink 互联的 NVIDIA A100 Tensor Core GPU 和 2 颗 AMD Milan CPU,同时支持液冷和风冷散热技术,累计斩获 40 项 MLPerf™冠军。NF5688M6 是面向大规模数据中心优化设计的具备极致扩展能力的 AI 服务器,支持 8 颗第三代 NVLink 互联的 NVIDIA A100 Tensor Core GPU 和两颗 Intel Ice Lake CPU,支持多达 13 张 PCIe Gen4 的 IO 扩展能力,累计斩获 25 项 MLPerf™冠军。
