APP下载
报价宝  ›  资讯  › 

性能提升超越摩尔定律!浪潮 AI 服务器再创 MLPerf V2.0 训练评测最佳成绩

报价宝 来源:baojiabao.com 发布时间:2022-12-19 18:36:36 09月30日更新
报价宝综合消息性能提升超越摩尔定律!浪潮 AI 服务器再创 MLPerf V2.0 训练评测最佳成绩

6 月 30 日,全球权威 AI 基准评测 MLPerf™最新 V2.0 训练评测成绩榜单公布。浪潮 AI 服务器表现优异,继两月前在 MLPerf™V2.0 数据中心推理评测中斩获全部冠军后,本次又在 MLPerf™V2.0 单机训练性能继续保持领先。

本次 MLPerf™评测吸引了包括谷歌、NVIDIA、浪潮信息、百度、Intel-Habana、Graphcore 等全球 21 家厂商和研究机构参与,共有 264 项评测成绩提交,是上一轮基准评测的 1.5 倍。评测任务涵盖了当下主流 AI 场景,包括自然语言处理(BERT)、智能推荐(DLRM)、图像分类(ResNet)、医学影像分割(3D U-Net)、轻量级目标物体检测(RetinaNet)、重量级目标物体检测(Mask R-CNN)、语音识别(RNN-T)以及强化学习(Minigo)8 类 AI 任务。

在单机训练评测的固定任务中,浪潮信息以高端 AI 服务器斩获自然语言理解(BERT)、智能推荐(DLRM)、语音识别(RNN-T)三项性能成绩第一,位列单机冠军榜首。在本次配置 8 颗 NVIDIA A100 Tensor Core GPU 的主流高端 AI 服务器中,浪潮 AI 服务器斩获 5 项任务最佳成绩(BERT、DLRM、RNN-T、ResNet、Mask R-CNN)。

超越摩尔定律,持续领跑 AI 计算性能提升

MLPerfTM 评测组织机构 MLCommons 执行主任 David Kanter 在此次成绩发布会上表示,自首次公布评测基准以来,MLPerf 性能提升速度远超过摩尔定律。考虑到业界对计算和 AI 的需求正以惊人的速度增长,这让人非常振奋。

自参加 MLPerf™AI 性能评测以来,浪潮 AI 服务器通过软硬件全面优化,持续实现 AI 性能突破。相较于 2018 年 12 月 MLPerf™初始版本 V0.5 的典型配置 8 卡机型的性能数据,浪潮 AI 服务器的性能显示出大幅提升,提升比例最高达 789%,2.35 倍于摩尔定律增速。

浪潮 AI 服务器在 MLPerf™基准评测中的卓越表现,得益于浪潮信息在 AI 计算系统上优异的设计创新能力和全栈优化能力。浪潮 AI 服务器针对 AI 训练中常见的密集 I / O 传输瓶颈,通过 PCIe retimer-free 设计实现了 CPU-GPU 间通道免中继高速互联,大幅降低通信延迟;并针对高负载多 GPU 协同任务调度,以及 NUMA 节点与 GPU 之间的数据传输性能进行了深度优化,确保训练任务中的数据 I / O 通路处于最高性能状态;在散热层面,率先实现 4U 空间内部署 8 颗 500W 的高端 NVIDIA A100 Tensor Core GPU,并支持风冷、液冷两种散热方式。同时,在模型训练全流程中,浪潮 AI 服务器持续通过优化预训练数据处理、GPU 之间高速通信、GPU 核心加速等关键模块,最大化提升了 AI 模型的训练性能。

大幅提升 Transformer 训练性能

当前,基于 Transformer 神经网络的预训练大模型正引领新一代 AI 算法发展,并逐步从自然语言处理走向计算机视觉、多模态等领域。MLPerfTM 评测任务中的 BERT 模型即是基于 Transformer 架构的模型。Transformer 简洁、可堆叠的架构使得开发极大参数量、基于极大数据集的预训练大模型成为可能,这带来了模型算法能力的大幅提升,但同时也对 AI 计算系统的处理性能、通信互联、I / O 性能、并行扩展、拓扑路径及散热能力提出了更高的要求。

在本次 BERT 评测任务中,浪潮 AI 服务器通过优化数据预处理、GPU 之间密集参数通信、超参数自动寻优等,进一步提升了 BERT 训练性能,在 15.869 分钟内即在 Wikipedia 数据集的 2850176 条数据上完成了 3.3 亿参数的 BERT 模型训练,相较于 V0.7 版本的最佳成绩 49.01 分钟的性能提升达到 309%。至此,浪潮 AI 服务器已经连续三次获得 MLPerfTM 训练 BERT 任务性能冠军。

浪潮信息在 MLPerf™V2.0 训练评测中取得佳绩的 2 款 AI 服务器分别是 NF5488A5 及 NF5688M6。NF5488A5 是全球首批上市的 NVIDIA A100 Tensor Core GPU 服务器,在 4U 空间支持 8 颗由 NVIDIA NVLink 互联的 NVIDIA A100 Tensor Core GPU 和 2 颗 AMD Milan CPU,同时支持液冷和风冷散热技术,累计斩获 40 项 MLPerf™冠军。NF5688M6 是面向大规模数据中心优化设计的具备极致扩展能力的 AI 服务器,支持 8 颗第三代 NVLink 互联的 NVIDIA A100 Tensor Core GPU 和两颗 Intel Ice Lake CPU,支持多达 13 张 PCIe Gen4 的 IO 扩展能力,累计斩获 25 项 MLPerf™冠军。

文章标签: 性能 训练 评测 服务器 服务 浪潮 数据 任务 模型 成绩 能力 冠军 支持 信息 参数 基准 浪潮信息 互联 处理 通信 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 报价宝 笔记本电脑价格 电视机价格 华为手机价格 降噪耳机价格