在稍早 IBM 宣布与群环科技针对 IBM PowerAI 深度学习框架扩大合作时,笔者与 IBM 的 Power 处理器专家小小的聊了一下关于他们目前的硬件架构与 AI 产品战略, IBM 认为,他们目前在硬件的架构已经相当领先,但光是硬件架构还不够, IBM 的 PowerAI 计划也提供了软件与 AI 相关的最佳化,更重要的是 IBM 的架构还具备可扩展性。
IBM 之所以对他们在 AI 的硬件性能有这么大的信心,也仰赖 IBM 的 Power 架构, IBM 的 Power 架构不仅是采用针对超级电脑最佳化的设计,同时还透过 OpenPower 联盟进行跨业界的结合,其中一项相当重要的是 NVIDIA 加入 OpenPower 联盟,并且将目前 AI 最炙手可热的 NVIDIA GPU 所具备的 NVLink 超高速通道导入。
虽然目前在许多为人工智能设计的超级电脑中, NVIDIA 的 Pascal 与 Volta 架构 GPU 已经屡见不鲜,不过相较于 x86 架构, IBM Power 8 与 IBM Power 9 因为支援 NVLink ,故不仅获得 CPU 与 GPU 直接相互沟通的能力,同时还可藉统一储存内存,打破目前 AI 训练最容易发生的加速器内存不足的情况。
在目前 x86 的人工智能服务器架构下,因为 GPU 与系统的内存是独立的,虽然可借由 MVIDIA 的 NVLink 将最多 8 张 GPU 的 HBM2 内存共享,但相较服务器系统所具备的系统内存仍是相当小的,一旦深度学习所需的数据量过于庞大,就会造成系统当机。
透过 IBM 与 NVIDIA 共同投入的 NVLink 通道技术后,不仅使 CPU 与 GPU 在运算获得相互沟通的平等权,使运算流程不再需要回归 CPU 后再行指挥,更重要的是能够使 GPU 也使用到系统所撘载的大量 RAM ,并且借由系统自动分配资料,将合适的资料分别存放在高速的 HBM2 与大容量的系统 RAM 上。
此外, IBM 所提供的 AI 解决方案不同于市场多数解决方案是以基于开源软件搭配针对单机的运算方案, IBM PowerAI 解决方案可透过高速网络进行架构的横向扩充,当企业的人工智能需要更高的运算量,就不用受限于单一主机的运算力,仅需再扩充 Power AI 主机后即可使运算力再增加。
除了透过 NVLink 结合 NVIDIA GPU 以外, IBM 也在 Power 9 率先导入 PCIe 4.0 界面、 OpenCAPI 界面等,使各式的硬件加速器能够透过新世代的快速通道与 Power 9 直接沟通,使客户可依照需求弹性的扩充适合各类需求的加速器架构。
而 IBM 认为除了硬件之外,最重要的是提供让客户能轻易使用的完整解决方案, IBM 不仅提供完整的软件与框架工具,同时也在深度学习的培训系统提供简化,强调若仅是用于初阶的影像辨识与分类,甚至可在 30 分钟就完成培训的前置准备、选择模型并开始训练,对于 IBM 的 AI 战略来说,提供高性能的硬件只是基本,能够简化使用者的开发过程才是关键。
IBM 强调,若是电脑运算,势必会得到结果,即便是 AI 也是一样,但为何有许多深度学习的开发在训练后无法得出结果,往往就是在深度学习的几层之间的调教发生顾此失彼的状况,因为深度学习采用的类神经网络就如同人类大脑一般,是以逐层方式作为逻辑。
而许多不熟悉深度学习特性的开发者往往以为只要修复发现问题的层就可解决问题,不过却忽视在其中一层修改后还需要连后续的层也一并修改,否则无法配合先前修改过的层,这会导致模型无法达到正确答案,使得范围无限扩张而得不到答案, IBM 的解决方案中除了可侦测发生问题的层以外,也会提出必须随之修改的相关层的建议。
至于 AI 架构是否会因为专属的加速器出现而产生变化, IBM 的观点则是趋向目前 AI 仍在成长期,虽然深度学习是市场大方向,但显然在框架、学习语法都还在陆续推陈出新下,为了因应市场不断的变化,具备弹性的可程式化架构仍较专属的硬件加速器可适应急速变化的 AI 市场。
IBM 这次在台湾与在地合作伙伴群环科技合作 PowerAI 深度学习框架,也是为了让客户能够借由在地化的资源快速获得 AI 相关的产业知识与企业资料,并且让企业能依照不同的产业对于深度学习模型需求,并结合企业内部数据进行测试,体验 AI 带来的产业革新,使企业能够评估并且容易实践导入 AI 的企图。






























