APP下载

瘾人物:解放人工智能影像分析与应用可能性的幕后推手,台大徐宏民教授

消息来源:baojiabao.com 作者: 发布时间:2026-07-28

报价宝综合消息瘾人物:解放人工智能影像分析与应用可能性的幕后推手,台大徐宏民教授

这几年在人工智能领域的分支当中,基于类神经网络的深度学习技术成为市场大热门,而 NVIDIA 在台湾大学成立 AI Lab ,幕后的推手就是由过去在业界拥有丰厚影像技术经验的资讯工程学系以及资讯网络与多媒体研究所徐宏民教授。

 

源自对影像分析与辨识技术的热情由产转学

徐教授是由业界转向学界的代表性人物,他曾为台湾知名影音技术公司 CyberLink 的创始员工,热爱软件与影音技术,相信软件技术为未来产业核心。同时也因为接触 DVD 内容管理后,与影像分析结下不解之缘;当年他因为听了一场影像辨识与搜寻相关的演讲,毅然决然离开当初为当红炸子鸡的 CyberLink ,投入影像辨识技术的研究领域。

不过相较当时热门的影像编解码,影像辨识技术并没有明确的市场和应用,在相机技术尚未成熟的时代,数位影像资料的数量与品质相对匮乏。

然而如同许多技术都是由美国军方与政府机关应用开始,当时徐教授在纽约哥伦比亚大学攻读博士学位,所处的实验室从事跨语言新闻节目视讯分析与搜寻,对各国大量视讯内容所出现的人、事、物进行辨识。

在大约 2004 年时,徐教授的实验室定义出 LSCOM 技术进行新闻事件中的重要物件与事件侦测,约可以辨识 400 项左右的物件、人物和事件等,在当时已经是相当先进的技术。

而为了提升运算效能,在只有 CPU 运算的时代,他们透过手动撰写程式码进行运算处理,其间接影响日后徐教授在进行平行运算研究与开发时,对于基础理论有更深刻的认知。

 

学成归国与 CUDA 结下不解之缘

徐教授在 2007 年回到台湾,当时数位影像随着网络的普及已开始蓬勃发展,无论是传统相机的数字化或是数位监控等,皆已产生大量且品质良好的影像数据,再加上网络相簿的出现,都对日后影像分析打下稳健的基础。

谈及与 GPU 平行运算的结缘就必须回溯到 2012 年年底他受邀到日本京都欧姆龙演讲,会后一位日本老先生与他提及深度学习技术在影像辨识的应用似乎已经有所成果,不过当初他的认知仍停留在类神经网络是未能蓬勃发展且不被受关注的技术,但他后续仍找了许多相关资料,才得知当年 ImageNet 利用消费性 GPU 加速的系统结合深度学习架构,一举突破数位影像辨识的门槛。

不过真正开始接触影像辨识,则是在隔年的夏天,徐教授也不讳言的表示,当时的契机是因为美国微软研究院举办了影像搜寻竞赛,提供一万美金的奖金,新颖的比赛方式与丰厚的奖赏驱使徐教授的学生们跃跃欲试,组团参加竞赛。

比赛方式是由参赛队伍训练一套系统,此系统要在十秒以内针对由微软提供的问题,判断关键字与影像是否意义吻合。对此团队中就有学生开始利用卷积网络的特征值来增益搜寻品质,实验成果不仅让他们获得全球比赛冠军,更让徐教授决心在 2013下半年 开始投入研究深度学习的影像与视讯分析技术,如今丰硕的成果也证实当时的决定是正确的。

 

研究资源专注投入 GPU 与 NVIDIA 合作设立 AI Lab

徐教授明白要投入一项技术开发,需仰赖前人的智慧与丰富的生态圈,因此便注意到 NVIDIA 不仅供应硬件,也积极投入开发 CUDA 和深度学习加速套件。更重要的是,CUDA 技术的应用已有相当庞大的社群,能够相互分享与探讨各类应用与技术,并有许多具有经验的开发者提供各类相关辅助套件。

徐教授与学生的研究多以大量的影像数据为基础进行分析,系统需要庞大的资料吞吐量,若是以云端架构进行光是在资料传输就需要耗费大量时间,此外,即便透过纯 CPU 分散架构进行运算,除了运算能力不足的问题外,资料在系统间的传输也相当缓慢,尤其在单靠内部学术网络更是难以负担,因此在台大架设高效能的 GPU 运算中心是当务之急,借由导入 GPU 架构后,不仅能提升单一服务器的运算效能,同时借由高速总线连接各主机,大幅改善影像数据分析的大量需求。

徐教授与团队从一开始选择 Tesla K20 与 Tesla K40 搭配服务器作为主要架构,并选用消费级 GPU 让学生进行计划初期的基础试验,后续的成果再移植到服务器上。因为积极投入 GPU 与深度学习的开发,不知不觉徐教授与团队购买了许多 GPU 产品,引起 NVIDIA 的注意并开始与徐教授接触,想了解徐教授是何许人物、又把他们的 GPU 用在什么领域。

NVIDIA 长期以来除了针对研究人员与机构提供软硬件的支持外,同时也重视发展相关的产业生态圈,因此在去年推出基于 Pascal 架构的 DGX-1 人工智能超级电脑后,便宣布提供一套DGX-1给徐教授并合作成立 NVIDIA AI Lab。同时在今年 NVIDIA 推出 Tesla V100 后,徐教授与团队也获赠两张具备最新人工智能与深度学习架构技术的 Tesla V100 GPU。

徐教授点出实验室近期使用深度学习框架的趋势,过往多半以 Caffe 为基础,自去年起 TensorFlow 宛若后起之秀与 Caffe 平分秋色,今年 TensorFlow 则反超 Caffe 成为实验室最主流的框架,其原因在于 Caffe 虽然具备较好的效率,但却缺乏调整的弹性,而学生的研究需要自行设计学习网络结构,容易调整、更动的 TensorFlow 自然更为合适。

 

自诩不是做传统 AI ,而是从事机器学习的影像技术分析与应用

由于当前深度学习趋势以基于影像分析的混合讯号应用为主,不少人都会直觉认定徐教授所从事的是 AI 应用,但徐教授认为 AI 是一个广泛的议题,他所做的是以机器学习为基础,发散出创新的影像以及混合数据分析应用。

影像分析不仅只有商机,在从事过程中所面对的挑战亦可化为乐趣,在新技术的导入及运算效能的提升时,也能够有许多颠覆想像的创新应用,例如今年徐教授与团队就挑战透过无人机的鸟瞰角度拍摄并分析下方的车辆数量,乍看下似乎相当简单,但鸟瞰角度相较平面角度更富挑战,不像平面视角的车辆有立体层次,如何将影像中的车辆正确圈出、并进一步正确判断停在树荫下的车辆,就是这次的研究课题,此项计划花费近两年的时间也终于做出成果,十月即将在顶尖电脑视觉会议 ICCV 发表。

其他应用的可能性举凡医疗影像的分析、照片的管理与产线自动化检测等,都是目前各产业正在着手的应用,徐教授也特别举出关于太阳能管理相关创新应用,其借由 Sky Camera 的影像进行分析,作为日照发电效率的评估使用,此外,还有透过手机拍摄 2D 物体照片后,从影像数据库中找出符合形状特征的 3D 模型,其中牵涉复杂的运算处理,将 2D 物件分析后转为 3D 模型的重建与对照,这项应用将对于工业生产与艺术设计有极大的帮助。

虽然徐教授现在身处学术单位,不过由于先前业界的经验与丰硕的研究成果,徐教授的研究团队也乐于与产业界交流与合作,目前包括与台湾 NAS 品牌群晖科技合作的照片辨识、光宝集团的视讯安全监控、与微软合作透过影像辨识将照片写成的诗集、联发科的影像辨识相关合作、与 IBM 华生研究中心合作完成第一个 AI 自动剪辑的电影预告片等,都是目前徐教授与业界结合的实证。

他认为AI技术能够应用领域很广,如果能够专注在“提升产能、效率和安全”的应用上,对于台湾整体产业发展,将带来革命性的转变。尤其是在于其将产出的大量资料与资料单位价值高的几个领域,例如:制造、能源、健康医疗、交通和 IT 等,都是值得大量投资 AI 技术的领域。他也迫切指出,将 AI 技术透过产学合作转移到这些产业类别是缓不济急的,因此他也协助台大资工的系友们成立专注在工业界 IoT 混合讯号的 AI 新创公司慧景科技 (Thingnario),希望这些前瞻技术可以尽快在台湾产业深耕发热。

 

延伸阅读:

为医疗诊断辅以人工智能的理性与效率 中国医药大学人工智能医学诊断中心以深度学习打造肝脏电脑断层影像辅助诊断系统

一图看懂 NVIDIA 与智慧城市

 

 

回应 0
2018-05-27 12:34:00

相关文章