APP下载

以YOLOv4打败Google还不够,中研院组队瞄准物件追踪AI要再拿世界第一

消息来源:baojiabao.com 作者: 发布时间:2026-09-08

报价宝综合消息以YOLOv4打败Google还不够,中研院组队瞄准物件追踪AI要再拿世界第一

YOLOv4为边缘应用带来更轻量更准确的物件辨识能力,中研院资科所所长廖弘源指出,他目前正另组团队,要打造另一款世界第一的物件追踪AI。

图片来源: 

摄影/王若朴

YOLOv4今年问世以来,不仅广受全球AI社群讨论,在9月28日的MSCOCO物件侦测竞赛中排名世界第一。“但这还不够,”开发YOLOv4关键技术的核心人物中研院资讯科学研究所所长廖弘源指出,他现在还另组国家队,锁定物件追踪AI,发豪语要打造全世界最好的追踪器、再次打败Google、AWS,拿下另一个世界第一。

无心插柳柳成荫,为产业解题意外催生YOLOv4

YOLOv4的诞生,还得从2017年的科技部计划说起。当时,科技部提出“业界出题、学界解题”AI计划,由企业提出问题,再由学界提供技术来解决,让学界技术得以落地应用。

在这项计划中,中研院资科所与义隆电子媒合,要来解决义隆电子提出的交通车流分析问题。为了解题,廖弘源找来以前的博士班学生组队,包括后来YOLOv4的共同作者、中研院资科所博士后研究员王建尧,以两大共识来执行任务,也就是要挑选能以科学解决的现实产业问题,以及“先把手弄脏,”先不要考虑论文发表,如此才能从动手做的过程中,找出最佳解法。

经双方讨论,团队制定出2018年至2021年的解题目标。首先,2018年要完成鱼眼车流分析、多摄影机行人识别技术、行动装置人脸防伪技术,2019年锁定路口停等车队与车流分析、混流车牌识别、行车鱼眼多物件追踪,2020年则是结合前两年的鱼眼车流分析技术和停等车队与车流分析技术,来建立路口交通号志控制系统;2021年则要完善智慧交通路网号志控制系统,要透过混流车牌识别技术,以科技执法来揪出违规车辆。

有了年度目标,团队也进一步规划开发流程。2018年,他们聚焦于鱼眼十字路口车流分析,将使用场景锁定于路口交通号志灯,在号志灯上装设鱼眼镜头,搭配Nvidia Jetson TX2平台,来拍摄、分析道路路口影片。其中的技术要求,包括要能辨识车辆、车种和数量统计,比如认出汽车、机车、自行车、联结车等,此外,还要能辨识车流量、车行平均速度、路口平均占有率和车辆间距等。

同年6月,团队也部署鱼眼镜头,实际测试用来分析车流量的算法,并根据侦测到的数据,来调整交通号志灯号。

接下来,2019年,团队将开发目标扩展至停等车队分析,将枪型式摄影机装设于交通号志灯或一旁立杆上,每个方向装一支,一样搭配Nvidia Jetson TX2平台,来拍摄、分析路口影片。而技术目标,则是要辨识各车道线内的停等车种和间距,比如机车、小客车及大型车,以及这些车间的距离。

在实作上,他们进行了停等车队与车速的分析,以及停等车队与车流的分析。而当时枪型摄影机所搭配的物件侦测算法,就是“意外发展出来的YOLOv4。”

以PRN和CSPNet为基础,今年YOLOv4正式诞生

YOLOv4就在这些阶段性的任务中诞生了。2018年,为配合硬件平台限制,廖弘源与王建尧以ResNet为基础,改善了学习策略,自行开发一套快速、较不耗费运算资源的轻量级类神经网络:局部残差网络(Partial Residual Networks,PRN),来进行影像辨识。虽然PRN比YOLOv3快上两倍,但准确度比YOLOv3稍差。

隔年,为改善这个问题,他们着手研发跨阶段局部网络(Cross-Stage Partial Net,CSPNet),不只耗费的硬件资源更低,准确率也更高。这是因为,CSPNet可增加梯度组合(Gradient combinations),也能最大化梯度多元性,一改卷积网络为人诟病的梯度消失问题(也就是学习效率不佳的主因)。

2019年11月,廖弘源和王建尧开源了CSPNet程式码,立刻吸引了Alexey Bochkovskiy的注意,也就是维护YOLOv3 DarkNet的电脑视觉专家。“他对CSPNet很有兴趣,”廖弘源指出,他也邀请团队以三种GPU来测试CSPNet效能,包括Maxwell、Pascal和Volta。

今年3月,他们完成所有GPU测试,发现“CSPNet在三种GPU的表现,都是世界最好的。”后来,他们将测试程式码开源出来,也另外写了篇论文,并发表为YOLOv4,作者就是廖弘源、王建尧和Alexey Bochkovskiy。

在架构上,YOLOv4以CSPDarkNet53为Backbone,来加强卷积网络的学习能力,而Neck部分则加入空间金字塔池化层(Spatial pyrimad pooling)和PANet,前者用来强化接受区域(Receptive field)作用,能将最重要的特征区分出来,后者则取代YOLOv3的FPN,在不同等级的侦测器中聚合参数(Parameter aggregation)。最后,在YOLOv4的Head,则采用YOLOv3。

在效能上,YOLOv4比EfficientDet快上两倍;而且在采用Tesla V100 GPU的情况下,以MSCOCO资料集来测试物件辨识能力,YOLOv4可每秒辨识65帧(fps)、平均精确度(AP)达43.5%,“优于其他R-CNN网络表现。”

9月拿下世界第一,下个目标瞄准物件追踪AI

不只如此,在今年9月28日的一场MSCOCO资料集物件侦测竞赛中,团队以CSPNet加上Mish启动函数参赛,拿下第一、第二、第四和第六名,打败Google、高通、Amazon和脸书的类神经网络(如下图),“从9月28日到现在,这个排名都没有改变过,台湾一直是世界第一,”廖弘源说。

YOLOv4也带来嵌入式应用的新作法。比如,边缘装置系统不须将资料上传至云端,也能即时分析、回馈,“享有与云端运算同等的高精确度,”而且装置成本低、耗电量也低(小于30瓦)。

话锋一转,廖弘源指出,“我们并没有停下来,”反而找来国内大学教授、组了10人台湾队,锁定物件追踪AI,要打造“全世界最好的Tracker,再次打败Google、Amazon,让台湾再荣光一次!”文◎王若朴

2020-11-17 16:54:00

相关文章