Google以图像增强算法强化深度学习,推测精准度创新高

AutoAugment算法能够自动调整图像颜色,增加深度学习模型训练资料多样性
Google发表了AutoAugment技术,从训练资料下手来增强深度学习的效率,该算法可以找出最佳增强策略,自动增加既有资料集所能提供的资料数量与多样性,透过这个方法,Google大幅增加了图像推测的精准度,在ImageNet资料集中获得了83.54%的精准度,目前排名第一。
深度学习在电脑视觉领域的应用,要提高模型的推测精准度,关键通常在于大量标记的训练资料的可取得性,只要输入越多高品质具多样性的训练资料,模型的效能也会随之增加,但Google提到,重点就是收集大量的高品质训练资料,来提高模型效能是一件非常困难的事。
过去在训练高效能的电脑视觉模型,无论是半自动产生或是手动编辑资料的增强方法,一直都是选项之一,透过翻转或是旋转图像,能让类神经网络取得更多样性的训练资料,但最近的研究已经不太有人关注这个面向。Google提到,他们是因为受到自家机器学习服务AutoML的启发,因为先例以类神经网络与Optimizer产出的结果,替换人类设计的系统元件,才重新燃起这样的想法,他们认为,或许系统也能自动完成资料增强,让机器学习自己决定资料增强方法,生产出更多用于深度学习训练资料。
AutoAugment的想法很简单,Google表示,图像具有许多对称性质,而这些性质的改变并不会影响图像的内容,像是狗的图像镜射仍然是狗,虽然这样的变化对人来说是显而易见的,但像是在训练时将图像互相交叠,透过混合方法来增强资料,就不这么直觉了。
AutoAugment是专为电脑视觉设计的资料集自动增强策略,除了一些基本的图像操作,像是水平、垂直翻转,或是单纯的旋转外,还能更改图像的颜色。AutoAugment不仅可以预测合并图像的变换,还是预测每个图像变换的概率和大小,算法不会总是以相同的方法操做图像,AutoAugment会在2.9乘以1.32的图像变换概率搜寻空间中,选择一个最佳的变换政策。
AutoAugment会针对不同资料集的属性,学习不同的图像变换方法,像是在包含数字与自然场景的门牌号码街道视图,AutoAugment就会将增强处理重点,放在裁切与平移等几何变换上,而且由于世界各地门牌号码的样式颜色不一,AutoAugment还学会完全反转从门牌号码街道视图上收集到的门牌颜色。
而在CIFAR-10与ImageNet资料集中,AutoAugment则不会对图片进行裁切,因为这些图片通常不包含被截断的物体,而且也不会反转图像颜色,因为最终总会出现不实际的图像结果,但是却会自动调整颜色分布,同时保留一般颜色的属性,Google表示,这代表着在这两种图像资料集中,物体的实际颜色很重要,而在门牌号码街道视图则是相对的颜色重要。
Google透过AutoAugment算法,意外的发现过去一些著名电脑视觉算法的增强策略,而在取得这些增强策略的综合优点后,推测精准度有了大幅度的增加,除了在ImageNet资料集中获得了83.54%的精准度,目前排名第一外,在CIFAR10资料集上错误率仅有1.48%,这个结果比科学家预设的错误率还低0.83%。
另外,在门牌号码街道视图的应用上,错误率从原本的1.30%降低到了1.02%,而且Google提到,AutoAugment发现的增强策略是可以移植的,像是在ImageNet资料集归纳出的策略,也可以应用在福特汽车或是FGVC-Aircraft的资料集中。
