APP下载

【直击Web科技最前线:Google研究院】新神经图像学习框架登场,图片搜寻更贴近场景需求

消息来源:baojiabao.com 作者: 发布时间:2026-08-22

报价宝综合消息【直击Web科技最前线:Google研究院】新神经图像学习框架登场,图片搜寻更贴近场景需求

和其他框架相比,新神经图像学习框架Graph-RISE搜寻的相似图片,和原始图片较为接近(绿色代表相似图片,红色为其他图片)。(图片来源/Google)

使用Google搜寻关键字,除了可以寻找你想要的网络资讯,许多人也会搜寻图片,但如何准确搜寻到你想要的图片,系统必需要对图片的意义有深一层的理解,才能尽可能地贴近使用者的需求。

近期在台湾举行的Web Conference 2020上,Google研究院总监Andrew Tomkins介绍了新的神经图像学习框架Graph-RISE(Graph-Regularized Image Semantic Embedding),可对图像的语义有更精细地理解,已实际部署到Google的服务中。

Andrew Tomkins举例说明,早期的图像语意分析,粗略地分类图像产生的标签,只是类别层级(Category-level)的划分方式,例如将所有含有桥、河的图片分为一类,后来进一步强化图像学习技术,进入颗粒度更小的细致层级归类作法,可以将多张含有红色钢铁桥的图片归成一类,如果能够进一步区分所有含有桥的图片,例如能将含有不同角度,天空、河水颜色看起来不一样的金门大桥图片,都分类为金门大桥类别,就进入超高精细度的实例层级(Instance-level),可用实例或实际物件(Instance)来作为归类的划分范畴。

“透过实例层级分类,更精准地掌握图像内嵌的语意,正是图像搜寻服务的核心”,Andrew Tomkins说。当使用者输入文字或图片搜寻金门大桥时,希望能得到相关的图片搜寻结果。

因此,必需要为图像找到适合它们的实例层级标签,才能在人们使用搜寻时,尽可能贴近使用者的本意。

为此,研究团队先用人们进行搜寻时,查看搜寻结果所点选的缩图,经过去识别化处理、搜集,依搜寻词语出现的频率选定虚拟标签,共找出了4千万个虚拟标签,产生2.6亿张的样本图像,这些图像都已和虚拟标签配对,再加上未标签化的图像,作为训练用的资料。目标是找出内嵌模型,当两张图像为同一个分类,Image Embedding距离才会缩短。

在Graph-RISE框架中,先输入一张标签化的图片及一张相似图片(标签或未标签化),经过ResNet-101产生Image Embedding,再用于图像正规化处理。

这里所使用的相似图片,是从使用者每次搜寻时,所产生的相似图片关系,建立的共同发生图像网络(Co-Occurrence Graph)中选出。

接下来再通过Softmax函数,从4千万个查询标签(分类)里,预测可能符合图词组义的标签。不过,Andrew Tomkins指出,要从4千万个标签中选出可能性较高的标签,在实务上可能不太符合效益,为了让运算处理更有效率,因此,Google从所有标签中取样出10万个来进行预测。

为了测试其效果,在视觉品质方面,他们随选出6张图片进行搜寻,在10亿张图片中搜寻相似图片,比较DeepRanking、ResNet(未经图像正规化处理)和Graph-RISE三种框架的搜寻结果,再由人类专家评比,找到的图片是否接近原图。结果发现,Graph-RISE所找到的相关图片,准确性比另两种框架更高,但是在某些图片,Graph-RISE也会发生找错图片的情形。

而使用kNN Accuracy在ImageNet和iNaturalist两个公开资料集上来测试模型的准确性,Graph-RISE(40M)的准确性高于其他;使用内部资料集,在Triplet Accuracy测试,准确性也优于其他框架。

目前他们已将图像正规化工具开源,并释出到TensorFlow中。

2020-05-07 09:55:00

相关文章