APP下载

Google利用装置上模型,助视障者辨认超级市场商品

消息来源:baojiabao.com 作者: 发布时间:2026-09-06

报价宝综合消息Google利用装置上模型,助视障者辨认超级市场商品

Google发布了一个称为Lookout的Android应用程序,利用电脑视觉为视障人士建立无障碍空间。当用户将智能手机,对准超级市场货架上的商品时,Lookout能够即时辨识商品,并且大声地念出品牌名称以及容量。

Google提到,视障人士日常生活遇到的挑战之一,便是在超级市场或是厨房中,辨识包装食品,因为许多包装食品使用一样的容器,像是相同形状大小的盒子和罐子,只是标签上的文字和图像不同。这样的包装增加了视障人士辨认商品的困难度,因此Google尝试使用行动装置与机器学习技术,来解决这样的问题。

由于近年来人工智能的发展,装置上的神经网络准确度大幅提升,再加上行动装置的运算能力越来越好,因此不少电脑视觉的运算,已经可以在行动装置上高效能地执行,Google表示,只要结合装置索引技术,以及诸如MnasNet和MobileNets等装置上模型,就能在行动装置上开发完整的电脑视觉系统,即时辨识标签。

Lookout内含具装置上产品索引的超级市场产品侦测和辨识模型,还有MediaPipe物件追踪和光学字元辨识模型,研究人员特别设计结合两者的架构,能够有效率地在装置上即时辨识商品。Google解释,完全装置上系统的优势,是低延迟且不用依赖网络,但是这也代表,要商品辨识系统有用,装置上的数据库必须要良好地覆盖产品范围,其中包括根据用户地理位置,动态选择两百万种热门商品。

但是传统的电脑视觉产品辨识方法,仰赖比对部分图像特征来进行,这些没有使用机器学习技术的方法,虽然能够可靠地配对符合的图像,但是索引图像的储存容量却相当大,每张图像大小约为10 KB到40 KB,要储存200万种商品是一个不小的数字,而且传统方法对于处理照明不佳或是模糊的图像,辨识能力并不好,Google还指出,仅使用部分图像特征也就代表了,索引图像仅提供局部资讯,无法捕捉更全面的外观。

另一种方法,则是使用基于机器学习技术的光学字元辨识系统(OCR),以撷取产品包装上的文字,但同样会有索引文字档过于庞大的问题,而Google最后则是选用了神经网络方法,替每个图像产生全域特征,大小仅有64字节,由于大幅缩小索引容量,因此可以在索引添加更多产品,提升商品辨识的覆盖范围,使得用户体验更好。

Lookout除了可以在超级市场中,辨识产品品牌以及容量之外,还能提供包括营养成分、过敏原等详细产品资讯,附加用户评价、产品比较和价格追踪等额外资讯,Google提到,他们也还持续提升Lookout的功能,强化模型品质和强健性。

2020-08-12 21:48:00

相关文章