APP下载

AI趋势周报第122期:机器界ImageNet!史丹佛开源最大机器人操作影片资料集RoboTurk

消息来源:baojiabao.com 作者: 发布时间:2026-08-04

报价宝综合消息AI趋势周报第122期:机器界ImageNet!史丹佛开源最大机器人操作影片资料集RoboTurk

史丹佛大学开源号称是机器界ImageNet的大型影片资料集RoboTurk,收录了来自54个业余者的111.25小时示范影片。

图片来源: 

史丹佛大学

重点新闻(0229~0305)

RoboTurk     机器人     资料集  

机器界ImageNet!史丹佛开源最大机器人操作影片资料集RoboTurk

史丹佛大学日前释出号称最大、最丰富且多样的机器人操作影片资料集RoboTurk Real Robot Dataset,要推进机器人决策等相关研究。2年前,史丹佛大学AI实验室负责人李飞飞与团队展开一项专案,建立了RoboTurk和Surreal两大平台,以群众外包方式来收集高品质的机器手臂任务示范资料。

首先,透过RoboTurk平台,使用者可用手机或浏览器,在远端即时操控模拟的机器手臂,来抓取物件。后来,史丹佛大学团队利用3支实体的Sawyer机器手臂,让使用者透过该平台,在远端操作实体机器手臂,并同时收集操作数据。操作的使用者有三个任务要解决,包括物件搜寻分类、物件堆塔、衣物折叠等。而Surreal则是开源的强化学习框架,可加速机器手臂的学习。

经过两年运作,近日,团队宣布任务完成,免费释出RoboTurk资料集,包括来自54个业余者的111.25小时示范影片。团队表示,这些资料可用于策略学习和多种应用,如多模态密度预估、影片预测、奖励功能学习,以及阶层任务计划等。(详全文)

  Amazon     ReStGAN    影像生成  

望文生景!Amazon发表ReStGAN输入文字就能产生商品图片

Amazon发表一套ReStGAN模型,能根据商品文字描述,产生相应的服装范例,目的是要消费者透过视觉导引,一步步找出自己想要的产品。比如,使用者输入黑裤女,再输入小号和七分,一旁的服装图片就会随之调整。

团队指出,该模型的特别之处,在于新文字输入时,服装范例依然保有旧的特征,再随之调整。ReStGAN是以StackGAN为基础,StackGAN专门处理文字转图片的任务,可分为两部分,首先是根据文字,直接产生一张低分辨率的图片,接着再从这张图片上采样,产生一张纹理和颜色更清晰的图片。不过,Amazon团队额外加入了一个递回归网络LSTM,可处理序列型任务,让模型可随文字的新增顺序,来调整产出的图片。经测试,团队的改良版StackGAN模型,皆比目前四款常见的GAN基准模型表现要好。(详全文)

  英特尔    潜在客户搜寻    行销  

英特尔用AI过滤百万家企业网页,寻觅潜在客户更有效率

英特尔日前公开自家寻找潜在客户的方法,由分析团队打造一款客户分类AI系统,可挖掘数百万个公开的企业网页,并从现有和潜在客户中网页中,抽取可分析的部分。该系统可针对两层面来分类,一是产业领域,另一是职能角色,像是制造业者或零售商等。

而这套AI系统由两部分组成,首先是负责采集大规模资料的引擎,要从公开来源收集企业网页资讯,并将这些资讯结合内部数据,形成知识图谱,并即时更新。再来是一组细分潜在客户的机器学习和NLP模型,网页资讯会先输入至用来分类文字的多重标签CNN,接着,团队再用BERT来优化文字分析,并用维基百科上的文字资料,来扩展模型的认知。

英特尔表示,以往,业务单位都得手动或透过其他工具,来寻找潜在的产业领头羊,但这些工具不符合英特尔内部使用的语言,因此难以制订行销计划。英特尔指出,透过新的AI系统,比传统方法更精准也更快速。(详全文)

  Google    二阶梯度优化       模型训练  

Google发表超强深度学习二阶梯度优化法,机器翻译模型实测能让训练时间少4成

深度学习训练资料越多,模型预测力越高,但运算资源就越庞大,如何优化训练效率是热门的AI议题,一阶梯度优化是目前主流作法,例如Adam、AdaGrad等,尽管也出现了不少优化效果更好的二阶梯度作法,但因需要庞大的运算力和内存,而难以实用。Google Brain、普林斯顿大学和以色列特拉维夫大学团队发表一个可以减少运算成本的二阶梯度优化法,甚至官方宣称,比所有一阶梯度优化器要快。

这个团队以两年前发表的优化器Shampoo为基础,以节约型的迭代算法Schur-Newton来取代原本耗费运算资源的SVD,并利用闲置的CPU进行自动双精度算法,来降低运算成本。此外,团队也分离步长(Step)大小、方向,并跳过大维度的预处理。团队也实际应用到英法机器翻译的应用上,利用Transformer模型来测试,发现二阶梯度优化法可达到一阶优化器一样的成效,但所需步骤的长度少了一半,且收敛速度在迭代数上快了1.95倍,整体时间减少40%。(详全文)

  Google    Mesh-TensorFlow     医疗影像  

AI分析超高分辨率影像有解,Google释出Mesh-TensorFlow框架

Google日前发表空间资料分区技术,可在保有分辨率的前提下,来分析超高分辨率图像,如医疗上常见的3D断层扫描等。首先,团队用Halo Exchange算法,来跨空间分区处理卷积运算,保留相邻分区的关系。过程中,Google以分散式深度学习架构Mesh-TensorFlow为基础,可根据用户定义的影像布局(Layout),分割张量到装置Mesh网络中,来执行高效能资料与模型平行运算。

现在,团队也将这个框架用于肝肿瘤断层扫描上,证明可行性。同时Google也释出Mesh-TensorFlow框架,供研究社群使用。(详全文)

Gmail   恶意文件侦测    深度学习  

Gmail强化恶意文件侦测能力,用深度学习扫Office恶意文件

Google在Gmail中部署了深度学习加持的文件扫描器,可改善恶意文件侦测率。Google指出,团队利用恶意程式扫描软件来把关Gmail安全,每周处理3千多亿个附件,其中每天被拦截到的恶意程式,63%都与前一天不同。

为此,团队导入新的文件扫描器,由两部分组成,首先是用TensorFlow Extended训练出来的TensorFlow深度学习模型,以及为每种档案类型客制的文件分析器。文件分析器的功能包括解析文件、辨识一般的攻击模式,并进行特征撷取等工作,提高了Gmail对恶意文件的侦测率,达150%。不过,目前这项新技术仍仅用在扫描Office文件。新的扫描程式与原有的侦测功能会平行运作。(详全文)

fastMRI   对抗学习     脸书  

影像品质不只高且更清楚,fastMRI用对抗学习消除伪影

脸书和纽约大学2年前展开fastMRI专案,最新成果不只能将磁共振成像(MRI)扫描的速度提升10倍,还能以深度学习解决MRI伪影问题。团队指出,深度学习从少量原始资料产生高精准MRI时,容易产生带状或条纹状的伪影,会影响放射科医师判读。

为此,团队利用定向对抗训练来产生深度学习模型,要从加速过的MRI中获取原始资料,来产生无伪影的MRI。定向对抗学习的原理是,训练目标会新增额外的损失函数,来鼓励模型骗过对抗网络。而团队采用这个方法,借由在影像重建前后,随机转换输入值,来产生水平和垂直的带状条纹,并同时训练对抗网络和重建模型,随着重建结果越来越好,对抗网络也会逐渐适应,直到最后没有条纹产生为止。(详全文)

Open Images     资料集      局部叙述  

Google释出Open Images资料集第六版,新增局部叙述注解

Google日前发布新版大型影像资料集Open Images V6,特别新增局部叙述(Localized Narrative),可随着鼠标在图像上的移动,同步显示该物件的文字描述,并以语音读出。局部叙述由注释者提供,包含了注释者以鼠标在图片上移动时,一边说出的语音描述。Google表示,局部叙述打破了过去图说的限制,让图片中的物件也有相对应的叙述。

此外,Google也在这次新版资料集中,增加了视觉关系注解,像是男人踩着滑板、狗接住飞盘等范例,另外还新增了2,350万个人工验证的影像等级标签。(详全文)

图片来源/史丹佛大学、Google、Amazon、英特尔、脸书

 AI趋势近期新闻 

1. Kubeflow 1.0正式发布

2. 论文投稿数创新高!IEEE顶级电脑视觉会议CVPR 2020如期举办

3. 微软Power Automate的RPA功能将于4月正式发表

4. Postgres.ai推SQL查询最佳化机器人Joe

资料来源:iThome整理,2020年3月

 
 
 
 
2020-03-05 13:52:00

相关文章