APP下载
报价宝  ›  综合  › 

AI趋势周报第146期:再见了卷积网络?一篇Transformer匿名论文引起ML社群围观

报价宝 来源:baojiabao.com 发布时间:2020-10-15 12:49:00 09月12日更新
报价宝综合消息AI趋势周报第146期:再见了卷积网络?一篇Transformer匿名论文引起ML社群围观

近日一篇Transformer匿名论文引起ML注目,它强调只以Transformer进行大规模预训练,其影像分类表现比卷积网络要好,而且更省运算资源。

图片来源: 

匿名作者

重点新闻(1009~1015)

卷积网络     Transformer     影像辨识  

再见了卷积网络,一篇Transformer匿名论文激起ML社群关注

一直以来,卷积网络(CNN)是影像辨识的首选,但近日一篇匿名论文(An Image Is Worth 16×16 Words: Transformers for Image Recognition at Scale)引起ML社群关注,就连DeepMind研究科学家Oriol Vinyals、Tesla的AI总监Andrej Karpathy和发明AlexNet的OpenAI首席科学家Ilya Sutskever都表示期待。

该论文指出,在电脑视觉中,注意力机制不是与CNN共用,就是替代CNN中一些元件,来保持适当结构。然而,作者认为,这种对CNN的依赖是没必要的,而且直接利用Transformer来处理影像Patch序列,其影像分类能力会比CNN出色。论文强调,Transformer以大量资料进行预训练且迁移至多种影像辨识benchmark时(如ImageNet, CIFAR-100和VTAB等),其表现不仅能比高阶CNN要好,所需的硬件资源还少了许多。

这篇论文目前正接受国际顶尖AI盛会ICLR 2021的评审,因此无法透露作者姓名。不过,外界推测是Google研究团队,因为论文采用的资料集JFT-300M只限Google内部研究使用。该资料集拥有3亿张影像、近两千个类别,供Google用来改善电脑视觉算法。(详全文)

  Performer     硬件资源    Google  

比Transformer更经济实惠!Google联手推Performer架构

Google联手DeepMind、剑桥大学、Alan Turing研究所,共同设计一款改良版Transformer架构Performer,解决Transformer耗费过多硬件资源的问题。

一般来说,Transformer的自我注意力机制解决了RNN梯度消失的问题,其注意力机制可学习分辨输入值序列中的复杂依赖关系。然而,随着输入值增加,Transformer就会增长4倍,所需的硬件资源也就更多。为解决问题,团队以快速注意力机制FAVOR+为骨干,打造出Performer架构,能快速、准确地估算Softmax注意力排名,且不依赖稀疏性和低等级等先验条件,可解决耗费硬件资源的问题。团队也以Performer进行一系列测试,范围涵盖像素预测、蛋白质序列建模,结果证实Performer除能耗费较少资源,还比基准模型快上两倍、准确率也有所提升。(详全文)

  手语侦测     即时辨识     光流  

Google打造视讯会议手语辨识模型,助聋哑人士即时发声

Google联手以色列巴伊兰大学、瑞士苏黎世大学,开发一套即时手语侦测模型,可即时在视讯会议场合中辨识手语人士,并设置为主要发言人。该模型在浏览器上执行,轻量且容易上手,能从画面中分离出人体动作和关节变化等讯息,大幅降低运算整帧HD影像的负担。

进一步来说,模型除了从每帧影像撷取关节点,也会累积每帧的光流(Optical flow)变化,这些光流特征会送至LSTM模型,来分类是否为手语姿势。团队利用德国手语数据库(DGS)来测试,光只一层LSTM和一层线性层,模型准确率最高可达91.5%,且每帧处理时间只需3.5毫秒。(详全文)

 

 

  联合学习    模型权重       氧气照护  

Nvidia揭露COVID-19联合学习进展,模型AUC达0.94

Nvidia发起COVID-19联合学习计划EXAM,在不侵犯资料隐私的前提下,跨国联合20家医疗机构,打造一套病情恶化模型,能根据患者状况来预测未来数小时至数天内,是否需要氧气治疗。

Nvidia联手美国权威医院麻省布莱根综合医院,邀集欧、美、亚等全球20个医疗相关机构,包括台湾健保署、台湾大学医学影像与数据人工智能(MeDA)实验室、三军总医院在内,以Nvidia Clara和自家医疗数据如生理数值和胸部X光片等,来训练本地模型,再将模型权重上传至AWS托管的母模型,来优化母模型,而优化过的权重也会开放各医院下载、进行另一轮训练。Nvidia指出,目前该模型的AUC区域已达0.94(目标为1.0),数周后将对外公开模型相关内容。(详全文)

  Nvidia     AI视讯     Maxine  

用AI打造低带宽高分辨率体验,Nvidia推出AI视讯串流平台

Nvidia日前在GTC大会上,推出云端GPU加持的AI视讯会议套件Maxine,只需H.264串流影像标准的十分之一带宽,就能传输影像。这是因为,Maxine不会串流整张画面的像素,而是以AI分析每个会议参与者的脸部关键点,并在云端GPU上执行压缩处理,因此需传输的资料比整个画面少上许多。

此外,Maxine还应用GAN技术,来提供如脸部自动校正、视线校正,以及噪音消除和脸部打光等功能。此外,由于Maxine采用云端原生架构,开发者还能利用Kubernetes的扩展性缩放服务规模。(详全文)

arXiv    程式码    机器学习 

论文网站arXiv提供程式码连结功能,可边读论文边验证

收集各领域论文的网站arXiv联手机器学习论文平台Papers with Code,在网页添加程式码页签,让机器学习论文作者,可提供相关程式码,连结机器学习论文与程式码,方便读者用来验证。

作者可点击论文标题旁的Papers with Code图标,来提供相关程式码。这时页面会切换至Papers with Code,作者加入实作程式码后,arXiv摘要页面即显示相关程式码,方便读者查询存取。(详全文)

物资交流   配对算法     脸书  

缺口罩吗?脸书配对算法强化物资交流

为解决武汉肺炎带来的物资不足问题,脸书以配对算法,连结不认识的使用者,来促进资源交流,像是当使用者在脸书发布需要口罩的贴文,AI就会推荐能提供口罩的邻居,让该使用者认识。

脸书以XLM-R模型来建置配对算法,XLM-R是脸书跨语言理解模型XLM以及RoBERTa的扩展,能够产生相关性分数,配对社群中需要帮助,以及能够提供帮助的使用者。XLM-R能够辨识含义相似的贴文,并且进行配对,即便贴文语意结构不同,XLM-R也能处理。(详全文)

肺水肿     急性心脏病      胸部X光片  

MIT打造肺水肿AI,助医生在黄金时间抢救急性心脏病患

MIT团队开发一套机器学习模型,能从肺部X光片中量化肺水肿严重程度,分为0到3级。团队指出,肺水肿是急性心脏衰竭的常见症状,其严重程度会影响治疗决策。

为解决问题,MIT找来4位放射科医师,在现有的X光片公开影像资料集中,加入严重程度注解。于是,团队以30万张X光片影像,以及放射科医师写下的相对应报告文本来训练模型。不过,这些文本通常只有1至2个句子,且不同医生的描述风格不同、使用广泛术语,因此,为了让系统能够理解报告文本,团队制定一套语言规则和字词替代,以确保能一致分析报告文本。经测试,模型能正确判别50%案例的严重等级,而对于严重程度等级3的案例,90%都能正确预测结果。MIT已与医院合作,将整合至急诊室中。(详全文)

图片来源/Google、Nvidia、arXiv、MIT

 AI趋势近期新闻 

1. 微软更新ONNX Runtime支援行动平台

2. 锁定农业,Alphabet射月专案公开智慧农业AI机器人

3. Google云端服务支援云端原生容器映像档技术Buildpacks

资料来源:iThome整理,2020年10月

 
 
 
 
文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 报价宝 手机价格 汽车价格 笔记本电脑价格 降噪耳机价格