APP下载

AI趋势周报第134期:Transformer也能用来解电脑视觉任务!脸书发表DETR模型

消息来源:baojiabao.com 作者: 发布时间:2026-09-01

报价宝综合消息AI趋势周报第134期:Transformer也能用来解电脑视觉任务!脸书发表DETR模型

脸书将Transformer用来解决电脑视觉任务,发表一套模型DETR。DETR由一系列全局损失(Global loss)组成,可进行独特的预测,比如给定小部分的已知物件查询,DETR可推导出物件与整体影像的关系,可直接平行输出最终的预测结果。

重点新闻(0530~0604)

脸书    Transformer     电脑视觉  

脸书发表DETR模型,用Transformer架构来解电脑视觉任务

Transformer是一款新兴深度学习模型架构,在序列性任务的表现特别好,常用于自然语言处理(NLP)、语音辨识、增强式学习等领域。而脸书最近发表的影像辨识模型DETR,特别把Transformer架构用来解决电脑视觉任务。

DETR可进行侦测物件和全景影像分割任务,但结构与先前的电脑视觉模型截然不同。DETR由一系列全局损失(Global loss)组成,可进行独特的预测,比如给定小部分的已知物件查询,DETR可推导出物件与整体影像的关系,可直接平行输出最终的预测结果。

脸书解释,DETR简化了影像辨识的工作流程,省去不少须手动设定的作业,也不需要特殊的函式库。经COCO影像资料集测试,DETR达到高阶方法(如Faster R-CNN)的预测水准,不过对小型物件侦测仍不够准确,这也是团队未来的研究方向。(详全文)

  DeepMind     BERT    偏差  

DeepMind:句法偏差让BERT更上层楼

自Google前年发布大型自然语言预训练模型BERT以来,就成为自然语言处理(NLP)的标竿,即使不了解阶级句法结构,也能很好地判断文法和句法。不过,DeepMind和加州大学柏克莱分校的研究员联手研究,发现句法上的偏差,可提高BERT的准确度。

进一步来说,团队采知识蒸馏(KD)方法,透过提取(Distill)语言模型的句法预测,来把句法偏差嵌入BERT预训练。为了顺利做到这一点,团队先建立了新的预训练设置,可直接提取KD中递回归类神经网络文法(RNNG)的单字边际分布,同时也保持BERT的扩展性。后来,团队利用6个结构预测任务,来测试改良的BERT,表现都比原本的BERT要好,错误率可下降2至21%。(详全文)

  OpenAI     自然语言模型    GPT-3  

OpenAI释出1,750亿个参数的超大型自然语言模型

30多位OpenAI研究员日前联手发表最新研究,也就是一套超大自然语言模型GPT-3,拥有1,750亿个参数,而且在一系列的基准测试任务中,比如翻译、新闻生成、回答SAT问题等领域,都达到高阶等级(SOTA)。

OpenAI曾在去年发表GPT-3的前身GPT-2,参数最多也才15亿个。这次发布的GPT-3模型,利用近上兆个单字的CommonCrawl资料集和网络文件、维基百科等相关资料,采非监督式方法训练而成。团队指出,GPT-3处理任务时,完全不须任何微调或梯度更新,只需要少量与模型交互的文字示例(Demonstration)即可。在NLP测试中,团队指出,GPT-3在单样本学习和少样本学习中表现优异,但对常识推理、句子比较等任务则稍弱。(详全文)

  百度   量子机器学习       Paddle Quantum  

百度开源量子机器学习平台Paddle Quantum

百度日前在自家深度学习开发者大会上,宣布释出量子机器学习平台Paddle Quantum,要来加速资料科学家利用量子运算来训练和开发AI的时间。这款平台建置于自家深度学习平台PaddlePaddle上,支援三种量子应用:量子机器学习、量子化学模拟,还有量子组合优化;开发者可以利用这些工具从头打造量子模型。

百度指出,Paddle Quantum具通用性和扩展性,因为它支援了量子电路模型的变量定义和矩阵乘法,还有一般的量子计算研究。此外,Paddle Quantum还提供一系列量子机器学习模型,为复杂的运算如Gibbs state preparation打下基础。(详全文)

  Google     联合分析    个资隐私  

不拿走任何资料!Google发表联合分析技术,兼顾隐私和服务品质

Google利用联合学习(FL)基础,发展一套联合分析(Federated Analytics)技术,可用来改善Google自家键盘Gboard和音乐辨识应用的准确度。Google表示,这项技术最大的优点,就是让使用者的资料留在装置上,同时工程师也能获取汇总的资料,来改善服务。

联合分析原本用来支援联合学习,让模型品质评估也能在用户手机上进行。举例来说,Gboard工程师可用来评估单词预测模型的品质,在本地端计算该模型的预测和实际输入单词间的差异,并上传比对结果,透过多个使用者手机上传的指标,工程师就能了解模型的效能。(详全文)

Cloud 超级电脑    台湾AI云    科技部  

自动评估更准确,Google最新NLG自动化指标BLEURT上线

现有NLG自动评估指标只评估表面相似度,Google开发一套可自动衡量句子间语意相似性的指标BLEURT,能达到接近人类注释的准确性,准确度还比常用的自动指标BLEU高48%。

BLEURT是一个以机器学习为基础的自动指标,能捕捉句子间语意的相似性。在开发时,Google采迁移学习来解决训练资料不足的问题,透过BERT的上下文单词表示法来辅助,以及其他预训练方法,来提高BLEURT强健性。后来,Google也对BLEURT进行基准测试,在机器翻译和资料生成文字等任务都超越现有的方法,比应用WMT Metrics Shared Task的BLEU,人工评估分数还要高48%。(详全文)

微软    Azure Cosmos DB     吞吐量  

微软Azure Cosmos DB可自动配置预设吞吐量,用户不必再紧盯流量

微软更新自家云端NoSQL数据库服务Azure Cosmos DB,除了强化和分析服务Azure Synapse的整合,还能自动缩放配置的吞吐量,用户还可使用自己的金钥对静态资料加密。

首先,微软释出Azure Synapse Link功能预览,锁定混合交易和分析处理,可让Azure Synapse存取Cosmos DB,以获取接近即时的分析结果。另一方面,Cosmos DB也将之前预览的自动模式更名为自动缩放预配置吞吐量,并正式释出,借由自动缩放功能,可以在维护SLA的同时,自动快速扩展以满足突如其来的流量峰值,让用户不用监控流量。(详全文)

大规模预训练模型     电脑视觉      BiT  

Google开源大规模预训练电脑视觉模型BiT

Google发布一款电脑视觉预训练模型BiT,透过大规模预训练,可快速运用其他资料集,来解决电脑视觉任务,而且实验显示,这款模型可获得极佳的Top-5精确度。

首先,Google利用自然语言预训练模型BERT的方法,来调整预训练的BiT模型。为微调超参数,Google运用了启发式超参数调校方法BiT-HyperRule,并利用图像辨识率和标签范例数量等高层级的资料特征,调整参数配置。在实验上,Google利用ILSVRC-2012训练和微调的模型,Top-5精确度可达到80%,比之前最好的成果还要高25%。(详全文)

图片来源/脸书、OpenAI、微软、Google

 AI趋势近期新闻 

1. 明年Google搜寻将把网页经验纳入排序依据

2. 运算效能提升20倍,Nvidia新款资料中心等级GPU上阵

3. OpenAI联手Uber,打造最新搜寻方法Virtual Petri Dish,帮开发者挑选最佳模型

资料来源:iThome整理,2020年6月

 
 
 
 
2020-06-04 12:14:00

相关文章