APP下载

Google释出大规模多语言AI模型基准,可评估模型跨语言的适应能力

消息来源:baojiabao.com 作者: 发布时间:2026-08-15

报价宝综合消息Google释出大规模多语言AI模型基准,可评估模型跨语言的适应能力

Xtreme基准中所支援的多项语言任务

Google发布自然语言处理系统基准测试Xtreme,其提供9项任务,涵盖40种语言12个语系,多语言模型通过对各种语言,与不同等级的语法以及语意推理等任务后,便能依得分评估其效能。Xtreme可以评估人工智能模型跨语言撷取共享知识的能力,而这有助于推动自然语言应用的发展。

自然语言处理主要的挑战,在于要能够建立一个可使用全世界6,900种语言的系统,Google提到,虽然大多数的语言都缺乏资料,并不足以单独训练出够强健的模型,但幸运的是,这其中有不少语言,都共享大量的基础结构,且在词汇上,也有不少来自于同一来源,像是英文的Desk和德文的Tisch,都来自于拉丁文Discus,另外,也有不少语言的语意角色(Semantic Role)相似,像是土耳其语和中文都使用后置介词,描述字词之间的时间和空间关系。

因此,在自然语言处理中,仍有许多方法可以在训练中,利用多语言共享结构,来克服资料稀疏的问题,Google提到,深度学习过去几年的发展,学习通用多语言表示的方法数量已经有所成长,不过,这些方法都还是有所限制,只能处理少量的任务,以及聚焦在相似的语言上。

为了推动多语言学习的研究,Google发布了XTREME,这是一个评估跨语言泛化的大规模多语言多任务基准,XTREME中涵盖许多未被充分研究的语言,目的是要最大程度提高语言多样性,增加现有语言任务覆盖范围以及训练资料的可用性;像是XTREME包含还在印度南部、斯里兰卡和新加坡使用的达罗毗荼语系泰米尔语,以及受非洲地区民众使用的尼日刚果语系中的史瓦希利语和约鲁巴语。

Xtreme中的9项任务,包括了语句分类、结构预测、语句检索和问答等,要使用XTREME评估模型效能,模型必须要使用可促进跨语言学习的多语言文字进行预训练,而Xtreme会利用零样本评估方法,来评估这些模型跨语言的转换效能,也就是要求模型对未曾训练过的语言资料进行预测,计算所有Xtreme任务的综合得分。

Google在Xtreme中进行初步的实验,发现即便是目前最先进的多语言预训练模型,包括mBERT、XLM、XLM-R与M4都表现不佳,即便这些模型都已经使用大量多语言资料进行训练,也能在英文的表现接近人类,但是在其他语言上的表现,效能明显较英文表现低落。

这些模型仍然很难把知识转移到非拉丁语系,这个结果在各模型于部分语音标记任务上的表现可以很清楚看到,mBERT在西班牙零样本评估的准确度达到86.9,但是日语只有49.2;且所有模型都难以在距英语遥远的语言,预测没有在英文训练资料中看过的实体,相较于葡萄牙语和法语的准确度有82.3和80.1,印尼文和史瓦希利语的精确度只有58.0和66.6。

实验结果显示,所有模型在英语和其他语言之间的效能差距仍然非常大,这代表在跨语言转换上,还有很大的研究潜力,Google提到,说英文的人口仅占全世界的15%,但是英文却一直是自然语言处理的重点,他们希望XTREME能够促进多语言迁移学习的发展。

2020-04-15 10:48:00

相关文章