APP下载
报价宝  ›  综合  › 

Google发布用于自动语音辨识的资料增强新方法

报价宝 来源:baojiabao.com 发布时间:2019-04-23 12:17:00 09月30日更新
报价宝综合消息Google发布用于自动语音辨识的资料增强新方法
图片来源: 

Google

Google AI研究团队发布用于自动语音辨识的资料增强新方法SpecAugment,该新方法是将语音资料增强视为视觉的问题,而不是语音的问题,因此,Google并不用传统资料增强的方式,针对语音音波输入资料增强,SpecAugment是直接对声学音谱图(spectrogram)输入资料进行增强,Google指出,这个方法是个简单又便宜的方法,此外,也不需要额外的资料,同时还能有效地改善自动语音辨识模型的效能。

自动语音辨识是将语音输入转为文字的过程,也因为深度神经网络的进展,语音辨识技术应用在许多现代设备和产品中,像是Google语音助理、Google Home智慧音响和YouTube,但是在开发以深度学习为基础的语音辨识系统时,还是有许多重要的挑战要解决,其中一项含有很多参数的语音辨识模型挑战,就是会有训练资料过度学习(overfit)的问题,若训练资料集不够广泛,模型很难处理未识别过的资料。

在缺乏足够训练样本的情况下,可以透过资料增强的方法,来增加有效训练资料,这个方法有助于大幅提升图像分类领域的深度网络表现,一般来说,在语音辨识的案例中,资料增强的方式是靠着改变声音音波,像是加快、减缓语音速度,或是加入背景噪音,来使得资料集有效地变大,让神经网络模型学习更多相关特征,来帮助模型变得更稳固、准确,不过,现有增强语音资料的传统方法会带来更多的运算成本,有时候还需要更多额外的资料。

传统的自动语音辨识模型,在将资料输入网络模型之前,通常会将音波编译为视觉的代表值,像是声学音谱图,而训练资料增强工作通常是在音波转换为音谱图之前,但是,Google团队是直接针对音谱图的资料进行增强,并不是用音波资料,且因为SpecAugment方法是直接针对模型输入资料的特征进行增强,因此,可以在训练的过程中在线上执行,并不会显著地影响训练速度。

SpecAugment是在时间方向上,利用改变音谱图的方式来修改、屏蔽连续频率通道的区块和时间内的语句区块,这些增强工作能够帮神经网络模型,在时间方向上的分解、部分频率资讯遗失和小片段语音输入的遗失等过程,变得更加稳固。

为了测试SpecAugment方法,Google用语音资料集LibriSpeech来进行一些实验,再透过语音辨识评估标准Word Error Rate(WER),比对模型生成的文字与目标文字的差异,实验执行的过程中,Google将所有的超参数固定,只有改变输入网络模型的资料,结果显示SpecAugment方法能够改善网络的效能,且不需要额外调整模型或是训练参数。

更重要的是,SpecAugment能够防止模型因为给予模型特定训练资料,而产生过度学习的问题,此外,用SpecAugment方法训练出来的模型,意外地超越先前所有方法的结果,甚至不需要语言模型的协助,语言模型在改善自动语音辨识网络中,扮演重要的角色,但是通常语言模型和自动语音辨识模型是分开训练的,且语言模型因为需要大量内存,很难应用在小的装置中,像是手机,因此,该研究结果能够实际运用在训练模型中,并且不需要语言模型的协助。

文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 数码相机价格 汽车价格 笔记本电脑价格 华为手机价格 降噪耳机价格