APP下载
报价宝  ›  综合  › 

Google直接在手机部署机器学习模型,离线也能使用语音输入文字

报价宝 来源:baojiabao.com 发布时间:2019-03-14 10:50:00 09月30日更新
报价宝综合消息Google直接在手机部署机器学习模型,离线也能使用语音输入文字

Google最新的语音辨识技术,能直接在装置上放置机器学习模型,让语音转文字辨识功能离线作业,以解决网络限制造成的服务延迟,而且该语音辨识模型还能依照使用者语音,逐字输入字元,就像是用键盘输入文字的情况一样。

从2014年开始,语音转录文字多使用序列到序列的方法,研究人员开始训练单一神经网络,将输入的音讯波形,直接映射到输出的句子,这种序列到序列的方法,是将给定一系列音讯特征,生成一系列单词或是拼音系统中最小单位字位(Grapheme)。虽然这种模型大幅提升准确性,但是系统必须分析完整个序列后,才能一并输出结果,因此系统无法边听边输出文字,而Google认为这是即时语音转录的必要功能。

Google新的语音辨识技术,采用RNN换能器(Recurrent Neural Network Transducers,RNN-T)训练的模型,这与之前序列对序列的生成模型不同,RNN-T可以连续处理输入的样本,并且串流输出字符,是一个非常适合用于听写的技术。在Google的实作中,模型输出的字符为子母表的字元,RNN-T辨识器会逐个输出字元,并在适当的地方加上空格。Google表示,要有效地训练这样的模型非常困难,但是他们现在可以让单词错误率低于5%。

而且为了提高语音辨识的用处,Google在装置放上新模型,直接在装置上进行语音辨识分析,以避免网络的延迟和不可靠性。传统语音辨识服务的效能,部分取决于使用者装置的网络连线状况,语音辨识服务必须要将使用者的语音或是从中萃取的资料,从手机端传输到服务器进行分析,再将得到的结果送回手机。

Google解释,在传统的语音辨识引擎中,声学(Acoustic)、发音以及语言模型构成了一个巨大的搜寻图,当语音辨识器接受到音讯波形,便会在搜寻图中找出最相似路径,并读出该路径上的字元序列。传统的搜寻图容量非常大,尽管应用了复杂的编码器,生产用模型大小依然接近2GB,而这样的大小无法放在行动装置上,因此必须要依赖连线,靠服务器分析后回传结果。

不过,现在Google的端到端方法不需要在大型的搜寻图上搜寻,Google训练的RNN-T模型只有450MB,就能提供与传统服务器模型相同的精准度,但是即便是450MB,对行动装置来说仍然太过庞大,Google在2016年开发了模型参数量化以及混合核心技术,再加上TensorFlow Lite函式库中的模型最佳化工具,大幅缩减模型容量。

模型参数化拥有比起训练的浮点数模型高4倍的压缩率,执行速度快4倍,Google最终压缩的模型只有80MB,因此可以放在手机上,提供离线语音辨识服务。目前Gboard语音辨识器仅能在Pixel手机上,使用美国英文。

文章标签: 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 手机价格 汽车价格 笔记本电脑价格 华为手机价格 降噪耳机价格