Google音频生成系统WaveNet,能用AI模仿男声、女声或乐曲
报价宝综合消息Google音频生成系统WaveNet,能用AI模仿男声、女声或乐曲

图片来源:
DeepMind
Google旗下的人工智能公司DeepMind日前释出原始音频生成模型WaveNet的相关论文,WaveNet是一套采用神经网络技术来模拟真人声音的系统。DeepMind声称,WaveNet模拟的真人语音比现在的文字转语音系统(Text-To-Speech)还要自然,且更加接近真人的声音。
过去的文字转语音技术使用大量的简短语音片段与单词发音的规则资料,来训练电脑产生语音资讯的系统,并重新形成完整的语音语句。
而WaveNet则是直接一次产生一个原始音频讯号的波形,能够学习多种声音的特色,包含女人、男人,甚至音乐的音讯,也能学习人类说话时的呼吸和嘴唇动作,甚至能加入情感或口音,来增加语音的多样性。
WaveNet可以产生更多的自然音讯,也能模拟更多种类的音频,也就是说,使用英语语音的资料训练WaveNet系统,就会产生英语语音,用中文语音资料则会产生中文语音,而用古典钢琴音乐的资料集来训练WaveNet系统,系统就会产生古典钢琴音乐。
根据DeepMind,WaveNet制作原始音频的模型,通常需要处理每秒至少1万6千个以上的样本音讯,且这种方式是建立真实语音资讯的必备条件。另外,DeepMind也在官网释出部分的WaveNet语音档案范本。
