目前基于语音的语意辨识是相当广泛的应用,不过唯有大企业才容易从使用者的手上蒐集资讯, Mozilla 本身也有语音与语意辨识相关的计划,但由于体认到语音数据搜集不易,虽曾使用开源资料以及商用语音库,但由于语音与语意辨识需要自然语癌而非朗读型语音,训练的结果效果并不理想,他们推出一个透过众人之力搜集语音数据并作为开源的计划,称为同声计划 Common Voice 。
有兴趣成为语音数据资料提供者的志愿者,可前往同声计划网页:请点此
这项计划目前先从英文数据库建立起,让志愿者念出画面出现的三个句子作为语音数据资料,同时志愿者也可聆听他人录音的状况检视语音品质,最终希望能够搜集一万小时的自然语音内容,而在系统中志愿者更可选择其国家语言形式,希望能透过此方式建立不同国家腔调的语音库,提升未来作为深度学习训练的时,使数据更精确。
不过目前为止搜集约 500 小时、由 13 万人所提供 30 万句内容,离目标的一万小时还相当远,而搜集一万小时语音内容的原因则是因为据 Mozilla 对深度学习的认知,一万小时的内容才足以使自然语言辨识达到良好的效果;一如 Mozilla 计划旨在创造开放的网络环境,同声计划所产生的数据库也将会作为 Public Domain 使用。目前同声计划预计在第二季加入第二种语言,不过目前工作小组还在探讨要加入哪种语言。
而 Mozilla 将会把同声计划的成果用于两项领域,其一是做为 Firefox 语音输入扩充套件 Voice Fill 的培训数据,希望能使这项套件提升辨识率;其二就是结合源自百渡基于 TensorFlow 的自然语意辨识库套件,将这些数据透过此语法在 Mozilla 的系统上进行自然语意的深度学习模型,而产生的模型成果也预计透过开放 API 的方式呈现。
Mozilla 同声计划志工 Irvine表示, Mozilla 在今年四月于台湾就举办过工作坊,探讨如何透过新方式吸引使用者为同声计划贡献语音数据,当时也罕见的吸引到在台湾举办各类工作坊以来最多的设计师,与与会的工程师呈现各半的情形,且当初本来觉得台湾会如欧美一样以游戏作为项目,但台湾开发者的创意却出乎意料,他们多以社群互动的方式作为项目,例如卡拉 OK 等方式,这也是台湾开发者思维有趣的地方。
此外 Irvine 也是倡导网络健康环境的志工,他也介绍了多个 Mozilla 在网络上所提供介绍网络健康环境的影片与内容资源,希望更多人能够了解到目前网络的情况,以及唤起使用者对于网络自由、个人隐私的意识。
有兴趣观看相关议题可到 Mozilla 网络健康专页:请点此






























