科技部推出AI语音数据资料集,年底释出2000小时,企业、学校都能免费用

首批开放资料集取自除了自行录制的资料外,也结合警察广播电台、教育广播电台的节目语音资料,经由精准标记后再汇整成高品质数据库公开释出。
摄影/翁芊儒
科技部今日发布“AI语音数据资料集”,在国网中心资料集服务平台(NCHC DATA MARKET),首批开放400小时的语音数据资料,要免费授权企业、学研界使用,也预计在年底前上线至少2000小时的资料集,申请办法则会另行公告于科技部主网站以及脸书粉丝专页。
首批开放的400小时资料集取自“科技大擂台-与AI对话”的试题库,除了自行录制的资料外,也结合内政部警察广播电台、教育部教育广播电台的节目语音资料,经由北科大电子工程系副教授廖元甫与背后学生团队协助精准标记后,再汇整成高品质数据库公开释出。
资料标记过程,则是先用文字辨识器将语音转为逐字稿,再用人工方式多次校正逐字稿内容,接着将语句切断,对齐每一句话出现的时间点,类似上影片字幕的方式校正文字,夹杂英文与台语的部分也会确实标记。廖元甫表示,释出资料集是要让使用者建立更精准的语音转文字模型(ASR),因为资料不够是一大痛点,“至少要4000小时的训练资料,才比较足够做出商用的模型。”
目前释出的语音资料会在国网资料集服务平台上架,免费授权给企业、学研界使用,科技部政务次长许有近表示,要借由语音数据库的释出,来缩短标注训练资料的人力与时间,也降低语音辨识技术发展门槛,目标要加速开发中文语音对话的核心技术;而接下来也会持续释出资料集,预计年底前再释出至少2000小时的资料。
台湾人工智能实验室创办人杜奕瑾在发布会中指出,语音数据库的释出可以让语音辨识更进步,加速人机互动体验的创新应用,虽然语意理解(NLP)目前仍然是很大的挑战,但语音数据库已经可以解决特定领域的问题,例如雅婷逐字稿可以协助用户将语音转译为文字,辨识度约60%,在商用对话的辨识度更可达80%,是目前台湾生产力App下载量第一名。
杜奕瑾也表示,PC时代的人机交互界面是键盘与鼠标,智能手机时代则是触控式屏幕,加入AI后,人机互动也有了人脸辨识、语音辨识、语意理解等创新体验,因此,技术在不断突破与创新的同时,人机互动也会有新的定义与意义。“敏锐的将生活中的各种体验进化,才能敏捷的产生社会需要的东西。”
