AI趋势周报第86期:微软发表文字转语音新成果,只要少数样本就能训练出准确度99.84%的模型

微软发表一款文字转语音AI,利用非监督式学习和总共20分钟长的200个音频样本及其文字档,就能开发出准确度达99.84%的模型。
重点新闻(0524~0530)
微软 语音辨识 非监督式学习
微软发表新文字转语音技术,只要200个样本就能训练出准确度99.84%的模型
微软日前发表一款文字转语音AI,利用非监督式学习和200个音频样本(总共约20分钟长)及其文字档,就能开发出准确度高达99.84%的文字转语音模型。
研究员表示,这项研究的关键在于采用了Transformer类神经网络架构;Transformer的特别之处在于其注意力(Attention),能让每个输出值与每个输入值相连,而且能动态调整权重。另一方面,研究员使用了开源的LJSpeech资料集,随机取其中的200个音频与相应的文字档作为训练资料集,并采用去噪自动编译器来重建受损的音频和文字档。研究员表示,利用这小型语料库打造出的AI,其测试时的表现比另外3个AI基准模型还要好,准确度可达99.84%,尽管生成的语音仍带有些许的机器腔。(详全文)
三星 3D建模 对抗生成网络
不必3D建模,三星的AI可以直接让图像“动”起来
位于莫斯科分部的三星AI中心近日发表一项研究成果,透过自家设计的模型,只需几张脸部表情的影像,就能让静态的人物肖像做出表情或开口说话,而且不必依赖3D建模等传统方法。
在这项研究中,三星团队首先以VoxCeleb2影片资料集来进行元训练,再利用3套类神经网络来打造这个系统,包括负责将帧映射到向量的嵌入式网络、负责将脸部特征映射到合成影片的生成器网络,以及评估生成影像真实性的鉴别器网络。研究员也以玛丽莲梦露、爱因斯坦和蒙娜丽莎等著名人物肖像来实验,因此,现在大家可以看到照片中的玛丽莲梦露或爱因斯坦开口说话了,甚至是在画作中的蒙娜丽莎也有不同的表情,而且研究人员在蒙娜丽莎身上套用了来自3个不同人的模型,创造出3位个性迥异的蒙娜丽莎。(详全文)
视觉模型 脸书 深度学习框架
脸书开源用于视觉和语言模型的深度学习框架
脸书最近开源释出能支援视觉和语言领域的深度学习框架Pythia。Pythia建立于脸书自家的开源框架PyTorch上,其模组化和随插即用的设计,方便研究人员能快速建置、复制和检测AI模型。Pythia框架的功能包括参考工具,能显示之前模型的基准测试结果,并快速评估新模型的效能。
Pythia框架是为视觉和语言任务设计,像是与视觉资料相关的回答问题模型,以及自动为影像产生标题的模型。此外,该框架也支援分散训练和多种资料集,还能自订损失函数、指标、排程和优化器。(详全文)
KCL Nvidia AI医疗
伦敦国王学院联手Nvidia,要打造医疗AI平台来改善英国医疗体系的影像判读流程
伦敦国王学院(KCL)联手Nvidia,要打造一款医疗AI平台,来简化、加速英国国家医疗体系(NHS)专科医生判读医疗影像的流程。该专案为KCL长期计划的一部分,旨在改善NHS心脏科、神经科和肿瘤科等12个领域的临床流程,以及病患照护等层面。
目前,KCL正部署算力为2 petaflops的Nvidia DGX-2超级电脑,来完成该专案的第一阶段,之后将利用Nvidia Clara AI工具套件和第三方类神经网络框架(如NiftyNet),来开发影像判读系统。另一方面,KCL研究员和Nvidia也将与英国数家NHS主要医院合作,来整合技术开发与临床应用,也方便未来快速部署到其他医疗机构。为保障资料隐私,此次专案将采联合学习(Federated Learning,也称为分散式机器学习)来开发算法,让各机构的资料不必向外传输,透过医院内部的资料即可自行开发AI算法。而这些各家开发的模型,除了能精准反映该区域的病患特性,NHS也可整合这些模型,来发展为层面更广的模型。(详全文)
JINS AI店员 机器学习
不怕选错!AI店员帮你挑眼镜
日本平价眼镜连锁品牌JINS日前宣布引进JINS Brain AI智慧判读服务至台湾分店,来帮台湾消费者“挑眼镜”。该服务由日本总部的JINS Brain实验室开发,他们利用半年的时间,让3千位不同年龄的男女店员来看30多万张不同脸型配戴不同框型眼镜的照片,并评断每张照片的配戴适合度,再利用这些资料来训练机器学习模型,开发出一套JINS Brain AI智慧判读系统。
现在,消费者只要对着店内iPad屏幕试戴眼镜,系统中的AI男店员或AI女店员就会在几秒内告知适合度百分比,帮助消费者挑选合适的眼镜。目前,JINS台湾分店已有4家开始提供免费的Brain AI智慧判读服务。(详全文)
MIT RoboRaise 机器人
不需下指令,MIT打造出能与人类合作抬起物体的机器人
麻省理工学院电脑科学暨AI实验室(CSAIL)最近发表能与人类合作抬起物体的机器人,该机器人系统RoboRaise是利用肌电图检查(EMG)感测器,来监控人类的二头肌和三头肌运动,算法会不断侦测人类手臂高度的变动和上下的手势,来调整自身的动作,与人类一同合作抬起物体。
MIT的研究团队使用RoboRaise系统执行一系列的任务,包括捡起物体、组装模拟的飞机零件等。在实验过程中,人类可透过手臂动作(如抬举、伸缩)来控制机器手臂的活动,而机器手臂的活动范围可精准至数英寸;此外,机器人还可正确回应人类70%的手势。研究团队希望,未来在系统中加入更多肌肉或不同类型的感测器,增加机器人的活动自由度,最终目标是要机器人能够完成更复杂的任务。(详全文)
微软 对话机器人 SDK
微软更新对话机器人开发框架SDK,提供适应性对话框灵活解决问答
微软更新了其用于建立文字对话机器人的开发工具Bot Framework SDK,帮助企业建立能确实解决用户问题的机器人与虚拟助理,提升客服体验。Bot Framework SDK加入了适应性对话框,能让开发者根据情境和事件,来动态更新对话流程。开发者可自定义行动(Action),而行动可包含一系列的步骤,这些步骤是由对话中发生的事件结果定义;这样的设计对于切换或中断对话内容时,格外好用。
Bot Framework SDK还提供了模组化对话功能,微软称之为技能(Skill)。开发者可将拼凑不同技能,来形成完整的对话体验,而技能包括了跨应用程序的语言模型、对话框以及卡片,目前预览版本的技能则有电子邮件、日历和兴趣点。中央对话机器人可以由企业各团队维护的子机器人组合而成。(详全文)
耐能 AI芯片 CNN
耐能新款低功耗AI芯片KL520能支援多种CNN模型,今年第四季出货抢攻边缘运算市场
耐能(Kneron)日前推出一款AI芯片“KL520”,主打低功耗、高效能,结合自家研发的可重组式AI神经网络技术(RANN)与模型压缩技术,并搭载自家设计的神经网络处理器(NPU),来支援多种机器学习框架与CNN模型。耐能研发的RANN,可以根据不同CNN模型的运算结构进行重组,来减少运算复杂度、提高效能。另一方面,KL520可支援主流框架和第三方算法,比如TensorFlow、Keras、Caffe,也支援运用上述框架所开发的CNN模型,如ResNet、Yolo、MobileNet等,也能客制化支援少见的模型。
KL520还具模型压缩技术,透过迁移式学习、量化、剪枝、蒸馏等四种方式,在模型精度的损失小于0.5%的情况下,将模型中较不影响表现的小网络拿掉,来压缩模型。Kneron目前已落地应用于手机、IoT、家居、安防等场景,预计今年Q4放量出货。(详全文)
摄影/翁芊儒 图片来源/三星、JINS、MIT
AI趋势近期新闻
1. 美国空军和MIT推出AI加速器计划,聚焦于国家级安全挑战
2. Google打造肺癌预测模型,表现超越人类放射科医师
3. 为突破AI能力限制,脸书要教机器人在真实世界中自主学习
4. IBM要让Watson协助农夫导入智慧农业
资料来源:iThome整理,2019年5月
