APP下载

科大讯飞麦克风阵列技术揭秘

消息来源:baojiabao.com 作者: 发布时间:2024-05-08

报价宝综合消息科大讯飞麦克风阵列技术揭秘

  未来人工智能会像水和电一样无所不在,在“万物互联时代”,语音将成为人机交互的新常态。风吹麦浪,静夜虫鸣。人类能听到的声音大约有40多万种,频率在20至20000赫兹之间。智能终端能听到多少呢?

  在科大讯飞2015年度发布会的现场,3000余人见证了这样的一场人机互动。演示人员在5米开外,用声音操控DingDong,完成了一系列高难度的订票任务,引来台下阵阵惊叹!

  现场那么嘈杂,DingDong却如此“听话”,要让DingDong听懂这么多声音,而且具备远场识别的功能,它必须听的到,而且要听的更加清晰,人类可以带上助听器,机器需要什么呢?

  【麦克风阵列】就充当了助听器这样的角色。这个名词是不是很陌生,放心!下面小编和你唠唠这个【麦克风阵列】。

  麦克风阵列(Microphone Array),从字面上,指的是麦克风的排列。也就是说由一定数目的声学传感器(一般是麦克风)组成,用来对声场的空间特性进行采样并处理的系统。

  早在20世纪70、80年代,麦克风阵列已经被应用于语音信号处理的研究中,进入90年代以来,基于麦克风阵列的语音信号处理算法逐渐成为一个新的研究热点。而到了“声控时代”,这项技术的重要性显得尤为突出。

  麦克风阵列能干什么?

  任何一项技术的发生发展都伴随着问题的提出及解决,麦克风阵列也是如此。那么它主要应用在哪些场景下呢?又有着怎样的功能!

  ◆【噪声环境怎么破?】—— 语音增强(Speech Enhancement)

  语音增强是指当语音信号被各种各样的噪声(包括语音)干扰甚至淹没后,从含噪声的语音信号中提取出纯净语音的过程。所以DingDong在嘈杂环境下,也能准确识别语音指令。

  2013年科大讯飞车载降噪产品和国际竞争对手效果对比

  ◆【说话人老是变幻位置怎么破?】——声源定位(Source Localization)

  现实中,声源的位置是不断变化的,这对于麦克风收音来说,是个障碍。麦克风阵列则可以进行声源定位,声源定位技术是指使用麦克风阵列来计算目标说话人的角度和距离,从而实现对目标说话人的跟踪以及后续的语音定向拾取,是人机交互、音视频会议等领域非常重要的前处理技术。所以麦克风阵列技术不限制说话人的运动,不需要移动位置以改变其接收方向,具有灵活的波束控制、较高的空间分辨率、高的信号增益与较强的抗干扰能力等特点,因而成为智能语音处理系统中捕捉说话人语音的重要手段。

  混响语音信号频谱

  经过去混响后的语音信号频谱

  ◆【说话人太多怎么破?】——声源信号提取(分离)

  家里人说话太多,DingDong听谁的呢。这个时候就需要DingDong聪明的辨别出哪个声音才是指令。而麦克风阵列可以实现声源信号提取,声源信号的提取就是从多个声音信号中提取出目标信号,声源信号分离技术则是将需要将多个混合声音全部提取出来。

  通过麦克风阵列波束形成做语音提取和分离

  利用麦克风阵列做信号的提取和分离主要有以下几种方式:

  1、基于波束形成的方法,即通过向不同方向的声源分别形成拾音波束,并且抑制其他方向的声音,来进行语音提取或分离:

  2、基于传统的盲源信号分离(Blind Source Separation)的方法进行,主要包括主成分分析(Principal Component Analysis,PCA)和基于独立成分分析(Independent Component Analysis,ICA)的方法。

  进击的麦克风阵列

  麦克风阵列技术虽然已经可以达到相当的技术水平,但是总体上还是存在一些问题的,比如当麦克风和信号源距离太远时(比如10m、20m距离),录制信号的信噪比会很低,算法处理难度很大;对于便携设备来说,受设备尺寸以及功耗的限制,麦克风的个数不能太多,阵列尺寸也不能太大。而分布式麦克风阵列技术则是解决当前问题的一个可能途径。所谓分布式阵列就是将子阵元或子阵列布局到更大的范围内,相互之间通过有线或者无线的方式进行数据的交换和共享,并在此基础上进行广义上的声源定位、波束形成等技术实现信号处理。

  相对于目前集中式的麦克风阵列,分布式阵列的优势也是非常明显的。首先分布式麦克风阵列(尤其无线传输)的尺寸的限制就不存在了;另外,阵列的节点可以覆盖很大的面积——总会有一个阵列的节点距离声源很近,录音信噪比大幅度提升,算法处理难度也会降低,总体的信号处理的效果也会有非常显著的提升,因此分布式阵列有可能是未来智能家居和会议系统中的主流方案。目前科大讯飞已经开始了相关技术研究的布局工作。

  在万物互联的今天,麦克风阵列技术已经深刻的走进了我们的日常生活。在智能车载、智能家居、机器人、可穿戴设备等应用热潮正兴起的时代,语音交互由于其便捷性,成了人机交互入口的第一选择,麦克风阵列自然也成为其中非常重要的前端技术。

  DingDong音箱中的麦克风阵列方案

  试想一下,未来,你身边的智能机器人通过声源定位技术找到主人的方位,通过降噪技术滤除环境噪声和混响,你可以自由在任意场景中控制机器人,回声消除技术也可用于消除设备自身播放的声音,从而真正的实现正真意义上的交互!

特别提醒:本网内容转载自其他媒体,目的在于传递更多信息,并不代表本网赞同其观点。其原创性以及文中陈述文字和内容未经本站证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本站不作任何保证或承诺,并请自行核实相关内容。本站不承担此类作品侵权行为的直接责任及连带责任。如若本网有任何内容侵犯您的权益,请及时联系我们,本站将会在24小时内处理完毕。

2019-04-26 05:20:00

相关文章