揭开神秘面纱:深入了解语音识别算法
创始人
2024-08-19 15:41:20
0

如今,似乎每一款商用设备都具备某种形式的语音识别功能,或者至少尝试过实现这一功能。从跨平台的语音助手到转录服务和辅助工具,再到最近成为大型语言模型(LLM)差异化的关键要素——语音输入已成为日常的用户界面。根据预测,语音用户界面(VUI)的市场规模将从2023年至2028年以23.39%的复合年增长率增长,可以预见将有更多的科技公司采用这一技术。

以下从剖析和定义使语音识别成为可能的最常见技术开始。

一、语音识别的机制:它是如何工作的?

特征提取

在进行任何“识别”之前,机器必须将人们产生的声波转换成它们能理解的格式。这个过程称为预处理和特征提取。梅尔频率倒谱系数(MFCC)和感知线性预测(PLP)系数是两种最常见的特征提取技术。

(1)梅尔频率倒谱系数(MFCC)

梅尔频率倒谱系数(MFCC)捕捉音频信号的功率谱,从本质上识别每个声音的独特之处。这项技术首先通过放大高频来平衡信号使其更清晰。然后,信号被分成短帧或声音片段,持续时间在200毫秒到40毫秒之间。然后对这些帧进行分析以了解它们的频率成分。通过应用一系列模拟人耳如何感知音频的滤波器,梅尔频率倒谱系数(MFCC)捕捕捉语音信号的关键、可识别的特征。最后一步是将这些特征转换成声学模型可以使用的数据格式。

(2)感知线性预测(PLP)系数

感知线性预测(PLP)系数旨在尽可能地模拟人类听觉系统的反应。与梅尔频率倒谱系数(MFCC)类似,感知线性预测系数(PLP)过滤声音频率以模拟人耳。在经过过滤之后,动态范围(样本的“响度”范围)被压缩,以反映人们的听觉对不同音量的不同反应。在最后一步,感知线性预测(PLP)估计“频谱包络线”,这是一种捕捉语音信号最基本特征的方法。这个过程提高了语音识别系统的可靠性,特别是在嘈杂的环境中。

(3)声学建模

声学建模是语音识别系统的核心,它形成了语音信号(声音)和语音单位(构成语言的不同声音)之间的统计关系。最广泛使用的技术包括隐马尔可夫模型(HMM)和最近的深度神经网络(DNN)。

(4)隐马尔可夫模型(HMM)

自从20世纪60年代末以来,隐马尔可夫模型(HMM)一直是模式识别工程的基石。它们对语音处理特别有效,因为它们将口语分解成更小、更易于管理的部分——音素。每个提取的音素都与隐马尔可夫模型(HMM)中的一个状态相关联,该模型将计算从一个状态到另一个状态转换的概率。这种概率方法允许系统从声音信号中推断出单词,即使在存在噪声和不同个体的语音差异的情况下也是如此。

(5)深度神经网络(DNN)

近年来,与人工智能和机器学习的发展和兴趣密切相关,深度神经网络(DNN)已经成为自然语言处理(NLP)的首选。与依赖于预定义状态和转换的隐马尔可夫模型(HMM)不同,深度神经网络(DNN)直接从数据中学习。它们由多层相互连接的神经元组成,这些神经元逐步提取数据的高级表示。

通过关注场景以及某些单词和声音之间的关系,深度神经网络可以捕获语音中更复杂的模式。这使得它们在准确性和鲁棒性方面与隐马尔可夫模型(HMM)相比表现得更好,并且需要额外的训练来适应口音、方言和说话风格——这在日益多语言的世界中是一个巨大的优势。

展望未来:挑战与创新

语音识别技术已经取得了很大的进步,但是,正如用户认识到的那样,它还远远不够完美。背景噪音、多人同时讲话、口音以及延迟是尚未解决的挑战。随着工程师们逐渐认识到网络模型的潜力,一个颇具前景的创新是利用隐马尔可夫模型(HMM)和深度神经网络(DNN)的优势,使用混合解决方案。扩大人工智能研究的另一个好处是跨领域的深度学习应用,传统上用于图像分析的卷积神经网络(CNN)在语音处理方面显示出有前景的结果。另一项激动人心的发展是迁移学习的使用,在大数据集上训练的模型可以通过相对较小的配套数据集对特定任务和语言进行微调。这减少了为新应用程序开发高性能语音识别所需的时间和资源,允许采用更环保的方法来重复模型部署。

二、整合一切:现实世界的应用

综上所述,特征提取和声学建模协同工作,形成了所谓的语音识别系统。这个过程从使用预处理和特征识别将声波转换成可管理的数据开始。然后将这些数据点或特征输入声学模型,由声学模型进行解释并将输入转换为文本。从那里,其他应用程序可以很容易地与语音输入进行交互。

从最嘈杂、最耗时的环境(如汽车界面)到个人设备上的无障碍替代方案,人们越来越信任这项技术,并将其用于更关键的功能。对于致力改进这项技术的人来说,理解这些机制不仅仅是学术上的需要,还激励技术人员欣赏这些工具及其在提高无障碍性、可用性和用户体验效率方面的潜力。随着语音用户界面(VUI)越来越与大型语言模型(LLM)相关联,工程师和设计师应该熟悉生成式人工智能在现实世界应用中最常见的界面。

相关内容

热门资讯

祝贺!东莞寮步师生摘得全国青少... 近日,由中国科协、国家自然科学基金委、共青团中央、全国妇联和天津市人民政府共同主办的第38届全国青少...
达能CEO:上海有能力在医疗领... “达能是IBLAC的‘老朋友’,从1993年就开始参加,此后,达能的每个CEO都会来参会。一是因为会...
数据存储2030(2024版) 人类社会的文明史,就是一部信息存储方式和传播方式变革的历史。3500 多年前,甲骨文出现, 标志着人...
华为、小米等卫星手机都受影响!... 快科技9月24日消息,据中国电信官方消息,中国电信卫星公司将于2024年9月27日0时至9月27日6...
紫光展锐二季度智能手机芯片全球... 据紫光展锐官方微信号消息,近日,全球市场研究机构Counterpoint Research发布了20...
2万元的三折叠手机可能与普通人... 文|《港湾商业观察》李镭 三折叠手机时代正式开启,你准备好了吗? 9月20日上午,华为Mate X...
合肥高新“智造”亮相世界制造业... 中新网安徽新闻9月23日电(刘畅 张俊)助力探月任务的卫星、聪明灵活的人形机器人、引发全球关注的量子...
原创 探... 探秘国家电网:热门专业解锁电力未来 国家电网有限公司(State Grid Corporation ...
数智赋能 如意甘肃谱新篇 近年来,中国电信甘肃公司以智能网络、数字科技助力产业转型升级,在科技创新、乡村振兴、绿色发展等领域阔...
从“扫一屋”到“扫天下”——机... 那是2016年的早春,当人们惊讶于引力波的发现、阿尔法狗的超能时,26岁潮汕小伙张峻彬看到的是人形机...
用AI守护绿水青山,构筑森林防... 中国青年网北京9月23日电(记者 纪佳琦)“山泽救于火,草木植成,国之富也”。森林作为陆地生态系统的...
我国创造世界水冷磁体技术新高峰 22日是周日,安徽合肥西郊科学岛上的一个实验室内却十分热闹,轰鸣声从一个巨大的白色罐体传来,身着白大...
反向越级的蔚来也才刚上路 文 | 冯伟冯大白 这两天,朋友给我讲了一个故事,挺有意思,和大家分享一下。 说现在遍地都是智能手...
原创 华... 9月20日10时08分,华为首款三折叠屏手机Mate XT非凡大师正式开卖,作为华为史上最贵的智能手...
21道工序,日产达8万个!探访... (央视财经《天下财经》)如今,快速充电功能已经成为不少国产智能手机的标配,为用户使用带来了便利。一个...
在徐汇,上海两大先导产业正加速... 转自:上观新闻 日前,主题为“智汇科技创新领航”的徐汇区“人工智能+生物医药”专场路演活动在模速空...
平高电气成功研制15千伏真空发... 本报讯 (记者肖艳青)记者从平高电气官微获悉,近日,平高电气自主研发的15千伏/6300安-80千安...
湖南盐业集团数智化赋能传统产业... 人民网长沙9月23日电 近日,湖南盐业集团所属九二盐业“智慧工厂”项目一期工程成功上线运行。这家创建...
原创 南... 思韦茨冰川(Thwaites glacier)是一座位于南极洲西部区域的巨型冰川,其面积大约有19....
XR产业链引领 千年古都探索银... 来源:陕西都市快报 当科技与艺术双向奔赴,会产生怎样的火花?西安,正在“精耕细作”与“聚力爆发”中书...