语音识别 (ASR)

Parent: ai_keywords

语音识别 (ASR) 百科解释

核心定义

自动语音识别(Automatic Speech Recognition,ASR)是一种将人类语音信号转化为文本或机器可执行指令的人工智能技术。其核心在于通过声学建模与语言建模的联合优化,实现从可变长音频序列到符号序列的精准映射。现代 ASR 系统多采用端到端(E2E)架构,融合深度学习(如 Transformer、Conformer)与序列到序列(Seq2Seq)范式,显著提升了鲁棒性与实时性。

关键技术点

  1. 声学特征提取:常用梅尔频率倒谱系数(MFCC)或滤波器组(FBank)将波形转换为时频域表示,保留对语音内容最具判别力的特征,同时去除噪声与说话人差异。
  2. 端到端声学模型:基于 CTC(连接时序分类)、RNN-T(循环神经网络换能器)或注意力机制(Attention),直接学习声学特征与音素/字符的对齐关系,免去传统 HMM-GMM 的复杂工程。
  3. 语言模型:N-gram 或神经网络语言模型(如 Transformer LM)对解码路径进行语义约束,提升同音词(如“方程” vs “防城”)的区分能力。
  4. 语音活动检测(VAD):利用 DNN 分类器或能量阈值实时识别语音片段起始/结束,降低非语音段(静音、噪声)对解码的干扰。
  5. 多任务联合训练:融合说话人识别、情绪识别等辅助任务,提升系统在远场、噪声环境下的泛化能力。

医学/神经科学应用场景

在首都医科大学神经病学研究中,ASR 被用于帕金森病早期声学标志物筛查。通过提取患者朗读任务中的语速、音调变异度、响度衰减等参数,系统可量化“运动性言语障碍”(如构音不全、音调升降困难)。结合深度神经网络对高频特征(如颤音不规则性)的捕捉,ASR 模型在区分帕金森病患者与健康对照时 AUC 可达 0.93,并可通过纵向分析评估药物(如左旋多巴)疗效。此外,针对卒中后失语症,ASR 辅助的自动言语流利度评估(如重复、命名任务的语义错误率)已纳入临床神经心理学量表,极大提升了评估一致性与早期复筛效率。