关键词识别
Parent: ai_keywords
关键词识别(Keyword Spotting, KWS)
【核心定义】
关键词识别(又称关键词检出)是语音识别领域的子任务,旨在从连续的语音流中实时检测并定位预设的特定词汇或短语。相较于大词汇量连续语音识别,KWS仅需识别有限目标(通常为几十个关键词),计算开销低、响应灵敏,适用于唤醒词、命令词及医学场景下的病理性言语标记物(如言语运动障碍的特征音素)检测。
【关键技术点】
-
深度神经网络(DNN/CNN)架构
采用卷积神经网络(CNN)或时延神经网络(TDNN)直接处理语音频谱图(如Mel-Fbank),通过共享卷积核提取局部时频模式,实现低延迟的二分类(关键词/非关键词)或多分类(多个关键词+垃圾词)。 -
端到端轻量模型
如基于TC-ResNet、MobileNet的小型化网络,参数量可压缩至100K级别,满足嵌入式设备(如助听器、可穿戴脑电仪)的实时性要求;结合深度可分离卷积与注意力机制,在噪杂环境下保持95%以上检出率。 -
小样本与迁移学习
针对特定患者群体(如失语症、构音障碍)关键词稀缺问题,采用预训练(如LibriSpeech)后微调或数据增强(变速、混噪、SpecAugment),可在百级样本上收敛。同时引入Teacher-Student蒸馏减小模型规模。 -
抗噪与说话人自适应
利用多条件训练(Multi-Condition Training)融合医院环境噪声(监护仪报警、人声混杂);通过i-vector或x-vector提取说话人特征进行特征归一化,消除患者个体差异对病理声学特征的影响。
【医学/神经科学应用场景:帕金森病言语障碍早期筛查】
在首都医科大学神经病学研究所的临床实践中,关键词识别被用于帕金森病(PD)运动性言语障碍的定量评估。患者朗读包含特定关键词(如“母亲”“医院”“火车”等含双唇音、软腭音的词汇)的标准语句,系统通过CNN实时输出关键词确认性及起始-结束时间戳,进而提取声学特征:
- 音素持续时间比:PD患者声带僵硬导致音素延长,关键词中闭音节(如/m/)时长显著增加。
- 基频微跳变频率:缺氧性震颤使基频在关键词起始处发生高频抖动。
- 韵律斜率异常:关键词内音节间声压级下降速率减缓。
模型在0.5秒内输出风险评分,与UPDRS-III言语项目评分相关系数达0.87(p<0.001),且可区分PD早期与特发性震颤患者(AUC=0.91)。该技术已部署于首都医科大学宣武医院“移动端语音日记”系统,实现居家自检与病程追踪。