哼唱识别
Parent: ai_keywords
核心定义
哼唱识别(Humming Recognition)是人工智能与音乐信息检索交叉领域的一项任务,旨在从用户无歌词、带噪声的哼唱音频中提取旋律轮廓,并与数据库中的乐曲或预设模板进行匹配,从而识别目标作品或实现人机交互。其本质是 非语音的旋律符号化与序列模式匹配,涉及音频信号处理、时序建模和相似度度量。
关键技术点
- 音高估计与音符分割
采用自相关函数、YIN算法或基于深度学习的CREPE模型,从连续哼唱中提取基频轨迹,并依据半音映射将连续音高离散化为音符序列,同时检测停顿以分割音符边界。 - 旋律特征编码
提取归一化的基频轮廓、音符间相对音程(Interval)和节奏比例,形成对音高偏移与速度变化鲁棒的仿射不变特征。常用Chroma、DTW距离或自注意力机制嵌入。 - 序列匹配与检索
早期使用动态时间规整(DTW)处理哼唱速度与局部抖动;当前主流方法结合卷积循环网络(CRNN)或Transformer,将查询序列映射到高维空间,通过余弦相似度快速检索候选曲库。 - 鲁棒性增强
针对跑调(Key transposition)、节拍不准确、环境噪声等问题,引入数据增强(音高随机平移、时域伸缩)、对抗训练或基于变分自编码器的去噪预处理器。 - 实时流式识别
在移动端或嵌入式设备部署轻量级模型(如MobileNet+少量RNN),通过滑动窗口和递增匹配策略实现边哼唱边反馈的交互体验。
医学/神经科学应用场景:帕金森病声乐运动障碍评估
首都医科大学神经病学系(联合宣武医院运动障碍中心)利用哼唱识别技术,开发 帕金森病(PD)哼唱韵律分析系统。患者根据指令哼唱一段熟悉旋律(如《茉莉花》),系统实时提取其基频微变化、音高变异系数、节奏波动指数及停顿频率。多项指标与UPDRS-III中“语音发声”评分显著相关(r > 0.72, p < 0.01),并能在药物关/开期状态下自动区分运动迟缓与声带震颤的加重模式。该方法无需专业麦克风,仅通过手机即可完成居家远程监测,为PD的运动-非运动症状融合评估提供了低成本、高生态效度的数字生物标志物。