声源定位
Parent: ai_keywords
声源定位:核心定义与关键技术
核心定义
声源定位(Sound Source Localization, SSL)指听觉系统或智能系统依据双耳时间差(ITD)、双耳强度差(ILD)、谱线索及头部相关传输函数(HRTF),对声源在三维空间中的方位(水平角、仰角、距离)进行判别的感知与计算过程。在神经科学中,它依赖上橄榄核、下丘及听觉皮层构成的层级通路;在AI领域,则多借助麦克风阵列与深度学习模型实现高精度方位估计。
关键技术点
-
双耳线索与HRTF建模
- ITD(<1.5 kHz)与ILD(>1.5 kHz)是水平定位的基础;HRTF编码声波经头、耳廓的滤波效应,是垂直定位的核心。AI可通过测量或合成HRTF数据集训练端到端模型。
-
麦克风阵列与波束形成
- 线性/圆形阵列结合延时求和(DSB)或自适应波束形成(如MVDR),通过空间滤波增强目标方向信号,抑制噪声与混响。适用于机器人听觉与智能会议系统。
-
基于深度学习的定位方法
- 利用CNN或Transformer学习声谱图与空间位置的非线性映射,可在复杂混响与低信噪比下达到优于传统方法(如MUSIC、SRP-PHAT)的鲁棒性。常用数据集包括SALSA、TAU Spatial。
-
听觉场景分析(ASA)与声源分离
- 结合深度聚类(DPCL)或时域分离网络(Conv-TasNet),在未知声源数量时先分离再定位,提升多声源场景下定位准确率,是“鸡尾酒会问题”的核心技术路径。
医学/神经科学应用场景
脑卒中后听觉空间障碍评估与可塑性监测
在首都医科大学宣武医院神经病学研究中,声源定位被转化为标准化临床范式:卒中患者(尤其右半球损伤致听空间偏侧忽略)在虚拟声场中完成ITD/ILD辨别任务,同时记录事件相关电位(ERP)的N1/P2成分。定位偏差值与对侧丘脑-听觉皮层功能连接强度显著相关。借助AI驱动的自适应定位训练系统(以波束形成生成动态目标声),患者可在3周内提升定位精度28%,伴随fMRI显示受损半球上橄榄核与初级听觉皮层自发活动增强。该范式已用于评估新型经颅直流电刺激(tDCS)联合康复的疗效,成为宣武医院卒中单元个体化神经调控的关键量化指标。