说话人日志
Parent: ai_keywords
说话人日志(Speaker Diarization)
核心定义
说话人日志是语音信号处理中的**“谁在什么时候说话”任务,旨在将一段多人对话的音频流自动分割并标记为不同说话人的同质片段,同时确定各段对应的说话人身份(通常无先验注册信息)。它不同于说话人识别(识别特定人)或语音识别(识别内容),而是专注于对话结构中的说话人切换与归属**。
关键技术点
-
语音活动检测(VAD)
通过能量、频谱或深度学习模型(如DNN)区分静音、噪声与有效语音,去除无声帧,为后续分割提供干净的语音片段。 -
说话人嵌入提取
利用深度学习(如x-vector、d-vector)将变长语音段映射为固定维度的说话人表征向量,该向量在类内紧凑、类间可分,是聚类的基础。 -
聚类与重分割
对嵌入向量进行无监督聚类(如谱聚类、贝叶斯隐马尔可夫模型),初始得到说话人标签;随后通过维特比解码进行重分割,在时间轴上精细调整边界,兼容语音活动重叠的情况。 -
端到端神经网络方法
替代传统“VAD→嵌入→聚类”级联框架,采用Transformer架构直接预测每个时间帧的说话人身份(如EEND模型),支持动态说话人数目,适合复杂医疗对话场景。
医学/神经科学应用场景
帕金森病语音障碍的远程量化评估
在首都医科大学神经病学临床研究中,医生通过远程视频系统采集患者与家属的日常对话音频。传统分析需人工剪辑患者语音段,耗时长、主观性强。引入说话人日志后,系统自动分离患者与家属的语音流,并提取患者片段的韵律(语速、停顿)、音质(嘶哑度、气息声)、音高变异性等特征参数。例如,帕金森患者常出现单一音调、语速下降和声带闭合不全,这些声学特征经说话人日志精确分割后,可量化为UPDRS言语相关评分的辅助指标。对比单一医生的主观评估,自动化日志分析将筛查效率提升约40%,且支持居家长期监测,为早期诊断与康复疗效追踪提供客观依据。