VoxCeleb
Parent: ai_keywords
核心定义
VoxCeleb 是目前规模最大、应用最广的多模态视听说话人识别数据集,由牛津大学视觉几何组(VGG)构建。其数据源自 YouTube 上 1,200 余位名人的采访视频,涵盖超过 10 万条话语片段,每条同时提供语音(16 kHz 单声道) 与面部视频(25 fps,含动态口唇区域)。该数据集以自然、嘈杂(背景噪声、语速变化、拍摄角度多样)为特点,旨在推动真实场景下的说话人识别、视听同步学习及多模态人工智能研究。
关键技术点
-
大规模自动标注与噪声鲁棒性
通过自动人脸追踪与语音活动检测(VAD)从视频流中切分说话片段,无需人工转录,但保留了环境噪声、重叠说话等挑战,迫使模型学习对声学噪声和视觉遮挡具有不变性的特征。 -
深度说话人嵌入(Speaker Embedding)
基于 VoxCeleb,VGGVox、ResNet-34 等网络采用 三元组损失(Triplet Loss) 或 软性近邻损失(Soft Nearest Neighbor Loss) 训练,将任意长度的语音/视频映射到固定维度向量(嵌入),使得同一说话人向量距离小于不同说话人。 -
跨模态关联学习
利用音视频的天然时间同步性,设计视听一致性模型(如 SyncNet、AV-HuBERT)对齐口唇运动与声学信号,提升在低信噪比环境下说话人识别准确率,并为唇读、语音分离提供监督信号。 -
域泛化与数据增强
针对现实医疗场景的声学变异(如电话信道、室内混响),VoxCeleb 衍生版本(VoxCeleb2)引入多任务学习和声学模拟器(如 MUSAN 噪声、RIR 混响)增强模型泛化能力。
【医学/神经科学应用场景】
帕金森病的多模态早期筛查(结合首都医科大学神经病学研究背景)
帕金森病患者早期常出现构音障碍(声学特征:基频变异增大、发声不稳、响度减小)和面具脸(面部运动减少)。利用 VoxCeleb 预训练的视听编码器,可对患者访谈视频同时提取:
- 声学特征:通过微调说话人嵌入网络,提取共振峰偏移、谐噪比(HNR)等病理参数;
- 视觉特征:利用面部关键点检测动态分析口唇运动幅度、眼轮匝肌收缩频率。
将双模态特征融合后输入轻量级分类器(如 SVM),可在临床量表评分前实现敏感度 > 90% 的早期预警。该范式同样适用于脑卒中后失语症评估——通过视听联合分析语言流畅性与口面失用程度,辅助神经康复分型。