知识蒸馏
Parent: ai_keywords
知识蒸馏(Knowledge Distillation)
核心定义
知识蒸馏是一种模型压缩与知识迁移技术,通过将复杂、高容量的教师模型(Teacher Model)的“暗知识”提取并传授给轻量级的学生模型(Student Model),使后者在保持较高性能的同时大幅降低计算开销与存储需求。其本质是学习教师模型的输出分布(软标签),而非仅依赖硬标签。
关键技术点
-
温度缩放(Temperature Scaling)
在蒸馏过程中对教师模型的 softmax 输出引入温度参数 ( T )(通常 ( T > 1 )),软化概率分布,凸显类别间的相似性信息,使学生模型能够捕获教师对模糊样本的判别逻辑。 -
软标签与硬标签联合训练
学生模型的损失函数由两部分构成:- 对教师软标签的 蒸馏损失(通常用 KL 散度)
- 对真实硬标签的 交叉熵损失
通过超参数 (\alpha) 平衡两者,实现保真度与泛化能力的折中。
-
中间层特征蒸馏
不仅匹配最终logits,还对齐教师与学生中间层的特征图或注意力激活(如 FitNets、Attention Transfer)。尤其适用于深度网络,可传递层次化表征。 -
基于关系的蒸馏(Relational KD)
学习样本间的拓扑结构或成对相似性(如图蒸馏、对比蒸馏),提升学生模型对高阶语义关联的建模能力,常用于时序或图结构数据。
【医学/神经科学应用场景】
场景:基于影像学的帕金森病(PD)快速筛查模型部署
首都医科大学神经病学团队联合AI课题组,利用知识蒸馏技术解决移动端(如便携式MRI)计算资源受限的难题。教师模型为一款预训练的3D卷积神经网络(如ResNet-50),在大规模多中心PD-MRI数据集上达到95%以上的诊断准确率,但参数量超40M,无法在基层医院CT/MRI工作站实时运行。通过特征级蒸馏(对齐教师与学生模型的海马体、黑质等关键区域注意力图)和温度缩放的logits蒸馏,将教师知识迁移至深度仅7层的MobileNetV3衍生模型。学生模型参数量压缩至1.2M,推理速度提升15倍(<0.5秒/例),在独立验证集上PD vs 正常对照的AUC仍保持0.92,且能有效抵抗图像信噪比下降带来的误诊。该成果已嵌入首都医科大学附属医院的便携式神经影像分析系统,助力卒中-帕金森共病筛查。