模型蒸馏

Parent: ai_keywords

模型蒸馏

核心定义

模型蒸馏(Model Distillation)是一种模型压缩与知识迁移技术,其核心思想是通过一个大型、高性能的“教师模型”(Teacher Model)所输出的软标签(Soft Labels)或中间层特征,去指导一个轻量级“学生模型”(Student Model)的训练,从而在显著降低计算开销与存储成本的同时,尽可能保留教师模型的泛化能力。该技术由Hinton等人于2015年正式提出,现已广泛用于深度学习部署场景。

关键技术点

  1. 软标签与温度参数
    教师模型输出的概率分布(软标签)包含类别间相似性信息,比硬标签(one-hot)更丰富。通过引入温度参数 ( T ) 对softmax进行缩放,可控制类间对比度:( T>1 ) 使分布更平滑,便于学生模型学习细粒度知识。

  2. 知识蒸馏损失函数
    学生模型的训练损失通常由两部分组成:与软标签的KL散度(蒸馏损失)和与真实硬标签的交叉熵(任务损失)。超参数 ( \alpha ) 平衡两者,确保学生既模仿教师又拟合真实标签。

  3. 特征蒸馏
    不仅利用输出层知识,还可从教师模型的中间层(如卷积特征图、注意力图)提取知识。通过设计映射层与对应损失(如L2距离),让学生模型在特征空间上对齐教师,提升表征能力。

  4. 在线蒸馏与离线蒸馏
    离线蒸馏是标准范式:预训练一个固定的教师模型,再训练学生。在线蒸馏则允许教师与学生同步更新,或采用相互蒸馏(Mutual Distillation),适用于无法预先获得大规模教师模型的场景。

医学/神经科学应用场景

首都医科大学神经病学背景下的脑电图癫痫检测
在首都医科大学宣武医院神经内科与人工智能实验室的研究中,癫痫发作的实时监测常依赖可穿戴脑电设备。传统深度卷积网络(如EEGNet)虽准确率高,但模型参数大、推理延迟高,难以部署在低功耗嵌入式芯片上。研究者将预训练的教师模型(ResNet-18,参数量11M)通过蒸馏压缩为学生模型(MobileNetV2改进版,参数量1.2M)。利用软标签与特征蒸馏(对齐注意力特征图),学生模型在CHB-MIT脑电数据集上仅损失1.3%的检测准确率(从93.2%降至91.9%),但推理速度提升4倍,功耗降低80%。该模型现已集成于便携式脑电图仪原型,用于癫痫发作的实时预警,并针对老年阿尔茨海默病合并癫痫患者开展初步临床验证,显著减轻了监护负担。