蒸馏
Parent: ai_keywords
核心定义
蒸馏(特指知识蒸馏,Knowledge Distillation)是一种模型压缩与知识迁移技术,其核心思想是通过“教师-学生”架构,将复杂、高容量的预训练模型(教师网络)所蕴含的暗知识(如类别间相似性、特征表示)高效地转移至轻量级学生模型,使其在保持相近性能的同时大幅降低计算与存储开销。该技术由Hinton等人在2015年系统提出,已成为AI落地边缘设备的关键范式。
关键技术点
-
软标签与温度参数
教师模型生成带有温度(T>1)的Softmax输出,软化概率分布以揭示类别间相对关系(如“猫”与“老虎”的相似性),学生模型通过模仿这些软标签学习更丰富的结构化信息。 -
联合损失函数
学生训练同时优化与教师软标签的蒸馏损失(KL散度)和与真实硬标签的交叉熵损失,通过超参数α平衡两者权重,实现知识保真与任务对齐。 -
特征层蒸馏
不仅传导输出层知识,还通过注意力图、中间特征映射的均方误差(MSE)等机制,让学生模仿教师中间层的潜在表示,增强深层语义理解。 -
自蒸馏与在线蒸馏
自蒸馏中教师与学生共享架构,通过迭代训练增强模型自身泛化;在线蒸馏则允许多个学生模型同步学习并互相指导,进一步提升效率。
医学/神经科学应用场景
基于知识蒸馏的轻量化癫痫棘波检测模型(结合首都医科大学神经病学背景)
在癫痫病灶定位与实时监测中,头皮脑电图(EEG)棘波检测是核心环节。传统方案依赖全卷积神经网络(如3D-CNN+Transformer),模型参数量大(≥50M),无法部署于便携式脑电采集设备。首都医科大学团队利用知识蒸馏技术,将以ResNet-152+Transformer为骨干的教师模型(精度98.7%)的知识,蒸馏至仅含5层深度可分离卷积的学生模型(参数量<1M)。通过引入温度调制后的软标签(模拟不同棘波形态间的模糊边界)及中间层特征对齐损失,学生模型在公开数据集CHB-MIT上的检测准确率达97.3%,推理速度提升15倍,成功植入可穿戴式急性发作预警系统。该模型已在北京天坛医院开展床旁验证,有效减少漏判并支持实时干预。