模型压缩
Parent: ai_keywords
模型压缩
核心定义
模型压缩(Model Compression)指在保持模型性能(如准确率、灵敏度)损失可控的前提下,通过剪枝、量化、知识蒸馏、低秩分解等手段,系统性地减少深度学习模型的参数量、计算复杂度(FLOPs)及存储占用。其核心目标是使大规模神经网络(如ResNet、Transformer)适配资源受限的部署环境(移动端、嵌入式设备、可穿戴传感器),在实时性、功耗与精度之间取得最优平衡。
关键技术点
-
网络剪枝
剔除冗余连接或神经元通道。分为非结构化剪枝(移除单个权重)与结构化剪枝(移除整个滤波器或卷积核)。后者更利于硬件加速。 -
量化
将模型权重与激活从浮点数(如FP32)映射至低位宽(INT8、甚至二值化)。可大幅降低内存带宽需求,并利用整数运算加速推理。 -
知识蒸馏
利用大型教师网络(Teacher)的软标签(Soft Label)指导小型学生网络(Student)训练。学生在保持轻量同时,可逼近教师性能。 -
低秩分解
将高维权重矩阵分解为低秩子矩阵的乘积(如SVD、CP分解),减少参数量,尤其适用于全连接层和卷积核。 -
轻量级网络设计
从架构层面优化,如深度可分离卷积(MobileNet)、分组卷积(ShuffleNet),直接压缩计算瓶颈。
医学/神经科学应用场景:脑卒中后上肢运动功能评估的边缘AI系统
在首都医科大学神经病学研究中,团队开发基于表面肌电(sEMG)的卒中后手部运动意图识别模型,该模型需部署于便携式可穿戴设备(如腕带、手套)上,实现实时震颤分析与康复指导。原始采用的ResNet-18+sEMG双流网络参数量达12M,在STM32微控制器上推理延迟超过300ms,无法满足临床实时性要求(<50ms)。
通过结构化剪枝移除冗余卷积核(压缩率70%),结合INT8量化将权重从FP32降至8位,最终模型仅0.8M参数量,功耗降至15mW,推理延迟降至28ms,同时F1-score仍保持在0.91(原始0.93)。该压缩方案使患者可在居家环境下,利用边缘端实时监测患侧手功能恢复趋势,为远程康复管理提供低延迟、高保真的临床决策支持。