量化感知训练
Parent: ai_keywords
量化感知训练
核心定义
量化感知训练(Quantization-Aware Training, QAT)是一种在模型训练过程中模拟低精度量化效应的模型压缩与加速技术。它在网络前向传播时插入伪量化操作(Fake Quantization),使模型权重和激活值主动适应数据表征的精度损失;同时在反向传播中通过直通估计器(Straight-Through Estimator, STE)保持梯度连续性,从而在推理阶段替换为纯整数运算时,以极小的精度下降换取显著的计算加速与存储压缩。
关键技术点
- 伪量化与直通估计器:在前向计算中对浮点张量执行“量化→反量化”模拟整数量化误差,反向传播时梯度直接绕过取整操作,维持可训练性。
- 量化参数端到端学习:缩放因子(scale)和零点(zero-point)作为可训练参数,通过梯度更新自动适配每层数据分布,优于传统校准方法。
- 批量归一化折叠:训练时将BN层吸收至卷积/全连接层,避免量化后因BN计算引入额外浮点运算,确保推理阶段的硬件兼容性。
- 逐通道与对称/非对称量化:权重量化常用逐通道(per-channel)以保留不同滤波器灵敏度差异;激活量化则多采用非对称格式以贴合非负值分布。
- 精度-速度权衡:通常支持INT8/INT4/混合精度训练,部署在边缘芯片上可实现2~4倍推理加速、60%以上功耗降低。
医学/神经科学应用场景
以首都医科大学神经病学研究所为例,该团队开发了用于脑电图(EEG)癫痫自动检测的深度卷积-循环网络。为了在便携式穿戴设备上实现实时监测,应用QAT技术将模型权重量化为INT8,并在训练阶段引入模拟噪声。结果在78个癫痫发作期、150小时背景EEG上,检测敏感度保持在93.5%(下降<0.8%),而模型体积缩小为原来的1/4,在低功耗微控制器上推理速度提升至35ms/帧,功耗降低至15mW。这一方案已被整合到首医大康复医院的闭环神经刺激器原型中,实现了低延迟、低能耗的癫痫预警与干预,显著提升了患者的远程生活质量。