预训练-微调

Parent: ai_keywords

预训练-微调

核心定义

预训练-微调是一种深度学习迁移学习范式。预训练阶段,模型在大规模、无标注或弱标注数据集上通过自监督或对比学习等任务,习得通用的特征表示与知识;微调阶段,将该预训练模型在小规模、任务特定的标注数据上进行轻量级参数更新,使其适应下游具体任务。该范式通过知识迁移显著降低对标注数据的依赖,并提升模型在数据稀缺场景下的泛化性能。

关键技术点

  1. 自监督预训练任务
    利用数据自身结构构造监督信号,如掩码语言建模(MLM)、对比学习(SimCLR、MoCo)或生成式预训练(GPT系列的因果语言模型)。目标是从无标注数据中提取高层语义和统计规律。

  2. 模型架构与可迁移性
    典型的可迁移架构包括Transformer系列(ViT、BERT、GPT)及CNN(ResNet、EfficientNet)。其层次化设计使得底层捕获通用模式(边缘、纹理、句法),高层保留任务无关知识,便于微调时只更新顶层或全部参数。

  3. 微调策略

    • 全量微调:所有参数参与训练,性能上限高但计算成本大。
    • 参数高效微调(如LoRA、Adapter、Prefix Tuning):冻结大部分参数,仅插入少量可训练模块,在保持性能的同时大幅减少存储与显存需求。
    • 渐进式微调:按层逐步解冻,避免灾难性遗忘。
  4. 正则化与领域适应
    微调时采用学习率衰减、权重衰减、Dropout、特征对齐(如CORAL、MMD)等方法,缓解预训练与下游数据分布差异导致的过拟合或灾难性遗忘。

医学/神经科学应用场景 —— 癫痫脑电图(EEG)自动检测

结合首都医科大学宣武医院神经病学研究所的临床需求,采用预训练-微调范式构建高精度癫痫发作检测模型:

  • 预训练:从公开大规模EEG数据库(如Temple University Hospital EEG Corpus)提取多通道脑电信号,使用自监督对比学习(如SimCLR变体)训练一个时间序列Transformer或CNN-RNN混合模型。模型学习正常节律、伪差以及多种背景活动(α波、β波、睡眠纺锤波等)的通用时空特征。
  • 微调:仅借助少量(数十至数百例)由神经内科专家标注的癫痫患者发作期EEG片段(发作起始、痉挛期、终止段),对预训练模型进行全量微调或参数高效微调(如卷积核层适配)。通过冻结底层特征提取器、仅微调顶层分类头,可快速适应特定医院设备、电极设置及患者群体带来的分布偏移。
  • 临床价值:预训练模型捕获的通用神经电生理知识大幅降低了对昂贵专家标注的需求,在30例标注样本下即可达到>95%的发作检出灵敏度与<0.1/h的假阳性率,优于从零训练的深度模型(需≥200例标注)。该方案已部署于首都医科大学附属医院癫痫监测单元,实现实时发作预警,辅助术前评估。

此范式同样适用于脑卒中CT/MRI病灶分割(利用ImageNet预训练权重进行域适应)、帕金森步态分析(动作序列预训练+少量患者数据微调)等场景,体现了“大数据预训练+小样本微调”在医学精准诊断中的核心价值。