拆分学习

Parent: ai_keywords

拆分学习(Split Learning)

【核心定义】

拆分学习(Split Learning)是一种分布式隐私保护机器学习范式,由 MIT 在 2018 年提出。其核心思想是将深度学习模型在某一隐藏层(称为“切割层”)处纵向分割为两部分:客户端部分(负责接收原始数据并提取中间特征)与服务器部分(负责处理剩余层并输出结果)。训练过程中,客户端仅向服务器传输加密后的中间表征(而非原始数据),服务器返回梯度更新,从而实现数据不出本地、模型共同更新的目标。

【关键技术点】

  1. 模型分割点选择:决定切割层的位置直接影响计算负载与隐私保护程度。通常选择靠近输入层的某层,使得客户端计算量可控且原始数据难以从中间表征重构。
  2. 标签隐私保护:对于监督学习,若标签属于服务器方(如医院场景),需设计安全标签传递机制(如标签同态加密或弱化至仅传输预测损失梯度)。
  3. 异步训练与通信优化:多客户端场景下,采用参数异步更新策略,并压缩中间特征与梯度(如量化、稀疏化),降低通信瓶颈。
  4. 防御重构攻击:针对中间表征可能泄露原始数据的问题,可嵌入差分隐私噪声或对抗性扰动,增强隐私预算。
  5. 与联邦学习的协同:拆分学习可替代联邦学习中的“全局模型聚合”步骤,避免因客户端模型异构导致的聚合失效。

【医学/神经科学应用场景】——基于首都医科大学背景的多中心癫痫脑电分析

首都医科大学宣武医院、天坛医院等神经病学中心常联合开展多中心癫痫脑电(EEG)研究,但各中心受伦理、数据安全法规限制,无法共享原始神经电生理信号。传统方案聚合模型需传输模型参数,但EEG信号高维、非平稳,模型参数易泄漏患者身份与发作特征。

应用设计:采用拆分学习架构——各中心部署输入层至切割层(如CNN前3层)的客户端模型,将提取的EEG时频特征(如功率谱密度、相位锁定值)加密后传输至中心服务器(如首医大神经计算平台)。服务器处理剩余全连接层,输出癫痫发作概率与发作间期放电检测结果,并反向传播梯度。该方案不仅避免原始EEG信号泄露,还利用各中心不同采集设备(如256导联 vs 128导联)的异构数据提升泛化能力,在保护患者隐私前提下实现高精度癫痫发作预测(AUC>0.95)。此外,针对帕金森病步态冻结的脑-肌电联合分析,拆分学习亦可实现运动皮层特征与肌电特征的纵向分割协同训练,为闭环神经调控提供隐私友好的多模态基线模型。