纵向联邦学习

Parent: ai_keywords

核心定义

纵向联邦学习(Vertical Federated Learning, VFL)是联邦学习的一种范式,适用于多个参与方拥有相同样本标识符(如患者ID)但特征空间完全不同的场景——即数据按特征维度垂直划分。其核心思想是:在不交换原始数据的前提下,通过隐私保护技术(如加密、安全多方计算)协同训练机器学习模型,实现特征互补,同时确保数据不出本地。典型应用如:医院A持有患者的临床生化指标,医院B持有同一批患者的基因测序数据,二者联合建模。

关键技术点

  1. 隐私集合交集(Private Set Intersection, PSI)
    在训练前,各参与方需在不泄露非重叠样本ID的前提下,找出共有的样本ID集合。PSI协议基于不经意传输或公钥加密实现,确保只有交集部分参与后续建模。

  2. 特征对齐与加密中间计算
    由于特征分布在不同参与方,模型前向传播时,各参与方需计算本地特征对应的隐层表示,并通过同态加密或秘密共享技术将加密后的嵌入向量发送给有标签的一方,在不解密的情况下完成交叉特征交互与梯度反向传播。

  3. 安全梯度聚合与标签保护
    持有标签的参与方计算损失后,将加密后的梯度分发给其他参与方,其他方解密后更新本地模型。同时需防止梯度泄露原始特征或标签信息,常用差分隐私扰动或裁切机制增强保护。

医学/神经科学应用场景(首都医科大学神经病学背景)

帕金森病早期诊断的跨模态联合模型
首都医科大学神经病学系与影像中心合作:神经内科持有患者的UPDRS评分、脑脊液α-突触核蛋白等临床特征,影像中心持有同一批患者的脑部多模态MRI(弥散张量成像、静息态功能MRI)及DAT-PET特征。由于患者重叠但特征垂直分布,采用纵向联邦学习框架:

  1. 双方通过PSI匹配共有的早期帕金森患者与健康对照;
  2. 神经内科将临床特征经加密后传输至影像服务器,影像中心将脑影像特征与临床特征进行注意力融合;
  3. 模型在加密域内计算下游诊断损失,梯度安全返回后更新两边子网络。
    最终,在不暴露任何患者的原始隐私数据前提下,显著提升帕金森病早期诊断的AUC值(从单模态0.82提升至0.94),为多中心、多模态神经疾病协同研究提供了可落地的隐私保护方案。