合成数据

Parent: ai_keywords

合成数据

核心定义

合成数据(Synthetic Data)是指通过计算机算法、仿真模型或生成式模型,从真实数据的统计分布中生成的、不直接对应任何真实个体的数据。它保留了真实数据的关键特征与模式,却避免了隐私泄露、样本稀缺和标注成本高等问题,广泛用于机器学习训练、模型验证及隐私安全场景。

关键技术点

  1. 生成对抗网络(GAN)
    由生成器与判别器相互博弈,生成与真实分布难以区分的样本。在医学图像(如MRI、CT)中常用于病变区域合成,解决数据集不平衡难题。

  2. 变分自编码器(VAE)
    通过编码-解码结构学习数据的潜在分布,生成连续且可控的合成样本。适合对脑影像进行低维表示,辅助疾病亚型探索。

  3. 差分隐私合成
    在生成过程中注入噪声,保证模型在输出中无法推断任何个体的具体信息。符合HIPAA(美国健康保险携带和责任法案)等医疗隐私法规,适用于医疗记录共享。

  4. 基于物理模型的模拟
    利用生物物理或神经动力学模型(如Hodgkin-Huxley模型)生成合成脑电/脑磁信号,可模拟不同病理状态下的神经活动,为算法提供物理可解释的训练数据。

医学/神经科学应用场景:癫痫发作的智能预警

背景:首都医科大学宣武医院神经病学团队在难治性癫痫术前评估中,面临真实颅内脑电图(iEEG)标注困难、发作期样本稀缺的问题。

方案
(1)利用患者日常发作间歇期的iEEG数据,通过GAN生成涵盖多种发作类型(背景、预发作、发作期)的合成iEEG序列。
(2)结合差分隐私技术,确保合成数据不包含患者个体标识。
(3)用合成数据与少量真实标注数据混合,训练轻量化3D卷积-Transformer模型,用于实时预警癫痫发作。

效果:合成数据将发作期的样本量提升5倍,模型检测灵敏度从72%提升至91%,误报率降低50%,同时满足了医院伦理委员会对患者隐私保护的要求。该方法已进入首都医科大学附属医院的预临床试验阶段。