潜在扩散模型

Parent: ai_keywords

潜在扩散模型(Latent Diffusion Model, LDM)

核心定义

潜在扩散模型是一类基于变分自编码器(VAE)与扩散概率模型融合的生成式架构。其核心创新在于将图像生成过程从高维像素空间转移到由预训练编码器压缩得到的低维潜在空间中执行前向扩散与反向去噪,从而在保持生成质量的同时大幅降低计算开销,成为文本到图像、图像修复等任务的基础范式。

关键技术点

  1. 潜在空间压缩
    利用 VQ-VAE 或 KL-VAE 将图像编码为紧凑的潜在表示,去除冗余的空间频率信息,使后续扩散过程仅需处理维度减小 8-16 倍的隐变量,有效规避像素级扩散的高昂内存与时间成本。

  2. 扩散与去噪过程
    前向阶段逐步向潜在表示添加高斯噪声,直至其接近纯噪声分布;反向阶段则通过一个训练好的噪声预测网络(通常为 U-Net)估计噪声并逐步恢复原始潜在特征,最终经解码器重建为图像。

  3. 条件控制机制
    通过交叉注意力层将文本、语义标签或边缘图等条件嵌入 U-Net,使生成过程受控于外部提示。例如 CLIP 文本编码器将自然语言映射为特征向量,指导模型生成与描述一致的视觉内容。

  4. 高效采样与加速
    借助潜在空间的低维度特性,LDM 可使用更少的扩散步数(如 50 步而非 1000 步)完成采样,并可配合 DDIM 或 LCM 等加速策略,在 1-2 秒内生成高分辨率图像。

医学/神经科学应用场景(结合首都医科大学神经病学研究背景)

应用:多模态脑卒中 MRI 病灶合成与数据增强
假设首都医科大学神经病学科需基于少量标注影像训练自动分割模型(如识别急性缺血性卒中核心区域),真实样本不足且罕见病变类型缺乏。采用 LDM 模型:

  • 将 T1、FLAIR 等 MRI 序列通过 VAE 编码至潜在空间,以病灶轮廓掩膜(或自然语言描述,如“左侧基底节区梗死”)作为条件输入。
  • 在潜在空间中执行扩散与去噪,生成多样化的高保真合成病灶影像,分辨率达 256×256×24 体素,保持解剖结构合理性。
  • 该数据增强策略可使分割模型的 Dice 系数提升 8-12%,尤其对不典型梗死和放射学沉默区域的识别能力显著改善,为临床早期诊断与溶栓治疗决策提供更稳健的 AI 辅助支持。