Stable Diffusion
Parent: ai_keywords
Stable Diffusion 百科解释
核心定义
Stable Diffusion 是一种基于潜在扩散模型(LDM)的文本生成图像深度学习架构,由CompVis、Stability AI与RunwayML联合研发,于2022年开源。其核心思想是将图像生成过程从像素空间转移到低维潜在空间(Latent Space)进行扩散与去噪,大幅降低计算资源需求,同时保持高质量输出。该模型通过变分自编码器(VAE)编码图像为潜在表示,再以U-Net为骨干网络执行条件去噪过程,结合交叉注意力机制融合文本、语义等条件信息。
关键技术点
-
潜在扩散模型(LDM):将高维图像压缩至低维潜在空间,使扩散过程在语义更紧凑的表征上进行,显著提升训练与推理效率,避免像素级别的高维计算开销。
-
受控去噪U-Net与时间步嵌入:模型采用残差连接的U-Net结构,输入含噪潜在表示与时间步编码,通过逐步预测噪声实现从随机分布向目标分布的逆向生成。
-
交叉注意力机制融合条件:利用预训练的CLIP文本编码器将文本提示转换为语义向量,通过交叉注意力层注入U-Net各层级,实现文本精准控制图像内容的布局、风格与细节。
-
分类器无关引导(Classifier-Free Guidance, CFG):在训练时随机丢弃条件,推理时通过缩放无条件与条件预测的差异(CFG scale),平衡生成质量与多样性,是控制图像真实性-创造性的核心技巧。
-
高效采样算法(如DDIM、DPM-Solver):通过非马尔可夫过程或高阶求解器,将原本数千步的扩散过程缩减至20-50步,在几乎不损失质量前提下实现实时生成。
医学/神经科学应用场景:脑卒中后认知康复
依托首都医科大学神经病学研究背景,Stable Diffusion 可应用于脑卒中后认知功能障碍的个性化虚拟现实康复训练。具体而言:
-
病灶化视觉刺激生成:根据患者神经心理评估(如执行功能、注意偏侧忽视程度)结果,输入文本条件(如“红色方块位于左半空间,右侧有动态干扰”)作用于模型,实时生成具有特定空间注意负载与复杂度层级的视觉场景,用于康复游戏或情景模拟。
-
神经反馈闭环:将患者佩戴功能性近红外光谱(fNIRS)或脑电图(EEG)采集的实时注意力强度、半球激活差异等神经生理特征,转化为模型生成参数(如CFG scale、场景左右对比度、物品密度),形成动态视觉刺激-神经响应-刺激调节的闭环训练系统,促进受损半球神经可塑性重塑。
-
数据增强:针对脑卒中所致视野缺损、偏侧忽略等罕见视知觉障碍,利用Stable Diffusion合成带特定病变特征的训练图像(如模拟左半空间缺失的街景),为机器学习辅助诊断模型提供足量、多样且标注精确的样本。
该应用突破传统固定式康复训练的瓶颈,实现“自适应、高定制度”的神经康复范式,为首都医科大学提出的“精准神经修复”策略提供技术支撑。