自回归图像生成

Parent: ai_keywords

核心定义

自回归图像生成是一类基于概率链式法则的生成式方法。它将图像视为一个有序序列(如像素、图像块或离散视觉token),通过逐元素地预测下一个元素的条件概率,逐步构造出完整图像。其核心在于序列化建模,将二维视觉信息转化为一阶马尔可夫链,利用自回归模型(如PixelRNN、GPT-VQ)捕获长程依赖关系。与扩散模型或GAN不同,自回归生成天然支持细粒度控制,但推理速度受限于序列长度。

关键技术点

  1. 序列化表示:需将图像转化为有序序列。常见做法包括:像素级顺序(如PixelCNN按行扫描)、图像块序列(如ViT划分patch)或VQ-VAE将图像编码为离散代码本索引,再按空间顺序排列。
  2. 因果掩码与注意力:为防止未来信息泄露,采用因果掩码(如Transformer中的上三角掩码),使每个位置的预测仅依赖前序元素,确保生成过程的渐进性。
  3. 条件生成与引导:通过注入类别标签、文字描述或低分辨率图像作为条件,使模型在生成序列时可控。例如,输入病理描述生成对应MRI图像局部异常。
  4. 稀疏化与缩放策略:为应对高分辨率图像序列过长的问题,采用分层自回归(如DALL-E先以粗网格生成,再局部补全)或混合架构(结合扩散模型,仅在语义层使用自回归)。
  5. 与生成式预训练的结合:借鉴大规模语言模型范式,在图像领域训练数百亿参数的自回归模型(如Llama-Groot),实现少样本、零样本的图像补全与生成。

医学/神经科学应用场景

场景:阿尔茨海默病(AD)的脑部MRI早期病变重建与病程模拟
首都医科大学神经病学研究所可利用VQ-VAE+自回归模型,从患者稀疏扫描(如仅采集4个断层)或受损MRI数据中,逐像素生成完整的高分辨率T1加权像。具体实现:将大脑ROI区域分割为512×512的网格,自回归模型以海马体、颞叶等关键结构的前序像素为上下文,预测后续像素的灰度值,精准填补灰质萎缩、脑室扩大的细节。该技术可弥补临床扫描因运动伪影或缩短扫描时间导致的信息缺失,辅助医生在认知量表正常前识别早期AD病理改变。同时,通过条件控制病变严重程度因子,模型能逐帧生成从轻度认知障碍到重度痴呆的序列化脑萎缩演进图,支持药物疗效的虚拟对照评估。