Flamingo

Parent: ai_keywords

Flamingo 百科解释:人工智能与神经科学交叉视角

【核心定义】

Flamingo 是 DeepMind 于 2022 年提出的多模态视觉语言模型(Vision-Language Model, VLM),其核心创新在于通过门控交叉注意力机制将预训练的视觉编码器(如 NFNet)与冻结的大型语言模型(如 Chinchilla)高效连接,从而在仅使用少量任务示例的情况下实现跨模态推理。该模型支持图像、视频与文本任意交织的输入,展现出强大的少样本视觉问答图像描述能力,是通用人工智能中多模态理解的重要里程碑。

【关键技术点】

  1. 门控交叉注意力(Gated Cross-Attention)
    通过在语言模型各层插入可学习的交叉注意力模块,并用门控机制调控视觉信息的注入,使得预训练的语言模型能“看见”图像,同时避免灾难性遗忘。

  2. 预训练组件冻结策略
    视觉编码器与语言模型的主干参数在训练中保持冻结,仅更新交叉注意力层和输入/输出嵌入,大幅降低计算开销并保留原始模型的泛化能力。

  3. 多分辨率视觉编码
    采用“感知重采样器”(Perceiver Resampler)将不定数量的图像块压缩为固定数量的视觉token,支持任意分辨率与任意图像数量的输入。

  4. 少样本上下文学习
    无需微调,仅需在提示中提供少量图文示例(如“这张图中有一个病灶,诊断是脑卒中”),即可零样本泛化至未见任务,十分契合医疗场景的数据稀疏性。

【医学/神经科学应用场景】

场景:癫痫病灶定位中的脑电图-文本多模态辅助分析
在首都医科大学宣武医院神经内科的脑电图中,癫痫发作期的异常放电(如棘波、尖波)常具有特征性波形。传统诊断依赖神经电生理专家的目视判读,耗时且存在主观差异。Flamingo 可接受脑电图的图像截图(如单导联或多导联波形)与简短临床描述(如“发作期:右侧额区节律性尖波”),通过少样本方法(例如仅需 5-10 个标注示例)自动输出病灶定位、发作类型分类及后续建议。

结合首都医科大学背景的具体流程

  • 输入:患者 30 秒发作期的 EEG 波形图像 + 文本 “20 岁女性,发作时意识丧失”。
  • 模型利用门控交叉注意力提取波形中的时空特征,并与文本先验对齐。
  • 输出:“高度提示右侧颞叶癫痫(局灶性),建议行高密度 EEG 定位”。
    该方法可显著降低标注成本,协助神经电生理医生快速筛选高危病例,尤其适用于基层医院缺乏专科医师的脑卒中后癫痫继发筛查。未来可扩展至帕金森病步态视频分析或急性缺血性卒中影像的实时判读。