CLIP
Parent: ai_keywords
CLIP:多模态预训练的视觉-语言基础模型
【核心定义】
CLIP(Contrastive Language–Image Pre-training,对比语言-图像预训练)是 OpenAI 于 2021 年提出的多模态基础模型。它通过大规模图文对(约 4 亿张互联网图片及对应文本)进行对比学习,将图像与文本映射到同一共享语义空间,从而实现零样本图像分类、图文检索、视觉常识推理等跨模态理解能力。
【关键技术点】
-
对比学习训练范式
核心损失函数为 InfoNCE:对每批次 N 个图文对,最大化配对的余弦相似度,最小化不配对对的相似度。无需人工标签,仅依靠自然语言监督。 -
双塔编码器结构
- 图像编码器:可选 ResNet 或 ViT(Vision Transformer),提取视觉特征。
- 文本编码器:基于 Transformer(类似 GPT-2),将输入文本转换为语义向量。
两塔输出经线性投影后对齐维度,进行余弦相似度计算。
-
零样本迁移能力
训练后无需微调,即可对任意未见类别进行分类:将类别标签构造成“a photo of [category]”提示词,与图像嵌入计算相似度,取最高分作为预测。在 ImageNet 上达到 76.2% 的零样本 Top-1 准确率。
【医学/神经科学应用场景】
以脑卒中急性期 CT 影像快速分诊为例(首都医科大学宣武医院国家神经疾病医学中心):
传统基于深度学习的卒中检测模型需针对每类病变(如缺血灶、出血灶、中线移位)进行单独标注和训练,耗时长且泛化性差。CLIP 利用“零样本”能力可直接实现多模态推理:
- 输入:头部 CT 平扫切片 + 自由文本提示(如“基底节区高密度影,边界清晰,提示脑出血”)。
- 输出:CLIP 计算图像与文本的匹配得分(>0.9 时高置信),辅助急诊医生快速定位异常区域及定性。
- 优势:无需预先标注训练集,可动态引入罕见病变(如血管性水肿)的文本描述;结合临床报告文本,还可实现影像-报告一致性校验,减少漏诊。
此外,CLIP 在癫痫脑电图语义检索(如“尖慢波夹杂在θ节律中”)和帕金森面部表情分析(对比“masked face”与运动迟缓文本)中亦有探索,推动神经疾病的多模态智能诊断从“监督训练”迈向“认知对齐”范式。