零样本图像分类
Parent: ai_keywords
零样本图像分类(Zero-shot Image Classification)
核心定义
零样本图像分类是指模型在未见过某类别任何训练样本的情况下,仅依靠该类别的语义描述(如属性、文本标签或知识图谱)即可正确识别该类别图像的任务。这打破了传统监督学习对标注数据的绝对依赖,将预训练模型从“识别已知”推向“推断未知”。
关键技术点
-
语义嵌入空间
将图像特征与类别描述(如词向量、属性向量)映射到公共嵌入空间,通过对比学习使二者对齐。常见模型如CLIP利用图文对比损失实现跨模态对齐。 -
可见类与未见类的共享表示
利用可见类(训练集)中学习到的语义-视觉关联泛化到未见类。关键在于确保嵌入空间的判别性,避免过拟合可见类。 -
属性学习与层次化推理
通过分解类别为可共享的语义属性(如“有翅膀”、“会飞”),使模型基于属性组合推理未见类别。层次化结构(如WordNet)可进一步约束推理路径。 -
广义零样本学习
解决测试时同时出现可见类和未见类的挑战,常见策略包括校准置信度(Calibration)、生成式方法(如利用GAN合成未见类特征)或基于transformer的上下文推理。
医学/神经科学应用场景
场景:首都医科大学神经病学研究所针对罕见脑小血管病(CSVD)亚型的快速影像筛查。
传统方法因罕见病例数据稀疏,难以训练专用分类器。基于零样本分类,可构建以下流程:
- 利用神经退行性疾病的病理知识图谱(如“脑微出血”、“血管周围间隙扩大”、“白质高信号空间分布模式”)作为语义描述;
- 将患者MRI影像通过预训练医学视觉编码器(如基于3D-ResNet或ViT)提取特征,并与上述语义嵌入进行跨模态相似度计算;
- 即便模型从未见过“常染色体显性遗传性脑动脉病(CADASIL)”的训练样本,也能通过其语义属性(“颞极白质高信号”、“皮质下梗死”)实现零样本识别。
该技术可显著降低罕见神经血管疾病的人工读片成本,加速临床试验入组与早期干预。