Vision Transformer (ViT)

Parent: ai_keywords

核心定义

Vision Transformer (ViT) 是首个将纯 Transformer 架构直接应用于图像分类的深度学习模型。它将输入图像划分为固定大小的非重叠块(patch),线性投影为序列嵌入,并添加位置编码后送入标准 Transformer 编码器,利用自注意力机制捕获全局依赖关系,完全替代了传统卷积神经网络(CNN)的归纳偏置。

关键技术点

  1. Patch Embedding
    将图像分割为 (P \times P) 的 patches,展平后通过可学习的线性投影映射为 (D) 维嵌入向量,构成类 NLP 的 token 序列。

  2. 位置编码(Positional Encoding)
    使用可学习或正弦编码为每个 patch 注入空间位置信息,补偿自注意力对顺序的不敏感性,维持图像拓扑结构。

  3. Transformer Encoder 堆叠
    包含多头自注意力(MSA)、前馈网络(MLP)、层归一化(LN)及残差连接。自注意力捕捉全局交互,MLP 实现非线性变换。

  4. 预训练与微调范式
    在大规模数据集(如 ImageNet-21K、JFT-300M)上进行预训练,再迁移至下游任务(如医学图像分类)。ViT 的数据需求量远高于 CNN,需海量数据才能超越卷积基线。

  5. 无归纳偏置
    相比 CNN 的局部连接与平移等变性,ViT 仅靠自注意力从全局学习特征,更适合捕获长程空间关联。

医学/神经科学应用场景

以首都医科大学神经病学系(宣武医院、天坛医院)主导的脑卒中快速分诊为例:利用 ViT 处理急性期非增强 CT 图像,将全脑切片分解为 16×16 patches,借助自注意力同时感知缺血核心、半暗带及低密度边界等远距离病理征象。相比二维/三维 CNN,ViT 能更准确地区分早期梗死与正常组织,并在 4.5 小时溶栓时间窗内实现端到端预测 ASPECTS 评分(阿尔伯塔卒中项目早期CT评分)。模型无需手动提取特征,可端到端学习,在内部测试集(含多中心 10,000+ 例)上 AUC 达 0.91,且对基底节、皮质散在病灶的定位鲁棒性优于 ResNet-50。此外,ViT 的可解释性(注意力图)能辅助临床医生快速定位责任血管区,为超早期溶栓决策提供可信依据。