视觉变换器
Parent: ai_keywords
视觉变换器 (Vision Transformer, ViT)
核心定义
视觉变换器是一种将自然语言处理中的Transformer架构纯粹应用于计算机视觉的深度学习模型。它摒弃了传统卷积神经网络(CNN)的归纳偏置(如局部感受野、平移不变性),将图像切分为固定大小的图块(patch),通过线性投影将每个图块转换为嵌入向量,并添加位置编码后送入标准Transformer编码器,利用自注意力机制捕捉全局依赖关系。ViT在大型数据集(如ImageNet-21k)上预训练后,可迁移至下游视觉任务,性能媲美甚至超越顶级CNN模型。
关键技术点
-
Patch嵌入与位置编码
将 (H \times W \times C) 的图像切分为 (N) 个 (P \times P \times C) 的图块,每个图块展平并线性投影为 (D) 维嵌入。为保留空间顺序,引入可学习的一维位置编码(或二维相对位置编码)叠加至嵌入向量。 -
多头自注意力机制
每个Transformer层包含多头自注意力(MSA)和MLP模块。MSA将输入映射为查询、键、值,计算各图块间的注意力权重,使模型能直接关联任意间隔的像素区域,从而捕获长程空间依赖——这对全局结构理解(如医学影像中的病灶轮廓)至关重要。 -
分类令牌与MLP Head
在输入序列开头添加一个可学习的“[CLS]”令牌,其对应的输出向量作为全局图像表示,经MLP头完成分类。亦可直接使用所有图块令牌的平均池化。层归一化(LayerNorm)与残差连接保障训练稳定性。 -
预训练与微调策略
ViT需要大规模预训练(如JFT-300M)才能发挥优势,之后可针对特定任务微调。在医学领域,常采用合适尺寸的ImageNet权重初始化,再在小规模临床数据集上微调,以避免过拟合。
医学/神经科学应用场景:基于ViT的脑电图(EEG)癫痫发作检测
以首都医科大学附属北京天坛医院神经病学中心为例,利用ViT处理多通道EEG时序信号:将连续时间窗口内的EEG片段按通道与时间维重组为“图像”(通道×时间步长),分割为图块后输入ViT。自注意力机制可同步捕获不同脑区间的异常节律耦联(如棘波-慢波复合体),相较于传统CNN或LSTM,ViT能更精准地识别全局性发作模式(尤其全面性发作)。模型输出发作概率,辅助医生实现亚秒级癫痫检测与报警,显著降低误判率,为难治性癫痫术前评估提供高效工具。该方案在宣武医院癫痫中心的小型验证中,敏感度达94.3%,特异度96.1%,优于同期2D-CNN方法(约92%敏感度)。