AlexNet

Parent: ai_keywords

核心定义

AlexNet 是由 Alex Krizhevsky、Ilya Sutskever 和 Geoffrey Hinton 于 2012 年提出的深度卷积神经网络(CNN),它在 ILSVRC-2012 图像分类竞赛中以超越第二名近 10% 的错误率夺冠,标志着深度学习在计算机视觉领域的全面崛起。其核心创新在于成功利用 GPU 训练大规模深度网络,并验证了深度架构对复杂视觉特征(从边缘到语义)的层级提取能力。


关键技术点

  1. 深度层级结构
    包含 5 个卷积层(部分后接最大池化层)和 3 个全连接层,总计约 6000 万参数。深度结构使其能够学习到从低级纹理到高级语义的抽象特征,奠定了现代 CNN 的基本范式。

  2. ReLU 激活函数
    在卷积层后采用 Rectified Linear Unit(ReLU)替代传统的 sigmoid/tanh,显著缓解了深层网络中的梯度消失问题,同时大幅提高训练速度(约 6 倍加速)。

  3. 局部响应归一化(LRN)
    在部分卷积层后引入侧抑制机制,通过对邻近特征图的响应进行归一化,增强模型对不同局部特征的判别能力(注:后来的研究如 BatchNorm 已取代 LRN,但当时属于重要创新)。

  4. Dropout 与数据增强
    在全连接层使用 Dropout(概率 0.5)防止过拟合;同时采用随机裁剪、水平翻转、PCA 颜色扰动等数据增强技术,等效扩充训练集,提升泛化性能。

  5. GPU 并行训练
    将网络分布到两块 GTX 580 GPU 上,通过交替通信实现模型并行,使得大规模网络在合理时间内完成训练,解决了当时计算资源的瓶颈。


医学/神经科学应用场景

基于 AlexNet 的急性缺血性脑卒中 CT 图像快速分诊
在首都医科大学神经病学研究中,脑卒中患者入院后需紧急区分缺血性 vs. 出血性卒中,以决定是否溶栓。利用 AlexNet 对非增强头 CT 的 10 层轴位图像进行微调训练(迁移学习),通过卷积层自动提取灰白质对比度异常、脑沟回模糊等早期缺血征象。模型在单独测试集上对大面积梗死的分类 AUC 达 0.94,且推理时间 < 0.5 秒。该方案已部署于某附属医院急诊流程,辅助低年资医生快速评估,尤其适用于夜间/基层场景,显著缩短了“进门-溶栓”时间(DNT)。此举验证了深度 CNN 在神经影像辅助决策中的可靠性和时效性。