图形处理器 (GPU)

Parent: ai_keywords

图形处理器 (GPU):定义、技术要点与神经科学应用

核心定义

图形处理器(Graphics Processing Unit, GPU)是一种专为高度并行计算而设计的微处理器。与中央处理器(CPU)的少量强大核心不同,GPU 拥有数千个相对简单但高效的计算核心,能够同时处理海量数据。这一架构使其从早期专用于图形渲染(如3D游戏、视频编辑)拓展至通用计算(GPGPU),并成为现代人工智能(AI)尤其是深度学习训练的基石硬件。

关键技术点

  1. 大规模并行架构
    GPU 采用单指令多线程(SIMT)模型,可同时执行数千个线程。以 NVIDIA 的 CUDA 核心或 AMD 的流处理器为代表,并行度比 CPU 高 1–2 个数量级,适合矩阵乘法、卷积等可分解的运算。

  2. 专用张量核心(Tensor Core)
    现代 GPU(如 NVIDIA Volta 及后续架构)集成的张量核心,专门针对混合精度矩阵运算进行优化,可在单个时钟周期内完成 4×4 矩阵乘加操作,将深度学习训练速度提升数倍。

  3. 高带宽显存与互联
    HBM2e/3、GDDR6X 等显存技术提供远超 CPU 内存的带宽(>1 TB/s),配合 NVLink 等高速互联,支持大模型(如 LLM)和 3D 医学影像数据在 GPU 和显存间快速流动。

  4. CUDA 与异构计算生态
    CUDA 是 NVIDIA 的并行计算平台和编程模型,结合 cuDNN、TensorRT 等优化库及 PyTorch/TensorFlow 框架,使开发者能高效利用 GPU 加速 AI 算法,且支持 CPU 与 GPU 协同工作。

医学/神经科学应用场景:基于 GPU 的癫痫灶定位

在首都医科大学神经病学研究中,GPU 显著加速了难治性癫痫的术前评估。具体场景如下:

  • 高密度脑电图(HD-EEG)源成像:将患者 256–2560 导联的长时间脑电图数据(常超过 48 小时)映射至个体 MRI 皮层模型,该过程涉及数百万个偶极子源求解与逆问题计算。GPU 并行化贝叶斯源定位算法(如 sLORETA、MNE),将传统数小时的计算压缩至 5–10 分钟,使术中实时成像成为可能。
  • 深度学习病灶检测:使用 3D 卷积神经网络(3D-CNN)分析 MRI 及 PET 影像,自动识别高信号皮质病灶(如局灶性皮质发育不良)。单例患者的多模态影像预处理(重采样、配准)及模型推理利用 GPU 的显存高带宽特性,可在 2 秒内完成,为神经电生理团队提供即时参考。

此应用借助 GPU 的高并行能力,将“多模态数据→电临床相关性分析”的周期从人工数天缩短至数十分钟,直接提升了癫痫外科致痫灶的定位精度与手术预后评估效率。