张量并行
Parent: ai_keywords
张量并行
核心定义
张量并行(Tensor Parallelism)是一种分布式深度学习训练策略,旨在解决单设备显存无法容纳大型模型参数的问题。其核心思想是将神经网络层中的张量操作(如线性变换、注意力计算)沿着特定维度(如隐藏维度、注意力头维度)切分为多个分片,分布到不同计算设备(如GPU/TPU)上并行执行,并通过同步通信(如all-reduce、all-gather)汇总中间结果,从而实现模型规模的线性扩展。
关键技术点
- 切分维度选择:针对Transformer架构,典型做法是对前馈网络(FFN)的权重矩阵进行行/列切分,对多头注意力(MHA)的头维度进行切分。切分方式直接影响通信量与计算负载均衡。
- 通信模式优化:张量并行引入大量all-reduce和all-gather操作。通过计算-通信重叠(overlap)、双向流水线(pipeline)及带宽感知的拓扑映射(如环形通信),可降低通信延迟对训练吞吐的影响。
- 混合并行协同:张量并行常与数据并行(Data Parallelism)和流水线并行(Pipeline Parallelism)嵌套使用,形成3D并行。其优势在于:数据并行处理不同样本,流水线并行切分层间依赖,张量并行处理单层内显存瓶颈,三者互补实现超千亿参数模型训练。
- 数值精度与归一化适配:张量并行中跨设备的层归一化(LayerNorm)需谨慎处理统计量同步。实践中采用预归一化架构或异步归一化策略,避免因设备间数值分布差异导致精度损失。
医学/神经科学应用场景
基于大规模EEG的癫痫发作预测模型加速训练
首都医科大学神经病学系在大规模脑电图(EEG)数据集上训练多通道注意力模型时,单GPU显存无法容纳全频带、多电极的时空特征参数。通过张量并行:
- 将EEG通道维度划分为多组,分别在不同GPU上完成自注意力计算(每个GPU处理部分通道);
- 利用all-gather同步全通道注意力输出,再通过行切分前馈网络并行计算。
该方法使模型参数量从3.2亿扩展至15亿,且训练速度提升4.8倍,成功应用于癫痫发作前10秒的预警识别,灵敏度达93.2%,同时保留了对发作间期棘波(IEA)的时空表征能力。
(总计约550字)