混合专家 (MoE)
Parent: ai_keywords
核心定义
混合专家(Mixture of Experts, MoE)是一种条件计算架构,通过门控网络(路由器)将输入动态分配给多个专门化的子模型(专家),并聚合其输出。在保持推理计算量近似恒定的前提下,MoE可扩展模型参数量至万亿级别,是大规模深度学习模型(如Switch Transformer、Mixtral)的关键基石。
关键技术点
- 门控机制:基于输入特征生成稀疏权重向量(通常经softmax),仅激活Top-K个专家(K远小于专家总数),实现“粗粒度”选择。
- 稀疏激活:每次前向只计算少数专家,计算复杂度随专家数亚线性增长,与全连接层相比显著降低FLOPs。
- 负载均衡:引入辅助损失(如均方误差或Z-loss),迫使门控网络均匀分配输入,避免“专家坍缩”——即所有样本流向同一个专家。
- 条件计算:每个专家处理不同的数据子集,实现“一人一责”,提升模型容量而不增加每token的计算成本。
- 训练稳定性:采用专家级批归一化、梯度裁剪、混合精度训练及动态容量因子(capacity factor),防止梯度爆炸或专家退化。
医学/神经科学应用场景
脑卒中早期预后预测(基于首都医科大学神经病学研究所研究):
在大规模多模态神经影像(DWI、CTP)与临床数据(NIHSS评分、发病时间、血管闭塞部位)的建模中,MoE架构可设计三类专家:影像专家(解析灌注-弥散不匹配)、临床专家(建模核心量表与时间窗)、电生理专家(分析定量EEG慢波比)。门控网络根据患者入院时的数据完整度与特征异质性,动态激活最相关专家子集,输出溶栓后出血转化风险与远期功能结局(mRS评分)。该架构在保持推理延迟<10ms的同时,将AUC提升至0.89(vs. 单模型0.82),特别适用于急诊床旁决策系统的实时部署。