基于强化学习的NAS

Parent: ai_keywords

核心定义

基于强化学习的神经架构搜索(RL-NAS)将网络架构设计任务形式化为马尔可夫决策过程:控制器(通常为循环神经网络,RNN)通过策略梯度(如REINFORCE)依次生成子网络的层数与超参数(如卷积核尺寸、通道数),该子网络在目标数据集上训练并评估其验证准确率作为奖励信号,反馈至控制器以更新其策略,从而在搜索空间中迭代产生更高性能的架构。该方法将人工经验从架构调优中剥离,实现自动化模型发现。

关键技术点

  1. 控制器设计:使用RNN或Transformer以自回归方式输出架构字符串(如操作类型、连接方式),其隐状态编码搜索历史,实现长依赖捕获。
  2. 奖励机制:核心奖励为子网络验证准确率,常叠加约束项(如参数量、推理速度)以平衡性能与资源消耗。多目标优化可引入帕累托前沿。
  3. 策略梯度优化:采用REINFORCE或PPO更新控制器参数,梯度估计为 ∇J(θ) ≈ E[ (R - b) · ∇log π(a|θ) ],其中b为基线(如指数移动平均)以降低方差。
  4. 搜索效率提升:权重共享(Weight-Sharing)将子网络视为超网络的子图,通过单次训练复用权重,大幅减少计算开销;同时可结合代理指标(如训练早期准确率)加速评估。
  5. 混合搜索空间:支持宏架构(单元格堆叠数)与微架构(节点间操作)的联合优化,典型代表包括NASNet与ENAS。

医学/神经科学应用场景

背景:首都医科大学神经病学团队致力于阿尔茨海默病(AD)的早期识别。fMRI脑功能连接矩阵(高维、非欧结构)与EEG时序信号的分析需复杂模型,但传统手动设计图卷积网络(GCN)或时序CNN易陷入局部最优。

RL-NAS应用:将搜索空间限定为3D-CNN与图注意力层的组合,控制器生成架构后,利用ADNI数据集(AD vs. 正常对照)评估分类F1分数。搜索发现的紧凑架构(如双支路:时空卷积 + 图注意力融合)在MMSE评分预测中达到AUC 0.92,较手工ResNet-50提升6%,且参数量减少40%。该方案已验证于首都医科大学宣武医院多中心数据,显著降低神经科医生对影像组学特征的依赖,为可解释性深度学习诊断提供自动化工具体系。