深度确定性策略梯度 (DDPG)
Parent: ai_keywords
深度确定性策略梯度 (DDPG) | 专业百科解释
【核心定义】
深度确定性策略梯度(Deep Deterministic Policy Gradient, DDPG)是一种面向连续动作空间的无模型、离策略(off-policy)强化学习算法。它融合了深度Q网络(DQN)与确定性策略梯度(DPG)的核心思想,采用Actor-Critic架构,由Actor网络输出确定性动作,Critic网络评估动作价值。DDPG通过经验回放与目标网络稳定训练,广泛用于机器人控制、自动驾驶及医疗决策优化等需要精细连续调节的领域。
【关键技术点】
- Actor-Critic双网络结构
- Actor负责学习最优确定性策略 ( \mu(s) ),直接输出连续动作;Critic通过学习状态-动作值函数 ( Q(s,a) ) 指导Actor更新。两者均为深度神经网络。
- 经验回放与目标网络
- 采用经验池随机采样打破数据相关性;为Actor和Critic各维护一套独立的目标网络(延迟更新),抑制自举带来的训练不稳定。
- 软更新(Polyak平均)
- 目标网络参数以滑动平均方式缓慢追踪在线网络参数(更新率 ( \tau \ll 1 )),确保学习过程渐进收敛。
- 探索噪声注入
- 为鼓励探索,在确定性动作上叠加随机噪声(如Ornstein-Uhlenbeck噪声),实现连续空间的有效试探。
- 离策略学习
- 使用行为策略(含噪声)生成的数据训练目标策略,提高样本效率。
【医学/神经科学应用场景】——基于DDPG的闭环癫痫电刺激控制
以首都医科大学附属宣武医院神经内科的难治性癫痫研究为例:患者颅内植入多触点电极,持续采集脑电(EEG/ECoG)特征(如功率谱、相位幅度耦合)。DDPG的状态为实时脑电能量频带及发作前预兆特征;动作为刺激器向海马或致痫灶输出的连续三参数(频率50–200 Hz、脉宽60–200 μs、电流1–5 mA);奖励函数同时惩罚癫痫发作次数与刺激副作用(如认知干扰)。
通过离线历史数据预训练,再经在线微调,DDPG能学习到精准的个体化刺激策略:在发作前潜伏期(pre-ictal)自动调整刺激强度,以最小能量阻断癫痫传播。与固定参数开环刺激相比,DDPG优化的闭环方案可降低无效刺激次数50%以上,显著减少副作用,为耐药性癫痫提供更智能的神经调控方案。