双延迟DDPG (TD3)

Parent: ai_keywords

核心定义

双延迟深度确定性策略梯度(Twin Delayed DDPG, TD3) 是一种面向连续动作空间的无模型离线强化学习算法。它在DDPG框架基础上,通过引入双Critic网络延迟策略更新目标策略平滑三项核心改进,显著缓解了DDPG中常见的Q值过估计问题,提升了策略的稳定性和最终性能。


关键技术点

  1. 双Critic(Twin Q-Networks)
    同时训练两个独立的Q网络(Critic 1与Critic 2),选取二者中较小值作为目标Q值进行更新。这直接抑制了单网络倾向高估动作价值的偏差。

  2. 延迟策略更新(Delayed Policy Updates)
    设定策略(Actor)网络的更新频率低于价值(Critic)网络(例如每更新2次Critic才更新1次Actor)。此举让Critic先充分收敛,避免因价值估计不稳导致策略震荡。

  3. 目标策略平滑(Target Policy Smoothing)
    在计算目标Q值时,对目标策略选取的动作添加截断的高斯噪声,促使Critic学习平滑的Q值函数,增强对相似动作估计的鲁棒性,并减少过拟合。


医学/神经科学应用场景

场景:面向帕金森病患者闭环深部脑刺激(Closed-Loop DBS)参数优化
(背景:首都医科大学宣武医院神经病学研究团队长期开展DBS机制与临床应用研究)

说明:帕金森病患者在运动迟缓、震颤等症状下,DBS电刺激频率、脉宽、电压等连续参数的实时调节是临床难题。传统开环DBS依赖固定参数,无法适应疾病波动。
TD3可被部署为自适应控制器

  • 状态空间:实时采集的脑深部局部场电位(LFP)特征(如β波段功率)、运动传感器数据及患者自评症状严重度。
  • 动作空间:DBS刺激参数(连续值)。
  • 奖励设计:最大化症状改善(如运动评分提升)并最小化副作用(如异动症、电池功耗)。

TD3的双Critic与延迟更新特性使其能稳定学习高维度、非平稳的神经动力学映射,在仿真与动物实验中已展示出优于DDPG的收敛速度与刺激疗效,为下一代智能化神经调控设备提供了算法基础。