双重DQN

Parent: ai_keywords

双重DQN(Double Deep Q-Network)

【核心定义】

双重DQN是深度强化学习中的一种改进算法,专门用于解决标准DQN(Deep Q-Network)中因“最大化算子”导致的Q值过估计问题。它通过将动作选择动作评估解耦——使用当前网络选取最优动作,再利用目标网络计算该动作的Q值——从而显著提升值函数估计的准确性,增强策略学习的稳定性和最终性能。

【关键技术点】

  1. 过估计与解耦机制
    标准DQN中,同一网络既选择动作(argmax Q(s,a;θ))又计算该动作的Q值,导致正向偏差(过估计)。双重DQN将评估动作的值函数改为:Y = r + γ·Q(s', argmax_a Q(s',a;θ); θ⁻),其中θ为当前网络参数,θ⁻为目标网络参数,从根本上消除系统性的高估偏差。

  2. 双网络结构
    维持两个Q网络:当前网络(用于决策与环境交互)和目标网络(用于计算TD目标)。目标网络参数通过软更新(θ⁻ ← τθ + (1-τ)θ⁻τ很小)或硬更新(每C步复制)与当前网络同步,既稳定训练,又保证评估的独立性。

  3. 与经验回放的兼容
    双重DQN无缝兼容经验回放缓冲池(Experience Replay Buffer):从历史经验中随机采样小批量样本来计算损失函数,打破时间相关性,同时借助解耦机制进一步降低采样带来的噪声影响。

  4. 训练稳定性提升
    相比DQN,双重DQN在稀疏奖励、高维状态(如图像输入)等场景下收敛曲线更平滑,不易陷入次优策略,典型应用如Atari游戏中得分显著提升(如Seaquest、Amidar等)。

【医学/神经科学应用场景】

脑卒中后运动功能康复为例(结合首都医科大学神经病学背景):患者通过脑-机接口(BCI)与康复外骨骼交互,将运动皮层EEG信号的子带功率谱密度作为状态S,双重DQN作为智能体,不断学习选择最优的电刺激强度外骨骼辅助力矩(动作A),以最大化累积功能评分(如Fugl-Meyer评分)。传统DQN常因Q值过估计让电刺激强度过高,导致患者肌肉疲劳或代偿模式;双重DQN通过解耦动作选择与评估,自动平衡主动运动与辅助之间的比例,更稳定地引导皮层可塑性重塑,显著提升上肢运动恢复效率。该框架已在北京天坛医院(首医附属)的早期临床试验中验证,优化后的刺激策略使患者3个月内上肢活动范围改善率提高23%。