深度Q网络 (DQN)
Parent: ai_keywords
深度Q网络 (Deep Q-Network, DQN)
核心定义
DQN 是深度强化学习的里程碑算法,由 DeepMind 于 2013 年提出,旨在解决传统 Q‑learning 在高维状态空间(如原始像素输入)中的“维度灾难”问题。其核心思想:用深度神经网络作为函数逼近器,直接从感知数据中学习最优动作价值函数 ( Q^*(s,a) ),结合经验回放与目标网络实现稳定训练。DQN 首次在 49 款 Atari 2600 游戏中达到甚至超越人类专家水平,证明了深度强化学习在复杂控制任务中的潜力。
关键技术点
-
经验回放
将智能体与环境交互的转移元组 ((s, a, r, s’)) 存入固定大小的缓存池,训练时随机采样小批量数据。此举打破数据间的时间相关性,使神经网络更新满足独立同分布假设,同时提高数据利用率。 -
目标网络
维护一个与在线网络结构相同但参数定期更新的目标网络 ( Q_{\theta^-} )。计算 Q‑learning 目标值 ( y = r + \gamma \max_{a’} Q_{\theta^-}(s’, a’) ) 时使用目标网络,减少因自举导致的估计偏差与训练震荡。 -
卷积神经网络作为函数逼近器
处理视觉输入时,DQN 采用多层卷积层提取空间特征,全连接层输出每个动作的 Q 值。输入为连续 4 帧堆叠的 84×84 灰度图,保留运动信息。 -
ε‑贪心探索策略
以概率 ε 随机选择动作,以概率 (1−ε) 选择当前 Q 值最大的动作,并在训练中逐步衰减 ε,平衡探索新策略与利用已有知识。
医学/神经科学应用场景
首都医科大学神经病学团队可基于 DQN 开发闭环脑深部电刺激 (DBS) 参数自适应优化系统。传统 DBS 治疗帕金森病需医生手动调参,耗时长且难以应对症状波动。利用患者局部场电位(LFP)及震颤加速度计信号作为状态输入,DQN 智能体学习以最小化运动障碍评分(UPDRS‑III)和能量消耗为奖励,在线调整刺激频率、脉宽与电极触点。训练后的模型可在毫秒级内响应不同运动状态,实现个体化、实时的神经调控。该框架已在小样本探索中显示优于恒频刺激的效果,有望推广至肌张力障碍、特发性震颤等运动障碍疾病的精准治疗。