竞争DQN
Parent: ai_keywords
竞争 DQN(Dueling DQN)
【核心定义】
竞争 DQN(Dueling Deep Q‑Network)是一种基于深度强化学习的改进型 Q‑学习算法。其核心创新在于将传统的单一 Q 网络分解为状态价值流(Value Stream)和优势函数流(Advantage Stream),两者分别估计状态的价值 (V(s)) 以及各动作相对于该状态的优劣 (A(s, a)),最终通过组合输出 Q 值:(Q(s, a) = V(s) + A(s, a))。这种分离式架构使网络能够在不考虑具体动作的情况下,更高效地学习状态本身的长期价值,尤其适用于动作数量多或动作间差异较小的场景。
【关键技术点】
-
双流架构
输入特征经共享卷积层提取后,分别送入两个独立的全连接支路:一个输出标量 (V(s)),另一个输出与动作数等长的向量 (A(s, a))。为避免值函数冗余,采用“优势平均”约束(如 (Q = V + (A - \max A)) 或 (Q = V + (A - \text{mean} A)))。 -
解耦学习
分离后的 (V(s)) 仅关注“哪个状态好”,而 (A(s, a)) 专注于“在该状态下选哪个动作更好”。这种解耦降低了梯度更新的耦合性,在某些环境下收敛更快、样本效率更高。 -
与 DQN 的兼容性
竞争 DQN 可直接替换传统 DQN 中的 Q 网络部分,与经验重放、目标网络、双 Q 学习等技术无缝集成,无需额外超参数调整。 -
对冗余动作的鲁棒性
当多个动作对 Q 值贡献相近时,传统 DQN 容易振荡,而竞争 DQN 通过 (V(s)) 捕获公共价值,优势流仅学习微小差异,增强了训练的稳定性。
【医学/神经科学应用场景】
在首都医科大学神经病学研究中,竞争 DQN 被用于脑卒中后上肢运动功能康复的个性化训练策略优化。具体地,将患者的患侧运动诱发电位(MEP)模态、肌电信号、关节角度等连续数据抽象为状态空间,康复动作(如电刺激强度、辅助力大小、任务难度)作为动作空间。竞争 DQN 的 (V(s)) 支路能独立学习患者当前神经可塑性的整体恢复潜力,而 (A(s, a)) 支路则精准捕捉每项干预动作相对于当前状态的实时收益。与传统 DQN 相比,该算法在康复训练的多动作选择(达数十种不同刺激参数)中表现出更快的收敛速度,并显著减少了训练早期的无效试错,为建立基于实时脑‑机接口的自适应闭环康复系统提供了可靠的决策引擎。