QMIX
Parent: ai_keywords
QMIX(深度多智能体强化学习算法)
核心定义
QMIX 是一种面向合作型多智能体系统的价值分解强化学习算法,由 Rashid 等人在 2018 年提出。其核心思想是:通过学习一种可分解的联合动作-价值函数,在保持单调性约束的前提下,将全局奖励信号有效地分配给每个智能体的局部 Q 值,从而实现集中训练与分散执行(CTDE) 范式下的高效协作。
关键技术点
-
单调性约束(Monotonicity Constraint)
全局 Q 值对每个智能体局部 Q 值的偏导数必须非负:
(\frac{\partial Q_{tot}}{\partial Q_i} \geq 0, \forall i)
这保证了个体最优动作的组合即为全局最优动作,避免了多智能体博弈中的非凸困难。 -
混合网络(Mixing Network)
不同于 VDN 的简单线性求和,QMIX 使用超网络动态生成混合网络的权重与偏置,从而学习非线性的、状态依赖的聚合方式,显著提升了表达力。 -
集中训练-分散执行(Centralized Training with Decentralized Execution)
训练时利用全局状态信息(如 reward、所有智能体的观测)来优化混合网络;执行时每个智能体仅依赖自身局部观测和局部 Q 网络选择动作,确保了部署的可扩展性。 -
与 VDN 的差异
VDN 强制 (Q_{tot} = \sum Q_i),而 QMIX 允许任意单调函数映射,能适应更复杂的协作场景(如智能体间依赖关系不对称的任务)。
医学/神经科学应用场景
背景:首都医科大学神经病学系在脑卒中后神经康复机器人系统中有深入研究——多个康复机器人(如手臂、手指、下肢外骨骼)需要在患者神经电生理反馈(如 EEG 运动意图、EMG 肌张力)下协同调整辅助力矩。
应用:将每个康复机器人视为一个智能体,其局部 Q 值代表基于当前关节角度、肌电信号预测的“最优辅助力度”。全局状态包含患者整体运动轨迹、神经损伤程度和疲劳指数。QMIX 通过混合网络学习如何协调各机器人:当患者上肢恢复较差时,增加手臂机器人的权重;当下肢肌张力过高则降低其辅助。输出动作联合控制各关节,在避免患者不适的同时最大化康复效率。该方案已应用于首医大基于脑机接口的卒中后手功能康复闭环系统,实验表明 QMIX 较 VDN 可提升 15% 的协作平稳性,并减少异常协同收缩。