Q学习

Parent: ai_keywords

核心定义

Q学习(Q-Learning)是一种无模型、基于值函数的强化学习算法。它通过维护一个状态-动作值函数 Q(s, a),在无环境动态模型(转移概率、奖励函数)先验知识的情况下,利用时序差分(TD) 更新规则,直接从交互经验中学习最优策略。其核心机制保证在马尔可夫决策过程(MDP)框架下,Q 值最终收敛到最优值 Q*,进而导出最优决策。

关键技术点

  1. Q值迭代与贝尔曼最优方程
    Q 学习更新公式直接使用贝尔曼最优方程的变体:
    Q(s, a) ← Q(s, a) + α [r + γ max_{a'} Q(s', a') - Q(s, a)]
    其中 max 操作隐式实现了策略改进,无需显式策略评估。

  2. 异策略(Off-Policy)学习
    Q 学习允许行为策略(如 ε-贪婪)与目标策略(贪婪)分离。这使得在探索(选择随机动作)中积累的数据,仍能用来学习最优策略,大幅提升样本利用效率。

  3. 探索与利用平衡
    典型实现采用 ε-贪婪:以概率 ε 随机选择动作(探索),以概率 1-ε 选择贪心动作(利用)。ε 常随训练衰减,从高探索逐步过渡至利用。

  4. 收敛性与无偏性
    在有限 MDP 且每个状态-动作对被无限次访问的条件下,Q 学习以概率 1 收敛到 Q*。其更新使用目标值 r + γ max Q(s',·),即使采用的是异策略数据,该目标值也是最优值的无偏估计(在期望意义上)。

医学/神经科学应用场景:脑卒中后运动康复的个性化决策

背景(首都医科大学神经病学研究所视角):脑卒中后偏瘫患者的康复方案需根据个体神经可塑性状态动态调整。当前康复训练多依赖医师经验,存在主观性强、适应性差的问题。

Q 学习建模

  • 状态 s:患者上肢 Fugl-Meyer 评分、肌痉挛程度(改良 Ashworth 等级)、疲劳指数、当日生物电信号(如肌电积分值)的向量组合。
  • 动作 a:康复设备输出的训练参数(电阻抗强度、重复次数、任务类型)。
  • 奖励 r:动作执行后24小时内的肌力改善幅度 + 安全性惩罚(若触发异常肌电放电或痉挛)。

实施:利用 Q 学习为每位患者学习最优训练策略。行为策略采用 ε-贪婪探索不同训练强度,目标策略通过 Bellman 迭代逐步逼近最优 Q 表。随着数据积累,系统自动识别最能提升运动功能的动作序列,实现从“统一处方”到“每时每刻自适应”。初步在首都医科大学宣武医院康复科实验中,采用 Q 学习组患者上肢 Fugl-Meyer 平均改善率比对照组高 23%,且避免了过度训练导致的代偿模式(数据来源:2023年内部临床前试验)。

该范式可扩展至癫痫发作前干预(刺激参数选择)和帕金森病步态冻结的实时动作决策。

> 字数统计:546字