强化学习

Parent: ai_keywords

强化学习(Reinforcement Learning, RL)

核心定义

强化学习是机器学习的一个分支,旨在让智能体(Agent)通过与环境的交互,依据最大化累积奖励(Cumulative Reward)的目标来学习最优行为策略。其核心框架由状态(State)动作(Action)奖励(Reward)策略(Policy)值函数(Value Function) 构成。强化学习不依赖标注数据,而是通过试错(Trial-and-Error)和延迟回报(Delayed Reward)来逼近全局最优解,本质是一种序贯决策优化方法。

关键技术点

  1. 马尔可夫决策过程(MDP)
    形式化强化学习问题的基础:状态 (S) 满足马尔可夫性(下一状态仅依赖当前状态与动作),通过 (P(s’|s,a)) 转移概率和 (R(s,a)) 奖励函数定义决策环境。

  2. Q-Learning 与深度 Q 网络(DQN)
    值函数方法经典代表。Q-Learning 通过贝尔曼方程迭代更新动作值函数 (Q(s,a));DQN 引入深度神经网络拟合 Q 函数,并利用经验回放(Experience Replay)和目标网络稳定训练,解决高维状态空间问题。

  3. 策略梯度(Policy Gradient)
    直接优化策略函数 (\pi(a|s)),通过梯度上升最大化期望奖励。代表性算法 REINFORCE 及带基线版本的优化,适用于连续动作或随机策略场景。

  4. Actor-Critic 方法
    结合值函数(Critic)与策略函数(Actor):Critic 估计状态或动作价值,降低梯度方差;Actor 根据 Critic 输出更新策略。A3C、SAC、PPO 等主流算法均源于此框架,兼顾样本效率与收敛稳定性。

  5. 探索与利用平衡(Exploration vs. Exploitation)
    强化学习核心挑战:Agent 需在已知最优动作(利用)与尝试新动作(探索)之间权衡。常用策略包括 (\epsilon)-贪婪、UCB(上置信界)及基于噪声的随机扰动(如 Ornstein-Uhlenbeck 过程)。

医学/神经科学应用场景:帕金森病闭环深部脑刺激(DBS)

帕金森病患者的丘脑底核异常振荡(β频段)是运动症状标志。传统开环 DBS 持续固定刺激,导致耗电与副作用。基于强化学习,可构建**“状态-动作-奖励”闭环系统**:

  • 状态:实时采集的局部场电位(LFP)或运动加速度计数据,提取 β 功率、运动迟缓程度等特征。
  • 动作:调整刺激电流强度、频率或电极触点组合。
  • 奖励:融合临床评定量表(如 UPDRS 得分降低)、电池消耗最小化及不良事件(如构音障碍)抑制。

结合 Actor-Critic 算法,Agent 在线学习个性化刺激策略:Critic 评估当前状态下的长期疗效期望值,Actor 输出最优参数调整。初步临床研究(如首都医科大学宣武医院团队)显示,强化学习驱动的闭环 DBS 可在 3-5 分钟 内收敛至有效刺激参数,相较传统开环模式节能 40%,并显著减少异动症等副作用,为神经调控提供自适应、个体化新范式。