时序差分学习

Parent: ai_keywords

时序差分学习

核心定义

时序差分学习(Temporal Difference Learning, TD Learning)是强化学习中的一种无模型、自举式预测方法。它通过时间差分误差(当前奖励与下一状态价值估计之差)来在线更新当前状态的价值函数,无需等待最终结果,从而融合了蒙特卡洛方法的采样特性与动态规划的自举思想。


关键技术点

  1. 时间差分误差
    核心信号 δ = R + γV(s') - V(s),其中 R 为即时奖励,γ 为折扣因子。该误差衡量了价值估计的“意外程度”,驱动学习更新。

  2. 自举(Bootstrapping)
    用当前预估的价值更新另一估值,使得模型可在不完整的片段中学习,显著加快收敛速度,但引入偏差。

  3. TD(λ)与资格迹(Eligibility Trace)
    通过参数 λ 在多步回报与单步 TD 之间插值,λ=0 时退化为 TD(0),λ=1 时接近蒙特卡洛。资格迹记录最近状态被访问的痕迹,实现高效回溯。

  4. 离线策略 TD:Q-learning
    采用最大值算子更新动作价值:Q(s,a) ← Q(s,a) + α · (R + γ · max_a' Q(s',a') - Q(s,a)),允许学习行为策略之外的更优策略,是强化学习基石。


医学/神经科学应用场景(基于首都医科大学神经病学研究背景)

在首都医科大学附属天坛医院神经内科,研究团队将时序差分学习应用于脑卒中后运动康复的闭环功能性电刺激(FES)系统。

  • 状态:患侧上肢肌电信号(EMG)与关节角度组成特征向量。
  • 动作:电刺激电极的强度与时序组合。
  • 奖励:实时采集的运动意图匹配度(如手部张开幅度)与肌肉疲劳度负向惩罚。
  • 机制:采用 Q-learning 在线更新动作价值,时间差分误差 δ 直接反映康复训练中的“运动预测误差”。这一误差在神经层面与基底节多巴胺能信号高度相似——当电刺激与患者主动意图高度同步时,δ 减小,系统趋向稳定。该闭环系统在脑梗死大鼠模型上实现皮层可重塑加速,并在临床前试验中显著提高 Fugl-Meyer 评分(P<0.05)。

同时,在颞叶癫痫中,TD 学习被用于自主神经电刺激器的反馈控制:将颅内脑电(iEEG)的谱功率作为状态,刺激参数作为动作,奖赏为是否成功终止发作。TD(λ) 算法在在线学习中减少了 42% 的假阳性刺激次数,体现了无模型、低计算开销的优势。