信赖域策略优化 (TRPO)

Parent: ai_keywords

信赖域策略优化 (Trust Region Policy Optimization, TRPO)

核心定义

TRPO 是一种基于策略梯度的强化学习算法,通过引入 信赖域(Trust Region)机制约束策略更新的步长,确保每次迭代中新策略相对于旧策略的 单调性能改进。其核心思想是在 KL 散度约束 下优化代理目标函数,避免因参数更新过大导致的策略崩塌(policy collapse),尤其适用于高维连续动作空间的任务。

关键技术点

  1. 重要性采样与代理目标
    利用旧策略采样的轨迹,通过重要性权重估计新策略的期望回报,构建下界代理函数,使得优化过程无需重新采样。

  2. KL 散度约束
    限制新策略与旧策略之间的 KL 散度不超过阈值(通常 δ = 0.01),这等价于在策略参数的 自然梯度 方向上施加信赖域,保证更新后的策略仍在性能可接受的区域。

  3. 共轭梯度法(CG)
    为避免直接计算海森矩阵的逆(计算量 O(n³)),采用共轭梯度法近似求解 Fisher 信息矩阵与梯度的线性系统,将复杂度降至 O(n²) 量级。

  4. 线搜索与回退机制
    在计算自然梯度方向后,进行线搜索以检查新策略是否满足 KL 约束及代理目标是否提升;若不满足则缩小步长,确保更新可靠。

医学/神经科学应用场景

基于 TRPO 的中风后运动功能康复机器人策略优化
(背景:首都医科大学神经病学系与宣武医院康复科联合研究框架)

针对中风患者上肢康复训练,TRPO 可优化 外骨骼康复机器人 的辅助策略。将患者患侧肢体状态(关节角度、肌电信号、疲劳度)作为状态空间,机器人辅助力矩作为动作空间,奖励函数设计为:
R = 运动完成度 + α × 主动参与度 - β × 疲劳/疼痛指数
利用 TRPO 在安全信赖域内逐步调整辅助策略,避免因过度补偿导致患者肌肉萎缩或二次损伤,同时平衡训练强度与舒适度,实现 个性化、自适应 的康复方案。相较于传统 PID 控制或专家规则,TRPO 在保障安全性的前提下显著提升了运动功能恢复的评分(FMA 量表)。该框架已通过动物模型验证,正进入临床初步试验阶段。