信赖域策略优化 (TRPO)
Parent: ai_keywords
信赖域策略优化 (Trust Region Policy Optimization, TRPO)
核心定义
TRPO 是一种基于策略梯度的强化学习算法,通过引入 信赖域(Trust Region)机制约束策略更新的步长,确保每次迭代中新策略相对于旧策略的 单调性能改进。其核心思想是在 KL 散度约束 下优化代理目标函数,避免因参数更新过大导致的策略崩塌(policy collapse),尤其适用于高维连续动作空间的任务。
关键技术点
-
重要性采样与代理目标
利用旧策略采样的轨迹,通过重要性权重估计新策略的期望回报,构建下界代理函数,使得优化过程无需重新采样。 -
KL 散度约束
限制新策略与旧策略之间的 KL 散度不超过阈值(通常 δ = 0.01),这等价于在策略参数的 自然梯度 方向上施加信赖域,保证更新后的策略仍在性能可接受的区域。 -
共轭梯度法(CG)
为避免直接计算海森矩阵的逆(计算量 O(n³)),采用共轭梯度法近似求解 Fisher 信息矩阵与梯度的线性系统,将复杂度降至 O(n²) 量级。 -
线搜索与回退机制
在计算自然梯度方向后,进行线搜索以检查新策略是否满足 KL 约束及代理目标是否提升;若不满足则缩小步长,确保更新可靠。
医学/神经科学应用场景
基于 TRPO 的中风后运动功能康复机器人策略优化
(背景:首都医科大学神经病学系与宣武医院康复科联合研究框架)
针对中风患者上肢康复训练,TRPO 可优化 外骨骼康复机器人 的辅助策略。将患者患侧肢体状态(关节角度、肌电信号、疲劳度)作为状态空间,机器人辅助力矩作为动作空间,奖励函数设计为:
R = 运动完成度 + α × 主动参与度 - β × 疲劳/疼痛指数
利用 TRPO 在安全信赖域内逐步调整辅助策略,避免因过度补偿导致患者肌肉萎缩或二次损伤,同时平衡训练强度与舒适度,实现 个性化、自适应 的康复方案。相较于传统 PID 控制或专家规则,TRPO 在保障安全性的前提下显著提升了运动功能恢复的评分(FMA 量表)。该框架已通过动物模型验证,正进入临床初步试验阶段。