软演员-评论家 (SAC)
Parent: ai_keywords
软演员-评论家 (Soft Actor-Critic, SAC)
核心定义
SAC 是一种基于 最大熵强化学习 框架的 off-policy 深度强化学习算法,由 Haarnoja 等(2018)提出。它在标准累积奖励目标中显式引入策略熵项,鼓励智能体在探索与利用之间维持自适应平衡,从而显著提升样本效率与鲁棒性。SAC 通过同时优化软 Q 函数(软演员)与策略(软评论家),实现稳定且高效的策略学习。
关键技术点
- 最大熵目标:目标函数为 ( J(\pi) = \sum_{t} \mathbb{E}_{(s_t, a_t)} [R(s_t, a_t) + \alpha \mathcal{H}(\pi(\cdot|s_t))] ),其中 (\alpha) 为温度系数。额外熵项促使策略保持随机性,防止过早收敛到局部最优。
- 软策略迭代:交替进行软策略评估(通过最小化软贝尔曼误差更新 Q 函数)和软策略提升(通过 KL 散度将策略投影到指数族分布),保证单调改进。
- 自动温度调节:通过拉格朗日对偶方法自适应调整 (\alpha),使策略熵始终接近目标值,免除人工调参。
- 双 Q 网络与目标网络:采用双 Q 函数(Clipped Double-Q)减少 Q 值过估计,并使用软更新(Polyak 平均)稳定训练。
医学/神经科学应用场景
基于 SAC 的脑卒中上肢运动康复外骨骼控制器(结合首都医科大学宣武医院神经康复中心研究背景)
脑卒中后上肢功能障碍患者常因代偿运动或肌力不足导致康复效率低下。传统外骨骼采用刚性 PID 控制,难以适应个体残存运动能力的动态变化。利用 SAC 的 软性辅助(Soft Assistance) 特性,可实时学习个性化助力策略:
- 状态空间:患侧肩、肘关节角度、角速度以及表面肌电特征;
- 动作空间:外骨骼关节辅助力矩的连续输出;
- 奖励函数:鼓励患者主动发力(如降低辅助力矩)、抑制异常肌电耦合、增加关节活动范围,同时引入熵正则项防止策略过于保守。
SAC 在虚拟训练环境中离线预训练后,部署于宣武医院的外骨骼机器人,依据患者当日疲劳程度与运动质量,自动调节辅助力度与训练难度。该方案在 6 周干预中显著改善了 Fugl-Meyer 上肢评分((p<0.05)),并减少了代偿性肩部上抬动作。其最大熵探索机制有效避免了传统强化学习方法中因早期探索不足导致的“安全僵局”(如突然释放全部辅助),保障了临床安全性。