基于偏好的强化学习
Parent: ai_keywords
基于偏好的强化学习(Preference-based Reinforcement Learning, PbRL)
核心定义
基于偏好的强化学习是一种通过人类偏好反馈(而非预定义数值奖励)来引导智能体学习最优策略的强化学习范式。其核心思想是:智能体通过比较两个或多个轨迹片段(或状态-动作对),从人类标注的“更优/更差”偏好中推断出隐含的奖励函数,再基于该奖励模型进行策略优化。PbRL 解决了传统 RL 中奖励函数难以设计、主观性高或无法显式形式化的痛点(如医疗决策、人机交互)。
关键技术点
- 偏好反馈获取:通常采用轨迹片段对比方式——向标注者展示两条执行轨迹的片段,询问“哪一条更符合目标?”(如“哪个康复动作更舒适?”)。反馈以二元或三元偏好形式(更优、更差、相等)记录,构建偏好数据集。
- 奖励模型学习:利用 Bradley-Terry 模型(或基于神经网络的概率模型)将偏好映射为标量奖励函数:假设人类偏好符合“更优秀轨迹被选择的概率正比于其奖励值指数”的假设,通过最大似然估计拟合该函数。
- 主动查询策略:为降低标注成本,智能体主动选择信息量最大的轨迹对(如基于奖励模型不确定性或边际贡献)请求人类反馈,在不显著影响性能的前提下减少所需标注次数。
- 策略优化与迭代:将学习到的奖励函数作为替代目标,采用标准 RL 算法(如 SAC、PPO)更新策略;随后利用新策略生成更优轨迹,再次请求偏好反馈,形成闭环迭代。
医学/神经科学应用场景:脑卒中后上肢康复训练
在首都医科大学神经病学团队主导的脑卒中偏瘫康复研究中,患者的上肢运动功能恢复具有高度个体化特征(如肌痉挛程度、关节活动范围、疼痛阈值)。传统康复机器人依赖固定奖励函数(如“关节角度最大”),常忽略患者主观舒适度与生物力学安全边界。基于偏好强化学习的方案如下:
- 反馈源:治疗师或患者本人通过对比两段康复训练轨迹(如机器人辅助下的肩关节前屈 vs. 外展)标注偏好,反馈包含“舒适度”、“发力感”、“完成度”等主观维度;
- 奖励模型:从偏好中学习针对该患者的多模态奖励函数,同时纳入表面肌电(sEMG)特征作为客观神经电生理约束,确保肌肉协同模式符合康复生理规律;
- 策略输出:智能体在线调整辅助力大小、运动速度和轨迹形态,生成个性化训练方案。临床初步结果显示,该方法可在减少治疗师人工调参的同时,显著提高患者主动参与度与运动恢复速率(Fugl-Meyer 评分提升 15-20%),体现了 PbRL 在神经康复中“以人为核心”的优化优势。
关联词:奖励函数学习、人类反馈、神经康复、个体化治疗