从人类反馈中强化学习 (RLHF)

Parent: ai_keywords

核心定义

从人类反馈中强化学习(Reinforcement Learning from Human Feedback, RLHF)是一种将人类主观偏好转化为学习信号的强化学习范式。它通过收集人类对模型输出的比较/评分数据,训练一个奖励模型来近似人类意图,进而指导策略网络(如语言模型、决策系统)优化,从而解决传统RL中奖励函数难以手工定义的复杂问题(如对话生成、医疗决策)。


关键技术点

  1. 偏好数据收集
    人类标注者在模型生成的多个候选输出中(如治疗方案、对话回复)进行成对比较或排序,形成偏好标签。数据需覆盖多维度(有效性、安全性、自然度等),避免单一偏好偏差。

  2. 奖励模型训练
    将人类偏好转化为监督信号:以排序对为输入,训练一个二分类/回归模型(如Transformer)输出归一化奖励值。常用损失函数为Bradley-Terry模型或Plackett-Luce排序模型。

  3. 策略优化(PPO微调)
    利用奖励模型给出的即时奖励,通过近端策略优化(PPO) 更新策略网络。需引入KL散度惩罚项,防止策略偏离原始预训练分布过多(避免“奖励黑客”)。

  4. 迭代对齐循环
    初始策略 → 采样 → 人类反馈 → 更新奖励模型 → 改进策略 → 重新采样。通过多轮迭代使策略逐渐对齐复杂的人类价值观(如伦理、隐私)。


医学/神经科学应用场景:帕金森病脑深部电刺激(DBS)参数优化

背景:DBS通过植入电极向丘脑底核或苍白球施加电刺激,缓解帕金森病运动症状。但参数(频率、脉宽、电压)需由神经内科医生(如首都医科大学宣武医院团队)根据患者反馈反复调整,耗时且依赖经验。
RLHF落地

  • 奖励模型:训练模型学习患者对症状改善(如震颤减轻、步态流畅)和副作用(构音障碍、异动症)的主观评分
  • 策略网络:输入患者基线脑电(如β频段功率异常)和运动学数据(可穿戴传感器),输出候选参数组合。
  • 人类反馈:患者通过App标记每轮刺激效果(1~5分),奖励模型据此自适应调整参数探索方向
  • 优势:实现个性化闭环刺激——RLHF能自动平衡症状控制与副作用,在数小时内替代数周的临床试错,尤其适用于晚期帕金森病药物疗效衰竭的患者。

注:此方向与首都医科大学宣武医院王玉平教授团队(神经电生理与DBS研究)高度关联。