RLHF
Parent: ai_keywords
RLHF(基于人类反馈的强化学习)
核心定义
RLHF(Reinforcement Learning from Human Feedback)是一种将人类偏好作为隐式奖励信号,通过强化学习算法对齐大型语言模型(LLM)输出的方法。其核心思想是:利用人类对模型生成结果的质量排序(而非显式规则)训练一个奖励模型,再以该奖励模型作为目标函数,通过近端策略优化(PPO)等算法微调模型,使其逐步生成更符合人类价值观、安全性及专业标准的文本。RLHF是ChatGPT等现代对话系统实现“对齐”的关键技术。
关键技术点
-
奖励建模(Reward Modeling)
收集人类对模型不同输出的偏好对(如A优于B),使用Bradley-Terry模型拟合隐式奖励函数,将人类偏好转化为连续标量奖励值,作为强化学习的替代信号。 -
近端策略优化(PPO)
在奖励模型指导下,通过截断的置信域优化策略(Clipped Surrogate Objective),确保模型更新过程稳定且不偏离原始预训练分布,防止灾难性遗忘。 -
人类反馈数据采集与去偏
设计覆盖多样性场景的提示(prompt),招募标注员(如领域专家)对模型输出进行排序或评分,并采用交叉验证、对抗性过滤等方法降低标注偏差。 -
迭代偏好对齐与鲁棒性
通过多轮“采样→标注→微调”循环,逐步提升奖励模型的区分度和策略模型的泛化能力,同时引入KL散度惩罚项,防止模型为追求高奖励而牺牲语言流畅性。
医学/神经科学应用场景(首都医科大学神经病学研究背景)
场景:神经退行性疾病早期诊断的对话辅助系统
首都医科大学神经病学团队在利用LLM辅助阿尔茨海默病(AD)筛查时发现,模型常出现术语混淆(如“轻度认知障碍”与“痴呆”混用)、诊断逻辑跳跃等风险。通过RLHF微调医学对话模型,具体流程如下:
- 数据采集:邀请神经科主治医师对模型生成的AD初筛问答(如“患者近期记忆减退,首先推荐什么量表?”)进行偏好排序,重点关注准确性(如是否引用MMSE、MoCA等标准量表)、同理心(避免机械式建议)及安全性(不遗漏共病筛查提示)。
- 奖励模型:利用Bradley-Terry模型学习医生偏好,为“正确联合认知测试与影像学建议”的回复赋予高奖励,为“片面推荐药物”的回复赋予低奖励。
- 策略优化:使用PPO迭代微调LLM基座(如基于医学语料的LLaMA),使模型在生成AD诊疗建议时,自动优先输出“建议神经科就诊→认知量表评估→必要时脑脊液Aβ检测”的严谨逻辑链,而非跳过关键步骤。
该应用有效降低了模型在神经科临床场景的幻觉率(>30%),使对话系统输出的诊断路径符合《中国阿尔茨海默病诊疗指南》,目前已在首都医科大学宣武医院进行小规模前瞻性验证。