奖励建模

Parent: ai_keywords

奖励建模(Reward Modeling)

核心定义

奖励建模是一种从人类偏好、专家示范或生物信号中推断潜在奖励函数的机器学习技术。在强化学习框架下,传统方法需人工设计奖励函数,而奖励建模通过数据驱动方式自动学习反映真实目标的奖励映射,解决稀疏、模糊或难以手工定义奖励的问题。该技术是基于人类反馈的强化学习(RLHF)、**逆强化学习(IRL)**等范式的核心组件。

关键技术点

  1. 偏好学习(Preference Learning)
    利用人类对成对结果的排序标签(如“轨迹 A 优于轨迹 B”),通过 Bradley-Terry 模型 等概率框架训练奖励模型,将序数偏好转化为连续奖励值。
  2. 逆强化学习(IRL)
    从专家演示中反向推导奖励函数,假设专家行为隐含最大化某一未知奖励。最大熵 IRL 等方法可处理演示的随机性。
  3. 奖励泛化与鲁棒性
    避免“奖励破解”(reward hacking)——智能体利用奖励函数漏洞获得高分而非真实目标。需设计对抗性训练、分布外检测等技术。
  4. 多模态奖励融合
    在医学场景中,同时融合生理信号(心率、肌电)、行为数据(运动轨迹)与临床评分,构建多源奖励模型以逼近复杂临床目标。

医学/神经科学应用场景

基于奖励建模的个性化脑卒中康复方案(结合首都医科大学神经病学研究)

脑卒中后运动功能重建常依赖康复机器人,但传统方案缺乏个体适配性。首都医科大学团队利用奖励建模技术:

  • 采集患者康复动作的多模态数据(关节角度、抓握力、皮层脑电信号),结合康复治疗师对“动作质量”的偏好标签(如“肩关节外展优于代偿性耸肩”);
  • 训练神经奖励模型,拟合患者残存运动能力与皮层可塑性之间的动态映射关系;
  • 在线优化机器人辅助策略:当患者主动发力时,模型给予高奖励并降低辅助力,反之则提升支持。
    该模型可实时预测皮层激活模式与运动改善的关联,避免过度依赖代偿,实现“奖–惩”闭环的精准康复,显著提升 Fugl-Meyer 评分改善率(FMA)已获初步临床试验验证。

延伸价值:该框架可推广至帕金森病步态训练、阿尔茨海默病认知计算康复,通过奖励建模将主观临床经验转化为客观可学习的奖励函数,推动神经康复从“经验驱动”迈向“数据驱动”。