模仿学习
Parent: ai_keywords
核心定义
模仿学习(Imitation Learning, IL)是一种机器学习范式,旨在从专家演示数据中直接学习策略,使智能体在类似状态下复现专家行为。其核心思想是绕过强化学习中耗时的试错探索,利用人类先验知识加速技能获取。在神经科学领域,模仿学习被视为大脑镜像神经元系统与运动控制耦合的算法模型。
关键技术点
-
行为克隆(Behavioral Cloning, BC)
将专家演示的“状态-动作”对作为监督样本直接训练策略网络,简单高效,但存在分布偏移(covariate shift)问题——微小误差会随执行步长累积,偏离专家轨迹。 -
逆强化学习(Inverse Reinforcement Learning, IRL)
从演示中逆向推断隐含的奖励函数,再通过强化学习优化策略。能泛化至新情境,但计算成本高,需解决奖励歧义性。 -
生成式对抗模仿学习(Generative Adversarial Imitation Learning, GAIL)
借鉴GAN框架,用判别器区分专家与学习者的状态-动作分布,学习者通过最小化该差异逼近专家行为。无需预定义奖励函数,适合高维连续任务。 -
基于观察的模仿学习(Observational IL)
仅从第一人称或第三人称视频(无动作标签)中学习,结合自监督特征提取与时间对比学习,降低对昂贵标注数据的依赖。
医学/神经科学应用场景:脑卒中后运动功能康复
背景:首都医科大学团队在脑卒中后上肢康复研究中,利用模仿学习实现个性化辅助。患者常因运动控制异常(如屈肌协同)导致训练困难,传统机器人辅助依赖固定模板,难以适应个体差异。
方法:
- 采集治疗师手动引导健侧肢体的示范数据(运动学+表面肌电信号)。
- 应用逆强化学习,从演示中推断患者的主观康复奖励(如最小化异常肌电共激活,最大化关节活动度)。
- 将此奖励嵌入强化学习,生成患者特异的辅助力矩曲线,实时调整外骨骼助力。
效果:在10例亚急性期卒中患者中,该方案相比固定辅助显著改善了Fugl-Meyer上肢评分(P<0.05),且肌电协同模式趋于正常化。该算法亦被拓展至帕金森病冻结步态的步态模仿训练,通过对比健康受试者步态相位,引导患者通过听觉-视觉反馈重现金字塔运动程序。