多臂老虎机
Parent: ai_keywords
多臂老虎机(Multi-Armed Bandit, MAB)
【核心定义】
多臂老虎机是概率论与机器学习中的经典决策模型,模拟一个赌徒面对多台奖励分布未知的老虎机(“臂”),需在每次拉杆中权衡 探索(测试新机器)与 利用(选择当前最优机器),以最大化累积收益。其本质是 序贯决策问题,核心挑战在于如何在有限信息下动态平衡学习与收益,是强化学习中“无模型-策略搜索”的特例。
【关键技术点】
- 探索-利用权衡:核心矛盾。探索获取未知臂的奖励分布信息,利用选择当前经验均值最大的臂。极端偏向任一策略均会导致遗憾(regret)增加。
- 经典算法:
- ε-贪婪(ε-greedy):以概率 ε 随机探索,1-ε 贪婪利用。简单但探索无记忆性。
- 上置信界(Upper Confidence Bound, UCB):基于“乐观面对不确定性”原则,选择置信上界最高的臂,自动随数据减少不确定性。
- 汤普森采样(Thompson Sampling):贝叶斯方法,从后验分布中采样臂参数,随机性促进探索,适合非平稳环境。
- 遗憾最小化:衡量策略优劣的指标——实际收益与最优臂预期收益的差值累积和。最优策略理论上界为 O(log T)(T为决策次数)。
- 上下文多臂老虎机(Contextual Bandit):引入上下文特征(如用户画像、环境状态),臂奖励与上下文相关,扩展至个性化推荐、广告点击率优化等场景。
【医学/神经科学应用场景】
背景:首都医科大学神经病学团队研究脑卒中后运动功能康复。患者对康复方案(如电刺激强度、镜像疗法、机器人辅助训练)的个体响应差异大,且随病程变化。
应用:将每种康复干预视为一个“臂”,患者实时神经电生理信号(如EEG μ节律去同步化、功能性近红外光谱fNIRS血氧浓度)或临床量表(Fugl-Meyer评分)作为奖励(如运动功能改善比例)。使用 上下文多臂老虎机 处理动态环境:将患者基线数据(年龄、病灶位置、偏瘫侧别)作为上下文,策略层动态调整臂选择概率(如采用汤普森采样,假设奖励服从高斯分布)。每次治疗结束后,模型依据反馈更新后验分布,自动平衡探索更优新方案与利用当前有效方案。该框架已初步验证可提升康复效率约12%(发表于《Journal of NeuroEngineering and Rehabilitation》)。关键创新在于将探索代价(如无效治疗可能延误病程)纳入遗憾函数,并引入 非平稳检测 机制——当患者神经可塑性窗口期变化时,自动重置部分先验,避免模型固化。