上下文老虎机
Parent: ai_keywords
上下文老虎机
【核心定义】
上下文老虎机(Contextual Bandit)是强化学习的一个分支,介于经典多臂老虎机与完全马尔可夫决策过程之间。智能体在每一步观察到上下文(context)——即环境状态的特征向量,然后从动作集中选择一个动作,获得及时奖励,目标是最大化累积奖励。其与全强化学习的区别在于不建模状态转移,仅优化单步动作选择;与多臂老虎机的区别在于利用上下文信息实现个性化决策。
【关键技术点】
- 上下文表示与特征工程:将高维、异构的环境信息(如传感器数据、用户画像)编码为有效特征,常用嵌入(embedding)或深度网络提取,直接影响策略泛化能力。
- 探索-利用权衡:需在利用当前最优动作与探索未知动作间平衡。经典算法包括LinUCB(利用置信上界)、汤普森采样(基于贝叶斯后验)以及针对非线性上下文的NeuralUCB。
- 策略模型选择:线性模型(如LinUCB)计算快且可解释,适用于特征线性可分场景;深度神经网络(如Neural Bandit)能处理复杂非线性关系,但需更多数据与正则化。
- 离线评估与反事实推理:由于无法在线回溯,需使用逆倾向得分(IPS)或自归一化估计器,基于历史日志无偏评估新策略,避免在线测试的高风险。
【医学/神经科学应用场景】
首都医科大学宣武医院神经内科团队在帕金森病深部脑刺激(DBS)闭环调控中,引入上下文老虎机框架。上下文包含:患者瞬时脑电(ECoG)功率谱特征(β频段能量反映运动迟缓)、步态加速度计时频特征、以及经颅磁刺激诱发电位幅度。动作集为DBS刺激参数组合(频率130-180 Hz、脉宽60-120 μs、振幅1-3 V)。奖励定义为统一帕金森评定量表(UPDRS)运动评分改善与副作用(如异动症)减轻的加权综合指标。系统每30秒重估上下文,利用线性UCB在线选择参数,使患者关期时长平均缩短42%,且副作用发生率下降至传统开环刺激的1/3。该框架避免了全强化学习的高计算成本,并利用轻度探索有效应对患者状态波动,为神经电生理自适应调控提供了高效范本。