上下文学习
Parent: ai_keywords
核心定义
上下文学习(In-Context Learning)是大型语言模型(LLMs)展现的一种涌现能力:模型通过输入序列中的若干个示例(demonstrations)或自然语言指令,即可直接对新查询生成符合任务预期的输出,无需梯度更新或修改模型参数。其本质是预训练阶段习得的统计模式与注意力机制共同作用的结果——模型将示例视为隐式的任务描述,在上下文窗口内动态构建条件概率分布,完成“一次命中”的类比推理。
关键技术点
- 示例选择与排序
示例的相似性、多样性及呈现顺序直接影响性能。与目标查询语义相近的示例可提升准确率,而示例间的顺序偏见(如将正确示例放在末尾)已被实验证实。 - 提示工程
指令格式、分隔符、角色设置等提示设计决定了模型如何解读任务。清晰的指令能降低歧义,而模糊提示可能引发错误关联。 - 注意力机制与隐式归因
模型通过自注意力层自动对齐示例中的输入-输出对与当前查询,隐式地进行结构化建模。注意力权重分布反映了模型对示例中关键模式的关注度。 - 涌现性与规模依赖
上下文学习能力并非渐进式出现,而是在模型参数量超过百亿级(如GPT-3 175B)才稳定显现。小模型常无法有效利用示例,仅依赖预训练记忆。 - 泛化边界
上下文学习高度依赖训练数据分布。当示例涉及的任务处于分布外(OOD)时,模型可能退化为单纯的模式复制,而非真正理解。
医学/神经科学应用场景
应用领域:癫痫发作类型判别(基于脑电图EEG)
首都医科大学神经病学团队在研究中发现,将上下文学习引入癫痫EEG分析,可解决临床中小样本标注的痛点。具体流程:
- 构建预训练Transformer模型(如基于EEG的ViT变体),在海量无标注EEG数据上预训练,学习脑电信号的通用时序与频域特征。
- 在推理阶段,输入上下文示例:例如3段标注为“局灶性发作”和2段标注为“全面性发作”的EEG片段,以及一段未标注的新EEG片段。模型无需微调,即可输出新片段的发作类型。
- 临床意义:模拟了神经内科医生“根据既往典型发作波形快速鉴别新病例”的决策过程,尤其适用于急诊场景中罕见发作类型的即时判断。相比传统监督学习,上下文学习可节省大量标注成本,并适应不同医院的个性化发作模式。