生成式预训练Transformer (GPT)

Parent: ai_keywords

生成式预训练Transformer (GPT)

核心定义

生成式预训练Transformer(Generative Pre‑trained Transformer,GPT)是一种基于自注意力机制的深度自回归语言模型,通过大规模无监督文本预训练与有监督微调,实现上下文感知的文本生成、推理与理解。其核心架构抛弃循环神经网络,完全依赖Transformer解码器堆叠,以单向(从左至右)方式逐词预测下一个token,从而捕获长距离语义依赖。

关键技术点

  1. 自注意力机制:通过Query-Key-Value计算,使模型在处理每个词时能动态关注序列中所有位置,捕捉跨层级依赖,解决传统RNN长程遗忘问题。
  2. 无监督预训练 + 有监督微调:先在海量互联网语料上学习通用语言表征(如Next Token Prediction任务),再针对特定下游任务(分类、问答、生成)进行小规模参数调整,极大降低对标注数据的依赖。
  3. 自回归生成范式:生成时模型将已输出序列作为下一步输入,每次迭代仅预测一个token,并通过概率采样或束搜索产生连贯文本。此范式天然适用于时序数据建模。
  4. 模型规模与涌现能力:随着参数(超千亿)与训练数据量的增加,GPT展现出零样本/少样本学习、逻辑推理、代码生成等涌现能力,这是小模型所不具备的。

医学/神经科学应用场景

以首都医科大学神经病学研究所关注的急性脑卒中为例,GPT可整合多模态临床文本数据(急诊病历、影像报告、出院小结)实现自动分层与预后预测。具体而言:

  • 病历实体提取与推理:微调的GPT可从非结构化笔记中抽取NIHSS评分、发病时间、溶栓禁忌症等关键信息,并生成结构化的卒中亚型(如大动脉粥样硬化型)推理摘要。
  • 动态病程生成:结合神经电生理(如脑电图)文本报告,GPT能基于时间序列预测病程演变趋势,辅助医生早期识别恶化的皮层扩散去极化事件。
  • 临床决策辅助:针对静脉溶栓后出血转化风险,GPT可在读取患者既往抗凝药史、血压波动及影像特征后,以自然语言输出个体化风险分层及推荐监测频率,提升神经重症决策效率。

该应用充分发挥GPT的生成与理解双向优势,将非结构化临床数据转化为可操作的智能辅助,契合循证神经科学对实时、精准信息的需求。