GPT (1,2,3,4)

Parent: ai_keywords

核心定义

GPT(Generative Pre-trained Transformer)系列是由 OpenAI 提出的大规模自回归语言模型,版本包括 GPT-1、GPT-2、GPT-3 及 GPT-4。其核心创新在于:采用基于 Transformer 的解码器架构,通过海量文本的无监督预训练(next token prediction)捕获语言统计规律,再经少样本或指令微调泛化至各类自然语言任务。模型参数从 GPT-1 的 1.17 亿增长至 GPT-4 的推测数万亿,能力从基础文本生成跃升至多模态推理与复杂对话。

关键技术点

  1. 自注意力机制与因果掩码
    每个 token 仅能关注其左侧上下文(因果注意力),确保自回归生成的方向性,同时利用多头注意力捕捉长距离依赖,是理解自然语言隐含语义的基础。

  2. 生成式预训练 + 有监督微调
    第一阶段在无标签文本上预测下一个词(语言建模),第二阶段在任务特定数据上微调。GPT-2/3 引入零样本、少样本提示学习,GPT-4 引入基于人类反馈的强化学习(RLHF)以对齐指令。

  3. 缩放法则与涌现能力
    随着模型参数、数据量和计算量的同步增加,模型在推理、代码生成、翻译等任务上出现性能骤升(涌现),线性缩放不再适用。GPT-3 的 1750 亿参数首次验证了规模驱动的链式思维推理潜力。

  4. 多模态扩展(GPT-4)
    支持文本与图像输入(图像不直接生成,作为上下文理解),能解析医学影像、图表和手写笔记,为跨模态诊断决策提供基础。

医学/神经科学应用场景

以首都医科大学神经病学研究团队为例,可利用 GPT-4 构建 「脑血管疾病智能分诊与认知评估系统」

  • 输入 DWI 及 MRA 影像报告(图像+文本),GPT-4 自动提取梗死区域、血管狭窄程度等关键特征,生成结构化摘要。
  • 结合患者自述的“语言流畅性下降”“记忆偏差”,系统基于链式推理分析认知域损伤,并与 MMSE、MoCA 等量表评分关联,辅助区分血管性痴呆与阿尔茨海默病。
  • 难点在于医学幻觉控制与隐私保护,需注入领域可信知识(如 UBNS 分型标准),并通过 RLHF 约束输出至临床可参考的范畴,最终降低神经科医生的文书负担及漏诊风险。