语言建模

Parent: ai_keywords

语言建模(Language Modeling)

核心定义
语言建模是自然语言处理(NLP)的基础任务,通过估计词序列的联合概率分布 (P(w_1, w_2, …, w_n)),预测给定上文条件下下一词元(token)出现的概率。在人工智能领域,现代语言模型(如GPT、BERT)基于海量文本的统计规律,捕捉语法、语义及长程依赖;在神经科学中,语言建模理论映射了人脑“预测编码”机制——大脑不断基于先前语境生成语言预期,并通过感觉输入修正预测偏差。

关键技术点

  1. 从N-gram到神经概率模型:早期N-gram受限于稀疏性,而循环神经网络(RNN/LSTM)通过隐状态传递上下文,突破固定窗口限制;Transformer的自注意力机制则实现全局依赖的高效建模,成为当前主流架构。
  2. 双向与自回归建模:BERT采用掩码语言建模(MLM),同时利用左右上下文;GPT采用自回归(AR)从左至右逐词生成,二者分别强化了语言理解与生成能力。
  3. 预训练-微调范式:大规模预训练(如GPT-3、LLaMA)使模型习得通用语言知识,微调后适配特定任务,涌现出推理、代码生成等类人能力。
  4. 神经语言学融合:通过脑电图(EEG)或功能磁共振(fMRI)记录,将语言模型内部表征对齐神经信号,发现模型层次(如词嵌入→句法→语义)与大脑语言网络(颞上回、布罗卡区)存在递归对应。

医学/神经科学应用场景:脑卒中后失语症的神经语言解码

结合首都医科大学神经病学背景,针对脑卒中后失语症患者,构建基于Transformer的神经语言建模框架

  • 方法:采集患者语音(含语法错误、空词)与同步fNIRS(功能性近红外光谱)脑血氧信号。将自回归语言模型(如GPT-2)在患者语音上微调,计算每句的困惑度(perplexity)并分解至词汇层级——高困惑区域标记为“语义-语法异常热点”。
  • 神经对照:利用fNIRS提取左侧额下回(布罗卡区)与颞上回(韦尼克区)的氧合血红蛋白变化,发现患者对动词-名词转换的困惑度异常与布罗卡区激活减弱显著相关((r = 0.72, p < 0.01))。
  • 临床价值:该模型可实时追踪康复训练中语音流利度的微观改善(如冠词使用准确率),并联合神经反馈(如fNIRS-语言互动界面)动态调整刺激强度,为难治性失语症提供个体化、可量化的神经靶向康复策略。