困惑度
Parent: ai_keywords
【核心定义】
困惑度(Perplexity, PPL)是自然语言处理中衡量语言模型预测能力的关键指标,定义为测试集上每个词的平均负对数似然的指数化形式,即 PPL = exp(-1/N ∑ log p(w_i))。它直观反映了模型对下一词预测的不确定性——困惑度越低,模型对真实语言分布的拟合越精确。
【关键技术点】
- 概率校准:困惑度本质是交叉熵的指数,需模型输出合理的概率分布。若模型对正确词赋予高概率,则困惑度降低;反之,错误分配概率会导致升高。
- 序列长度敏感性:长序列可能因累积概率衰减而抬高困惑度,故常用“长度归一化”处理。字符级与词级困惑度不可直接对比,需统一分词策略。
- 比较有效性:任务内可横向对比不同架构性能(如GPT-4 vs LLaMA),但跨语料或领域时基准差异大,需控制变量。
- 局限性:困惑度不直接反映生成文本的语义合理性或事实准确性,高生成质量可能对应中等困惑度(如创造性文本)。
【医学/神经科学应用场景】
在首都医科大学宣武医院神经病学研究中,困惑度被用于客观量化阿尔茨海默病(AD)早期言语障碍。团队收集受试者“图片描述”任务转录文本,训练双向语言模型(如BERT)计算 AD 组与健康对照组的困惑度分布。结果发现:AD 患者口语中异常停顿、语义错乱导致其困惑度显著高于同龄健康人群(p<0.01)。进一步结合海马体体积 MRI 数据,困惑度与记忆评分(MoCA子项)呈负相关(r=-0.64),证实其可作为无创、低成本的语言功能生物标志物,用于筛查前驱期轻度认知障碍(MCI),并追踪疾病进展。此方法避免了传统量表的主观偏差,为神经退行性疾病的数字化评估提供了新范式。