句子嵌入
Parent: ai_keywords
句子嵌入(Sentence Embedding)
核心定义
句子嵌入是将自然语言句子映射为固定维度稠密向量(如768维)的表示技术。该向量编码句子的整体语义与句法信息,使得语义相似的句子在向量空间中距离相近,是自然语言处理(NLP)中词嵌入的扩展,也是文本匹配、聚类、检索等下游任务的基础。
关键技术点
-
基于Transformer的编码架构
- 以BERT、RoBERTa等预训练模型为骨干,通过双向注意力机制捕获长程依赖。常用池化策略(如CLS向量、均值池化)获得句子级表示。
-
对比学习(Contrastive Learning)
- 如SimCSE、ConSERT,通过构造正负样本对(同一句子的不同Dropout变体为正例,批次内其他句子为负例),最大化正例相似度、最小化负例相似度,提升嵌入的判别能力。
-
多任务微调与领域自适应
- 在通用语料预训练基础上,针对特定领域(如医学文本)使用监督信号(分类、自然语言推理)进行微调,使嵌入更贴合专业语境。
-
高效池化与归一化
- 均值池化(Mean Pooling)或CLS向量加上
[SEP]注意力掩码,配合L2归一化(余弦相似度)确保向量模长统一,提升检索稳定性。
- 均值池化(Mean Pooling)或CLS向量加上
【医学/神经科学应用场景】
场景:基于句子嵌入的神经退行性疾病早期语言标志物挖掘
背景:首都医科大学宣武医院神经内科(国家神经疾病医学中心)在阿尔茨海默病(AD)临床队列中积累了海量结构化病程记录与患者自由对话录音(经语音转写)。语言功能下降是AD早期核心征象,但传统量表评估主观性强、耗时。
方法:
- 将患者每隔3个月随访的“自发言语”(如描述图片内容、回忆事件)切分为句子,通过Sentence-BERT(医学领域微调版)嵌入为高维向量。
- 利用对比学习构建健康对照组与AD组的句子嵌入空间,计算各句子向量与“正常衰老参考簇”的余弦距离,量化语言退化程度。
- 结合时序模型(如LSTM)分析嵌入轨迹,预测从轻度认知障碍(MCI)向AD转化的风险。
价值:自动提取客观、可量化的语义连贯性与信息密度特征,辅助临床早期筛查与疗效评估,减少对昂贵生物标志物的依赖。