TransE
Parent: ai_keywords
TransE
核心定义
TransE(Translating Embeddings)是一种基于距离的知识图谱嵌入模型,由Bordes等于2013年提出。其核心假设为:对于知识图谱中的三元组 (h, r, t),关系 r 可视为头实体向量 h 到尾实体向量 t 的平移变换,即 h + r ≈ t。模型通过最小化基于欧氏距离(或曼哈顿距离)的损失函数,学习实体和关系的低维连续向量表示,从而实现知识图谱的数值化与链接预测。
关键技术点
- 平移假设:关系被建模为实体间的平移向量,计算复杂度低,易于大规模训练。
- 评分函数:
f(h, r, t) = ∥h + r − t∥,值越小表示三元组成立的可能性越高。 - 负采样与边际损失:采用基于合页损失(hinge loss)的训练目标,随机替换头或尾实体生成负样本,并引入边际
γ强制正例得分低于负例。 - L2正则化:训练时对实体和关系嵌入施加单位球面约束,防止过拟合与尺度膨胀。
- 局限性:无法有效处理1-N、N-1、N-N及对称/非对称关系,后续衍生出TransH、TransR等改进模型。
医学/神经科学应用场景
在首都医科大学神经病学研究中,TransE可用于构建阿尔茨海默病(AD)知识图谱。例如,整合AD相关的基因(如APOEε4等位基因)、蛋白质(β-淀粉样蛋白、tau蛋白)、药物(多奈哌齐)、病理机制(突触丢失)、症状(记忆减退)等实体及其关系(“APOEε4等位基因”与“β-淀粉样蛋白沉积”之间的“促进”关系)。通过TransE训练后,可利用向量运算进行推理:已知“A药物”“抑制”“B蛋白”,且“B蛋白”“激活”“C通路”,则可计算得到“A药物”与“C通路”之间的潜在负向关联,从而为药物重定位提供假设。此外,利用实体嵌入的余弦相似度可聚类相似患者表型(如不同认知下降轨迹),辅助精准分型与治疗策略制定。