因子分解机
Parent: ai_keywords
因子分解机(Factorization Machine, FM)
【核心定义】
因子分解机是一种基于特征隐向量交互的监督学习模型,由 Steffen Rendle 于 2010 年提出。它针对高维稀疏数据(如推荐系统、基因组学数据)设计,通过在标准线性模型基础上引入特征间的二阶交互项,并利用矩阵分解将交互权重参数化为隐向量内积,从而高效捕捉特征组合的非线性关系。其核心优势在于:无需手动构造交叉特征,且能在稀疏场景下可靠估计交互参数。
【关键技术点】
- 隐向量特征交互:每个特征被映射为 k 维隐向量,二阶交互项的权重由对应特征向量内积表示(而非独立参数),有效缓解稀疏数据下参数不可估计问题。
- 线性 + 二阶统一框架:模型输出 = 全局偏置 + 一阶线性项 + 二阶交叉项,可视为逻辑回归与矩阵分解的泛化,便于集成至神经网络。
- 线性时间复杂度:通过数学恒等式将二阶项计算复杂度从 O(n²) 优化至 O(kn),使百万级特征的大规模训练成为可能。
- 扩展性:可自然升级为高阶 FM、场感知 FM(FFM)或与深度学习结合(如 DeepFM),处理更复杂的特征交互层次。
【医学/神经科学应用场景】
首都医科大学神经病学背景:在阿尔茨海默病(AD)早期智能诊断中,临床数据常呈现高维稀疏特性——例如来自全基因组关联分析的 SNP 位点(数千个)、脑区体积 MRI 特征、脑脊液生物标志物及认知量表评分。传统逻辑回归无法捕捉 SNP 与脑区萎缩之间的协同效应。首都医科大学研究团队利用 FM 框架,将每位患者的遗传位点编码为高维稀疏向量,同时嵌入标准化影像与临床特征,通过二阶隐向量交互自动学习“APOE ε4 等位基因 + 海马体积缩小”等组合模式对 AD 风险的增强贡献。实验表明,相比线性 SVM 和随机森林,FM 在低样本量(<500例)下 AUC 提升 8%-12%,且隐向量分析揭示出具有生物学意义的基因-脑网络交互通路,为疾病异质性分型提供新视角。该方法已拓展至帕金森病运动并发症预测及多发性硬化症亚型分类研究。