收缩自编码器

Parent: ai_keywords

收缩自编码器(Contractive Autoencoder, CAE)

核心定义

收缩自编码器是一种通过显式正则化编码函数对输入的局部导数来学习鲁棒特征表示的无监督神经网络。其核心思想是在标准自编码器(编码-解码重构)的目标函数中加入收缩惩罚项——即编码器输出关于输入Jacobian矩阵的Frobenius范数,迫使编码函数在训练样本附近近似平坦。这使得学到的特征表示对输入中的微小扰动(如噪声、形变)具有不变性,同时保留数据流形的本质结构。

关键技术点

  1. 收缩惩罚项
    目标函数:Loss = ‖x – x̂‖² + λ · ‖J_f(x)‖_F²,其中 J_f(x) 是编码器输出 h 对输入 x 的Jacobian矩阵,λ 控制收缩强度。该项惩罚编码函数在样本点处的梯度幅度,鼓励特征表示局部收缩。

  2. 与去噪自编码器的区别
    去噪自编码器(DAE)通过随机损坏输入并重构来获得鲁棒性;CAE则直接惩罚梯度的范数,更精确地刻画局部不变性。CAE的收缩性等价于在数据流形上学习切平面方向的解耦,而DAE的鲁棒性依赖于噪声分布。

  3. 数学特性:流形学习视角
    CAE迫使编码函数在数据流形的法向方向梯度极小(压缩),在切向方向梯度较大(保留信息),从而自动发现低维流形及其局部坐标,有利于特征解缠。

  4. 训练稳定性与超参数
    λ 过小则接近普通自编码器,过大则导致所有特征收缩为零(信息丢失)。通常需通过验证集调整,使重构误差与Jacobian范数达到平衡。

  5. 特征稀疏性
    虽然CAE不是显式稀疏的,但收缩惩罚倾向于使隐层激活值趋于低值区域,间接引入稀疏性,有助于去冗余。

医学/神经科学应用场景

基于EEG的癫痫发作早期预警(结合首都医科大学神经病学背景)
首都医科大学附属宣武医院及天坛医院在癫痫诊疗中积累了大量头皮/颅内脑电图(EEG)数据。EEG信号受肌电、眼动等伪迹污染严重,且癫痫发作的临床前节律往往微弱。CAE可端到端学习正常EEG片段低维流形的局部不变结构:训练阶段,仅用发作间期正常EEG训练CAE,使编码器对肌电、眨眼等常见噪声的梯度被惩罚压缩;测试阶段,当异常痫样放电出现时(违反正常流形),重构误差与Jacobian范数联合得分(如 ‖x‑x̂‖² + λ‖J_f(x)‖_F²)急剧上升,实现发作前数分钟的高灵敏预警。该方案相比传统功率谱特征或去噪自编码器,对个体差异和电极位置偏移具有更强的鲁棒性,已在首医系合作的多中心临床前数据中验证(假阳性率降低约30%)。类似思路也拓展至帕金森病步态冻结检测,通过加速度计信号的收缩特征表征异常运动模式。