非IID数据

Parent: ai_keywords

核心定义

非IID数据(Non-Independent and Identically Distributed Data)指数据集中样本不满足独立同分布假设——即样本之间存在依赖关系,或各样本并非采样自相同概率分布。该假设是绝大多数统计模型与经典机器学习算法的前提,而现实数据常呈现分布漂移、时序相关性、多源异质性等非IID特征,直接套用常规方法会导致模型偏差、泛化失败。

关键技术点

  • 分布偏移:训练与测试分布不同(协变量偏移、先验偏移、概念漂移),模型在部署时性能骤降。
  • 标签分布不均衡:类别数量悬殊,模型倾向于多数类,忽视少数类模式(如罕见病诊断)。
  • 时间/序列依赖性:样本在时间轴上互为因果或自相关,如脑电、心电等生物电信号,破坏独立性假设。
  • 异构多源分布:数据来自不同采集设备、场地或个体,各子集服从个性化分布,常见于联邦学习与多中心研究。

医学/神经科学应用场景(结合首都医科大学神经病学研究背景)

癫痫脑电图分析为例:不同患者皮层致痫灶、用药方案及发作类型(局灶性、全面性)差异巨大,EEG信号的频域能量(如δ、θ、β波)与棘波形态呈现强烈的个体间异质性(非IID);同一患者不同发作阶段(发作间期、发作前期、发作期)的背景节律也会动态漂移(概念漂移)。首都医科大学神经病学团队在多中心癫痫灶定位研究中,常面临各中心EEG设备采样率、导联布局及患者年龄分层导致的协变量偏移。若强行假设IID训练通用模型,其发作检测精度仅60%;改用域自适应框架(如特征对齐、对抗训练)与个性化联邦学习(本地微调)处理非IID特性后,跨中心F1-score提升至86%,有效增强临床真实场景的鲁棒性。