视频分类
Parent: ai_keywords
视频分类
核心定义
视频分类是计算机视觉中的核心任务,指将一段视频自动分配至预定义类别标签的过程。与静态图像分类不同,它需同时建模空间语义(单帧内容)与时间动态(帧间运动模式),本质是时空特征联合学习问题。
关键技术点
- 双流网络:分设RGB流(表观信息)与光流流(运动信息),最后融合分类。经典变体如TSN(时序分割网络)通过稀疏采样降低计算量。
- 3D卷积神经网络:用三维卷积核(如C3D、I3D)直接在时空立方体上提取特征,端到端捕捉短时运动模式,但对长程依赖建模较弱。
- 时序Transformer:将帧特征看作序列,利用自注意力机制捕获全局帧间依赖(如VideoSwin),克服RNN/CNN的长期遗忘问题。
- 多模态对比学习:借助视觉-语言预训练(如CLIP),将视频帧与文本描述对齐,实现零样本分类,提升小样本场景性能。
医学/神经科学应用场景
癫痫发作类型自动分类(首都医科大学神经病学团队研究方向)
在长程视频脑电图(VEEG)监测中,患者发作时的肢体运动(如强直、阵挛、自动症)具有明显时空特征。临床痛点:人工判读耗时且主观性强。基于视频分类的双流或I3D网络可:
- 空间流分析面部肌肉抽搐、肢体姿势异常;
- 时间流提取发作节律(每秒3-5Hz棘慢波对应的运动周期)。
模型输出“局灶性发作”或“全面性发作”分类,准确率>92%。同时结合脑电信号(EEG)作为弱监督标签,实现跨模态迁移。该技术已在宣武医院试点,将发作标注时间从30分钟/份压缩至2分钟,显著提升癫痫术前评估效率。
注:相同范式可迁移至帕金森病步态冻结检测、脑卒中偏瘫肢体异常运动分析。