Mask R-CNN

Parent: ai_keywords

## Mask R-CNN

### 【核心定义】

Mask R-CNN(Mask Region-based Convolutional Neural Network)是何恺明团队于2017年提出的实例分割(Instance Segmentation)框架。它在Faster R-CNN目标检测的基础上,并行增加了一个**掩膜预测分支**,从而能够同时输出图像中每个目标的边界框、类别标签和像素级精确分割掩膜。该模型是计算机视觉领域从“目标检测”迈向“像素级理解”的里程碑。

---

### 【关键技术点】

1. **ROI Align(兴趣区域对齐)**  
   针对Faster R-CNN中ROI Pooling的两次量化导致像素偏移问题,Mask R-CNN采用双线性插值实现浮点数精度的特征采样,确保分割掩膜的空间分辨率与原始图像对齐,显著提升小目标分割精度。

2. **多任务联合训练**  
   损失函数由三部分构成:分类损失(`L_cls`)、边界框回归损失(`L_box`)和二进制掩膜损失(`L_mask`)。掩膜分支对每个类别独立输出一个二值掩膜,通过逐像素Sigmoid二值交叉熵进行优化,避免了类别间的竞争。

3. **特征金字塔网络(FPN)**  
   作为骨干网络,FPN通过自顶向下路径和横向连接融合多尺度特征,使Mask R-CNN能同时检测大、中、小目标,对医学影像中大小不一的病灶(如微出血点与大面积梗死)具有鲁棒性。

4. **解耦掩膜预测**  
   掩膜分支与检测分支独立并行,且与类别无关(仅预测像素是否属于目标),从而避免了检测错误对分割的传导影响。

---

### 【医学/神经科学应用场景:脑卒中病灶的自动分割与量化】

在首都医科大学神经病学研究中,Mask R-CNN可用于**急性缺血性脑卒中CT/MRI影像的梗死灶与出血灶的实例分割**。传统人工勾画耗时且主观性强,而该模型能:

- **自动识别并勾勒每个病灶的精确边界**,同时输出其体积、位置及与关键功能区(如基底节、内囊)的空间关系;
- **对多发性腔隙性梗死或微出血点进行逐个分割**,支持病灶计数与负荷评估;
- **结合时间序列影像(如DWI与ADC图)**,动态监测梗死核心区与半暗带的变化,辅助溶栓或取栓决策。

该技术在首都医科大学宣武医院等机构的初步验证中,分割Dice系数可达0.85-0.92,显著降低医生阅片负担,推动神经影像学诊断的智能化与标准化。