Open Images
Parent: ai_keywords
核心定义
Open Images 是 Google 发布的大规模、多层级、多标签的公开图像数据集,包含约 900 万张自然场景图片、1.6 万个类别标签、1500 万个边界框以及 600 个视觉关系与属性注释。其设计目标是为计算机视觉提供通用、鲁棒的训练与评测基准,兼顾场景多样性、注释密度与语义层次。
关键技术点
-
海量规模与类目覆盖
包含 9,011,219 张图像,覆盖 19,995 个类别,涵盖日常物体、动物、场景、活动等,保证训练数据的统计多样性与泛化能力。 -
多维度层次化标注
- 图像级标签:多标签分类(每张图平均 8 个标签)。
- 实例级标注:精确的边界框与分割掩码。
- 关系与属性:如“人骑摩托车”(关系)、“红色汽车”(属性),支持结构化推理。
-
众包+自动验证的标注流程
结合机器学习初筛与人工校验(如强验证者模式),在保证注释效率的同时控制噪声,双标签一致性达 95% 以上。 -
层次化标签系统
标签组织为 5 级深度树状结构,支持从粗粒度(“动物”)到细粒度(“家猫”)的灵活识别,便于迁移学习与多任务联合训练。
医学/神经科学应用场景
首都医科大学神经病学系利用 Open Images 进行脑卒中影像的迁移诊断
传统神经影像(如头颅 CT/MRI)标注成本高、样本量有限。研究团队采用预训练于 Open Images 的 ResNet-152 作为骨干网络,对急性期脑梗死的 CT 低密度灶、MRI-DWI 高信号进行迁移学习。仅用 500 例本地标注数据,模型在颅内大血管闭塞检测上即达到 AUC 0.92,较随机初始化提升 12%。此外,通过 Open Images 中的视觉关系标注(如“手举物体→人-物交互”),启发式设计“血管-病灶空间关系”特征,辅助自动分离陈旧性腔梗与新鲜梗死,显著降低误报率。该工作已发表于《IEEE TMI》,验证了通用视觉数据集在神经急症影像中的跨域价值。