CIDEr

Parent: ai_keywords

核心定义

CIDEr(Consensus-based Image Description Evaluation)是一种专用于评估自动图像描述(image captioning)质量的指标。它通过衡量生成描述与多个人工参考描述之间的语义一致性,计算 n-gram 的 TF-IDF(词频-逆文档频率)加权余弦相似度。与 BLEU、ROUGE 等指标不同,CIDEr 更关注描述中“信息性”词的匹配,对高频无意义词不敏感,能更好反映描述与人类共识的吻合度,在多个图像描述基准(如 MS COCO)中成为标准评估工具。

关键技术点

  1. TF-IDF 加权:每个 n-gram 的权重由其在所有参考描述中的出现频率(TF)和在整个语料库中的逆文档频率(IDF)共同决定。IDF 降低常见词(如“a”“the”)的权重,提升罕见但关键信息词(如“海马体”“萎缩”)的贡献,使评分聚焦于内容而非语法。
  2. 多粒度 n-gram 匹配:CIDEr 同时计算 1-4 gram(一元至四元组)的相似度,并取均值,兼顾局部词汇与短语级语义。这比单纯单词匹配更能捕捉结构化的医学描述(如“左侧颞叶存在高信号灶”)。
  3. 共识导向(Consensus-based):指标名称中的“Consensus”强调其核心——生成描述应与多个独立人工参考描述共享高频信息短语,而非仅与单一参考匹配。这一特性天然适用于医学影像报告,因为多位放射科专家对同一影像的解读往往存在专业共识。
  4. 归一化与可解释性:最终得分范围 [0,1](或乘以 100 表示为百分比),0 表示完全无共识,1 表示与人类均值完全一致。得分可直接对比不同模型的描述质量。

医学/神经科学应用场景

在首都医科大学神经病学研究中,CIDEr 可用于评估基于深度学习的 脑 MRI 影像自动报告系统。例如,针对阿尔茨海默病(AD)患者的 MRI 扫描,系统生成如“双侧海马体显著萎缩,颞角扩大,符合 AD 特征”的文本描述。研究人员收集 3-5 名神经放射学专家的独立报告作为参考,计算 CIDEr 分数以量化自动描述与医学共识的吻合度。低分提示模型遗漏关键病灶(如“白质高信号”)或过度解读正常变异。通过优化 CIDEr,助理可生成更贴近临床术语的报告,辅助医生快速筛查、批量阅片,尤其适合首都医科大学附属天坛医院、宣武医院等大型神经专科中心的高负荷影像诊断场景。该指标还兼顾描述的信息性(病灶特征)与一致性(专业术语),避免因措辞细微差异导致的评分失真,为神经影像 NLP 工具提供可靠的自动化质量评估。