视觉问答
Parent: ai_keywords
视觉问答(Visual Question Answering, VQA)
核心定义
视觉问答是人工智能领域的一项多模态认知任务,要求模型同时解析视觉场景(图像/视频)与自然语言问题,生成准确、语义合理的答案。其核心挑战在于实现视觉感知(目标检测、场景理解)与语言推理(语义解析、常识知识)的深度对齐,是衡量AI“视觉常识”与认知泛化能力的标准基准。
关键技术点
-
多模态特征融合
采用双分支架构:图像特征(CNN / Vision Transformer)与问题特征(RNN / BERT)通过协同注意力或双线性池化(如MCB、BUTD)进行交互,使模型聚焦于问题相关的视觉区域(如“足球的颜色”->关注足球而非背景)。 -
视觉常识推理
突破“物体识别”局限,需理解空间关系(“左边”)、动作(“开车”)、计数(“几个”)、逻辑比较(“哪个更多”),甚至反事实推理(“如果拿走苹果会怎样”)。 -
鲁棒性与域适应
面对对抗样本(如添加无关物体)或域迁移(医学图像 vs. 自然场景),需采用数据增强、对比学习或预训练-微调策略(如CLIP、LLaVA)提升泛化能力。 -
可解释性机制
通过注意力热图(Grad-CAM)或可插拔的“推理链”模块,显式输出模型关注区域及决策路径,尤其在高风险领域(如医学诊断)中要求可验证。
医学/神经科学应用场景
[首都医科大学宣武医院神经内科] 脑卒中后失语症认知评估
部署VQA系统于床旁评估:患者观看一组标准化日常生活场景(如“厨房:灶台上有锅、水壶”),系统动态提问:“图中的人在做什么?”、“水壶是什么颜色?”。模型记录回答正确率、反应时(语音或眼动追踪)及错误模式(如忽略名词 vs. 动词)。结合神经电生理(事件相关电位 N400/P600 潜伏期),可定量分析患者语义加工与视觉注意功能损伤程度。相较于传统图片描述任务,VQA能更敏感地检测词汇检索障碍与空间关系理解缺陷,为个体化康复训练提供量化生物标志物。