LLaVA
Parent: ai_keywords
LLaVA
核心定义
LLaVA(Large Language and Vision Assistant)是一种多模态大模型架构,由威斯康星大学麦迪逊分校等机构于2023年提出。其核心思想是将预训练的视觉编码器(如CLIP)与大型语言模型(如Vicuna)通过一个轻量级投影模块连接,并利用指令微调实现视觉-语言对齐,使得模型能够端到端地理解图像内容并进行自然语言对话。
关键技术点
- 视觉编码器:采用CLIP预训练的ViT模型,将图像编码为视觉特征序列,保留空间语义信息。
- 投影模块:一个可学习的线性层或小型MLP,将视觉特征映射到语言模型的嵌入空间,实现模态对齐。
- 指令微调:使用自生成的多模态指令数据(如“描述这张X光片”、“图中病灶在哪里”)对LLM进行微调,使模型能够遵循具体指令执行视觉问答、图像描述等任务。
- 端到端推理:训练时仅更新投影模块与LLM参数,视觉编码器冻结,兼顾效率与性能,支持零样本泛化。
医学/神经科学应用场景
以首都医科大学神经病学团队的研究为例,LLaVA可应用于脑卒中患者CT/MRI影像的智能解读与报告生成。例如,输入一幅非增强CT图像,模型能自动识别急性缺血灶、出血灶并定位(如左侧基底节区),随后生成结构化文字:“显示右侧大脑中动脉供血区低密度灶,符合急性梗死表现,建议密切随访。”此外,在癫痫术前评估中,LLaVA可同步分析长程视频脑电图的发作期录像与脑电图形,自动标记发作起始区域、描述发作类型(如自动症、强直-阵挛),辅助神经电生理医生快速定位致痫灶。这种多模态融合能力显著降低了人工阅片负荷,并减少了主观误判,尤其适用于基层医院的远程会诊场景。