LLaMA

Parent: ai_keywords

LLaMA 百科解释

核心定义

LLaMA(Large Language Model Meta AI)是 Meta AI 于 2023 年推出的高性能大型语言模型系列。其核心理念是“以小博大”:在更小参数量(7B、13B、33B、65B)上,通过大量高质量公开数据训练,达到甚至超越 GPT-3(175B)的性能。LLaMA 采用自回归 Transformer 架构,训练数据包括 CommonCrawl、Wikipedia、书籍、代码等,强调训练效率与可复现性。

关键技术点

  • Scaling Law 的工程实践:LLaMA 验证了在固定计算预算下,使用更多数据训练较小模型的效果优于增加参数数量。例如 7B 模型在 1T token 上训练,远超同类规模模型的数据量。
  • 混合精度与优化策略:采用 BF16 混合精度训练,配合优化后的 AdamW 与余弦学习率调度,提升训练稳定性和速度。
  • 分词器优化:基于 SentencePiece 的 BPE 分词,支持多语言,并针对代码和数字进行改进,减少罕见词的碎片化。
  • 自注意力机制改进:使用激活函数 SwiGLU 与旋转位置编码(RoPE),增强长序列建模能力,并采用预归一化(Pre-Norm)提升深层网络收敛。

医学/神经科学应用场景

结合首都医科大学神经病学研究:LLaMA 可微调为神经专科大模型,用于脑卒中急性期决策支持。例如,输入患者 CT 报告的文本描述(“左侧大脑中动脉高密度征,ASPECTS 评分 7 分,发病 2 小时”),模型可快速生成溶栓/取栓建议、预后风险分层(如 90 天功能预后预测),并依据最新指南自动提取禁忌症。在癫痫领域,LLaMA 可分析长程 EEG 文字描述(“频繁尖慢复合波,右侧颞叶起源”),辅助自动生成临床报告,并检索相似病例供诊疗参考。其轻量级特性(如 7B 模型)适合部署于医院边缘服务器,实现隐私合规的本地化推理,助力神经电生理与影像数据的文本化智慧分析。