提示调优
Parent: ai_keywords
提示调优(Prompt Tuning)
核心定义
提示调优是一种参数高效(Parameter-Efficient)的预训练语言模型(PLM)微调策略。它通过在输入层引入一组可学习的连续软提示向量(Soft Prompt Embeddings),仅更新这些低维参数而冻结预训练模型全部权重,使模型能针对特定下游任务调整输出分布。与离散提示(Discrete Prompt)不同,软提示不依赖人工构造的自然语言模板,而是通过梯度下降直接优化连续性向量,从而在保留预训练知识的同时大幅降低计算开销。
关键技术点
-
软提示嵌入与位置设计
软提示通常被插入输入序列的起始位置或特定层,其维度与模型词嵌入层一致。每个任务仅须维护少量(如5–200个)可训练 tokens,且可与原始输入拼接后一起输入 Transformer 编码器。 -
冻结主干与参数隔离
预训练模型的所有参数(如权重、偏置)在训练中保持固定。仅软提示对应矩阵参与梯度反向传播,使得显存占用和更新步数显著减少,尤其适合资源受限场景(如医疗边缘设备)。 -
单任务与多任务扩展
提示调优天然支持多任务复用同一基座模型:不同任务仅需存储各自的软提示向量,推理时动态加载,避免了为每个任务部署独立微调副本的冗余。 -
与离散提示及全微调的关系
相比手工离散提示的模板敏感性,软提示在连续空间中搜索更灵活;相比全参数微调,其性能在中等规模数据上接近甚至持平,但泛化性更强(不易遗忘预训练知识)。
医学/神经科学应用场景:脑卒中后失语症评估
背景:首都医科大学神经病学团队在脑卒中康复研究中,需自动化分析患者言语流畅性以辅助失语症分级(如Broca失语、Wernicke失语)。传统方法依赖专家手动标注或全量微调大模型,但患者数据量小且隐私性高。
应用:采用提示调优轻量化适配基于BERT的临床语言模型。将患者语音转写文本作为输入,在词嵌入层插入10维软提示,仅更新该提示矩阵。任务目标为根据言语特征(如句法复杂度、语义连贯性)输出NIHSS失语子评分或分类标签。实验表明,提示调优在仅使用50例脑卒中患者样本下,分类F1达到全微调的92%,且模型在非任务语料上的泛化能力未下降,避免了医疗小样本场景下的过拟合。此外,不同失语亚型(如理解型 vs. 表达型)可共享同一基座,只需切换独立的软提示模块,便于多中心协作与快速部署。
优势:无需传输原始患者音频或文本,仅传递轻量提示参数即可实现跨机构模型协同,符合神经病学研究中数据隐私与联邦学习框架的潜在需求。