适配器
Adapter进阶在冻结的大模型层间插入小模块,只训练这些小模块来适配新任务。
适配器是一类参数高效微调方法,由 Houlsby 等人 2019 年在论文《Parameter-Efficient Transfer Learning for NLP》中提出:在 Transformer 各层插入「先降维、再升维」的小型瓶颈网络(带残差连接),微调时冻结原模型,只训练适配器。在 BERT 的 26 个文本分类任务上,每个任务只增加 3.6% 的参数,效果与全参数微调相差不到 0.4%。它省显存、省存储,一个底座可挂多个任务的适配器,也能减轻灾难性遗忘;后来的 LoRA 延续了同一思路。机器人领域中,TAIL(ICLR 2024)比较了瓶颈适配器、P-Tuning 和 LoRA 在模仿学习中的表现,给 VLA 适配新任务、新本体时也常用这类方法。
例子TAIL 用少量演示微调预训练的决策模型,发现 LoRA 只训练约 1% 的参数就能达到与全参数微调相当的效果,并在持续学习中避免了灾难性遗忘。
- 也叫
- Adapter 微调、适配器微调、Adapter 模块、瓶颈适配器
- 相关
- 参数高效微调、低秩适配、冻结骨干网络、灾难性遗忘、全参数微调、提示微调 / 软提示
- 来源
- Parameter-Efficient Transfer Learning for NLP (Houlsby et al., arXiv 1902.00751)
TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models (arXiv 2310.05905)