学习率
Learning RateLR常用梯度下降每次更新参数时迈出的步子大小,是最关键的超参数之一。
学习率是优化算法里控制每一步参数更新幅度的超参数:参数沿负梯度方向移动,移动量等于学习率乘以梯度(Adam 等自适应优化器还会按每个参数的历史梯度再做缩放)。设得太大,参数会越过最低点,损失来回震荡甚至发散成 NaN;设得太小,收敛很慢,或停在不理想的位置。它通常是调参时最先要调的量,并且和批大小有关:批大小加大时常按比例放大学习率(线性缩放规则)。实际训练很少全程用一个固定值,而是配合学习率调度,先预热、再逐步衰减。微调预训练大模型时一般用比从零训练小得多的学习率,以免破坏已经学到的能力。
例子LLaVA 第一阶段只训练投影层时学习率取 2e-3,第二阶段连同语言模型一起微调时降到 2e-5;OpenVLA 训练全程固定用 2e-5,作者发现加学习率预热没有带来收益;ACT 则用 1e-5。
- 也叫
- 步长、step size
- 相关
- 学习率调度(预热与余弦退火)、梯度下降、优化器、AdamW 优化器、批大小、超参数
- 来源
- Learning rate(Wikipedia)
Visual Instruction Tuning (LLaVA, arXiv 2304.08485)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)