中训练
Mid-training进阶夹在预训练和后训练之间的一轮训练,用更有针对性的数据补特定能力。
中训练先在大语言模型里流行:大规模预训练之后、指令微调和强化学习之前,再用质量更高或更贴近目标能力的数据(数学、代码、长文本等)继续训练一段,常配合学习率退火和上下文扩展,目标是补强特定能力又不丢通用基础,2025 年已有专门综述梳理这一阶段。具身领域借用了这个词:现成的视觉语言模型没见过机器人数据,直接微调成 VLA 效果受限,于是在两者之间先用具身相关数据(空间推理、机器人轨迹、与机器人对齐的人类动作等)过渡一轮。Ai2 的 MolmoAct 发布了专门用于中训练的机器人数据集,原力灵机 DM0 也采用预训练、中训练、后训练三段式流程。
例子EgoScale 先用两万多小时带动作标注的第一人称人类视频预训练 VLA,再用少量人类与机器人动作对齐的数据做一轮轻量中训练,之后只需极少机器人监督就能适配新的灵巧操作任务。
- 也叫
- 中期训练、中间训练阶段
- 相关
- 预训练、后训练、监督微调、视觉-语言-动作模型、数据配比、MolmoAct
- 来源
- Mid-Training of Large Language Models: A Survey (arXiv 2510.06826)
MolmoAct: Action Reasoning Models that can Reason in Space (arXiv 2508.07917)
EgoScale: Scaling Dexterous Manipulation with Diverse Egocentric Human Data (arXiv 2602.16710) - 信息截至
- 2026-02