知识隔离
Knowledge InsulationKI进阶训练 VLA 时切断动作专家回传给 VLM 骨干的梯度,保护预训练知识。
知识隔离是 Physical Intelligence 在 2025 年 5 月的论文中提出的 VLA 训练方法(Driess、Levine 等)。π0 这类模型在 VLM 骨干上接一个新初始化的动作专家,用流匹配输出连续动作,但动作专家的梯度回传会扰乱骨干,既拖慢训练又损害语言理解。做法是:用梯度阻断切断动作专家到骨干的梯度;骨干改用 FAST 离散动作 token 做下一个 token 预测来学动作,同时混训图文问答等 VLM 数据;推理时仍由动作专家快速生成连续动作块。
例子论文在收拾餐桌任务上报告,知识隔离版本的收敛速度约为纯流匹配训练的 π0 的 7.5 倍,同时保留了较好的语言指令跟随能力。
- 也叫
- 知识绝缘、Knowledge Insulating VLA
- 相关
- 梯度阻断、动作专家、π0.5、π0-FAST、灾难性遗忘、协同训练
- 来源
- Knowledge Insulating Vision-Language-Action Models: Train Fast, Run Fast, Generalize Better (arXiv:2505.23705)
论文 HTML 版(方法与实验细节) - 信息截至
- 2025-05