具身智能新手名词表English

异构预训练 Transformer

Heterogeneous Pre-trained TransformersHPT进阶

MIT 何恺明团队 2024 年提出,用共享主干网络统一预训练各种机器人数据。

HPT 由 MIT CSAIL 的 Lirui Wang、何恺明与 Meta FAIR 的陈鑫磊等人 2024 年 9 月发布,发表于 NeurIPS 2024(Spotlight)。机器人数据很「异构」:不同机器人的相机数量、关节数、控制方式都不同,很难放进一个模型一起训练。HPT 把网络拆成三段:每种本体配一个小的 stem(编码器),把本体感知和图像转成固定数量的 token;中间是一个大的共享 Transformer 主干(trunk),学习与本体、任务无关的表示;输出端的 head 按任务把表示映射成动作。预训练用了 50 多个数据集、约 20 万条轨迹,来源包括真机遥操作、仿真、人类视频和已部署的机器人。

例子把预训练好的主干接到一台新机器人上,只需为它训练新的 stem 和 head;作者报告在多个仿真基准和真机的未见任务上,微调后策略性能提升 20% 以上。

也叫
HPT
相关
跨本体、异构数据、预训练、本体专属头、缩放定律、Open X-Embodiment 数据集
来源
Scaling Proprioceptive-Visual Learning with Heterogeneous Pre-trained Transformers (arXiv 2409.20537)
HPT 项目页
信息截至
2024-12

在完整名词表里查看 →