F3RM
Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation进阶MIT 2023 年提出,把 CLIP 等 2D 特征蒸馏进 3D 场,少样本按语言指令抓放。
F3RM(Feature Fields for Robotic Manipulation)是 MIT CSAIL 的 William Shen、Ge Yang、Phillip Isola 等人提出的方法,发表于 CoRL 2023。CLIP、DINO 这类 2D 图像模型懂语义,却不知道物体在三维空间里的精确位置和形状,而机器人抓取离不开几何。F3RM 先对场景多角度拍照,训练神经辐射场(NeRF,从多视角照片重建三维场景的方法),同时把 CLIP 等模型的特征「蒸馏」进这个三维场,得到每个空间点都带语义特征的蒸馏特征场。机器人在这个场里优化夹爪位姿,只需少量示范就能学会 6 自由度抓取和放置,可用自由文本指定操作对象,也能迁移到没见过的物体。它和 LERF(把语言特征嵌入辐射场)属于同一思路,是「把 2D 基础模型知识搬到 3D 做操作」的代表作。
例子每个抓取任务只给两次示范(例如抓杯柄或抓杯口),机器人就能抓起颜色、大小不同的杯子;输入一句文字描述,就能在场景里挑出对应物体去抓。
- 也叫
- Feature Fields for Robotic Manipulation、蒸馏特征场操作
- 相关
- 蒸馏特征场、神经辐射场、CLIP、LERF、开放词汇、少样本
- 来源
- Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation (arXiv 2308.07931)
F3RM 项目主页 - 信息截至
- 2023-11