CLIPort
CLIPort: What and Where Pathways for Robotic Manipulation进阶结合 CLIP 语义理解与 Transporter 空间精度的语言条件操作策略。
CLIPort 是华盛顿大学和英伟达(Mohit Shridhar、Lucas Manuelli、Dieter Fox)2021 年发表于 CoRL 的工作。它借用神经科学里视觉的 what / where 双通路:语义通路用预训练的 CLIP(图文对比学习模型)理解「要操作什么」,如颜色、形状、物体类别;空间通路沿用 Transporter Networks 的全卷积网络处理 RGB-D 图像,决定「在哪里抓、放到哪里」,输出像素级的抓取和放置热力图。两路融合后,不需要物体位姿、分割掩码或符号状态,就能按语言指令完成装箱、叠布等桌面任务。它是较早把大规模预训练图文模型接进机器人操作的代表作,同一作者后来的 PerAct 把这类思路推广到 3D 体素。
例子一个多任务策略只用 179 对真实图像-动作样本,就在 9 个真实桌面任务上学会按语言指令操作。
- 相关
- CLIP、Transporter Networks、语言条件策略、桌面操作、PerAct、抓取放置
- 来源
- CLIPort: What and Where Pathways for Robotic Manipulation (arXiv 2109.12098)
CLIPort 项目主页 - 信息截至
- 2021-09