具身智能新手名词表English

LERF

Language Embedded Radiance Fields进阶

把 CLIP 语言特征嵌进 NeRF,能用自然语言在三维场景里找东西。

LERF 是 UC Berkeley 的 Justin Kerr、Chung Min Kim、Angjoo Kanazawa 等人提出的方法,发表于 ICCV 2023(口头报告)。它在神经辐射场(NeRF,用网络表示场景各点颜色和密度)之外,再学一个多尺度的语言场:空间中的点在不同尺度上对应一个 CLIP 向量,训练时用多视角图像金字塔上提取的 CLIP 特征监督,并用 DINO 特征做正则,让物体边界更清楚。建好后输入任意文字,就能在三维空间里渲染出相关度热图,不需要检测框、分割掩码或微调模型。它是把视觉语言模型的开放词汇能力搬进三维场景的早期代表,代码集成在 Nerfstudio 中。

例子LERF-TOGO(2023)先用 LERF 在场景里定位「杯子的把手」这类物体部位,再给现成抓取规划器的候选抓取排序;在 31 个真实物体上,选对部位的比例为 81%,抓取成功率为 69%。

也叫
语言嵌入辐射场、LERF-TOGO(抓取扩展)
相关
神经辐射场、CLIP、蒸馏特征场、F3RM、开放词汇、3D视觉定位
来源
LERF: Language Embedded Radiance Fields (ICCV 2023 项目主页)
Language Embedded Radiance Fields for Zero-Shot Task-Oriented Grasping (LERF-TOGO, arXiv 2309.07970)

在完整名词表里查看 →