具身智能新手名词表English

指向(点预测)

Pointing (2D Point Prediction)常用

视觉语言模型按文字指令,直接输出图像上目标位置的像素坐标。

指向是让视觉语言模型(VLM)用「在图上点一个点」来回答:输入图像和一句指令,输出一个或多个 2D 像素坐标。Ai2 的 Molmo(2024)专门采集了 PixMo-Points 指点数据,能指出并清点物体;RoboPoint(2024)用自动合成的数据微调 VLM,预测该在哪里抓、放到哪里的关键点;Google DeepMind 的 Gemini Robotics-ER 以 [y, x] 格式输出归一化到 0–1000 的坐标。点比框更精细,也比文字更便于下游使用:结合深度图反投影即得三维目标位置,可交给抓取、运动规划或 VLA 模型执行。

例子对 Gemini Robotics-ER 说「指出图中所有香蕉」,它返回形如 point: [376, 508]、label: small banana 的列表,每个点对应一根香蕉的位置。

也叫
点预测、指点、Point Prediction
相关
Molmo、RoboPoint、Gemini Robotics-ER、视觉提示、可供性检测、投影与反投影
来源
Molmo and PixMo (arXiv 2409.17146)
RoboPoint (arXiv 2406.10721)
Gemini API Docs: Gemini Robotics-ER overview
信息截至
2026-09

在完整名词表里查看 →