具身智能新手名词表English

RoboVQA 数据集

RoboVQA: Multimodal Long-Horizon Reasoning for Robotics进阶

谷歌 DeepMind 发布的面向机器人长程任务的视频问答数据集。

RoboVQA 是 Google DeepMind(Pierre Sermanet 等)2023 年 11 月发布的数据集和模型工作。数据集含约 83 万组「视频—文本」对、2.95 万条不同指令,问题围绕长程任务展开:下一步该做什么、这一步完成了没有、某个动作现在能不能做等。采集采用「自下而上」的众包方式:先收集开放式的长程任务,再由机器人、人或手持抓取工具的人去执行并标注,论文称吞吐量是传统逐步采集的 2.2 倍。作者用它训练了视频视觉语言模型 RoboVQA-VideoCoCa,以人工干预率作统一指标;结果显示视频输入的模型比单图模型平均错误率低 19%。

例子给模型看一段机器人在厨房里的视频并问「任务完成了吗?」或「下一步应该做什么?」,模型用文字作答,例如「把海绵放进水槽」。

也叫
RoboVQA
相关
视觉问答、具身推理、长程任务、视觉语言模型、谷歌 DeepMind、语言标注
来源
RoboVQA: Multimodal Long-Horizon Reasoning for Robotics (arXiv:2311.00899)
信息截至
2023-11

在完整名词表里查看 →