具身智能新手名词表English

视觉问答

Visual Question AnsweringVQA常用

给一张图和一个自然语言问题,让模型用文字作答。

视觉问答输入一张图和关于它的问题(如「桌上有几个杯子」),输出自然语言答案,需要同时理解画面、语言和常识。任务由 Antol、Agrawal 等人在 ICCV 2015 提出,VQA 数据集约 25 万张图、76 万个问题;2017 年的 VQA v2 做了平衡,减少模型不看图、只凭问题猜答案。如今视觉语言模型大多用问答形式训练和评测,ERQA、VSI-Bench 等具身与空间推理基准也是问答形式;训练 VLA 时常混入 VQA 数据协同训练,如 π0.5 用了 VQAv2 等网络数据来保住看图理解能力。和具身问答不同,VQA 只看给定图片,不需要机器人移动去找答案。

例子给模型一张厨房台面照片,问「水槽左边的杯子是空的吗」,模型回答「是空的」;具身推理基准会把这类问题换成「机器人夹爪要先移到哪个物体上方」。

也叫
图像问答
相关
视觉语言模型、多模态大语言模型、具身问答、协同训练、ERQA 具身推理问答基准、VSI-Bench 空间智能基准
来源
VQA: Visual Question Answering (ICCV 2015)
VQA 官网(VQA v2 数据集与挑战赛)
π0.5: a Vision-Language-Action Model with Open-World Generalization(协同训练用到 VQAv2 等网络数据)
信息截至
2025-04

在完整名词表里查看 →