具身智能新手名词表English

计算机视觉

Computer VisionCV入门必知

让计算机从图像和视频中提取有用信息、理解场景的学科。

计算机视觉研究怎样让计算机从单张图像或视频序列中自动提取、分析和理解信息,典型任务有图像分类、目标检测、分割、跟踪、位姿估计和三维重建。它起步于 20 世纪 60 年代末的人工智能实验室,1966 年还有人以为给计算机接上相机、让它「描述看到了什么」只需一个本科生暑期项目,结果这个问题研究了半个多世纪。深度学习兴起后,卷积网络、视觉 Transformer 以及 CLIP、DINOv2、SAM 这类视觉基础模型成为主流。具身智能里,相机是机器人获取外部信息的主要来源,VLA 的视觉编码器大多直接沿用计算机视觉领域预训练好的模型。

例子机器人收拾桌子前,先用目标检测找到杯子,用分割抠出杯子轮廓,再结合深度图算出它的三维位置,这几步都属于计算机视觉。

也叫
机器视觉(广义)、CV
相关
目标检测、语义分割、3D视觉、视觉基础模型、深度估计、视觉编码器
来源
Wikipedia: Computer vision
Richard Szeliski, Computer Vision: Algorithms and Applications (2nd ed., 2022)

在完整名词表里查看 →