具身智能新手名词表English

具身视觉跟踪(目标跟随)

Embodied Visual TrackingEVT进阶

机器人靠自身相机持续跟着指定目标移动,让目标始终留在视野里。

具身视觉跟踪指智能体仅凭第一人称视觉,在动态环境中持续跟随指定目标(通常是行人或另一台机器人),并控制自身移动,让目标保持在视野内、距离合适。它和传统视觉跟踪的区别是:传统方法只在录好的视频里框出目标,而这里跟踪器要自己输出运动指令,看到什么取决于自己怎么走。Wenhan Luo 等人 2018 年(ICML)的主动目标跟踪用强化学习把画面直接映射成前进、转弯等动作,是早期代表。难点在于遮挡、外观相似的干扰者、目标突然转向,以及目标识别和路径规划要同时完成。2025 年北京大学、银河通用等团队的 TrackVLA(CoRL 2025)用一个视觉-语言-动作模型同时做识别和轨迹规划,并构建了 EVT-Bench,采集约 170 万条样本。应用包括陪伴跟随、跟拍和物流跟车。

例子机器狗听到「跟着穿红衣服的人」后在人群中锁定对方;对方拐进走廊被短暂挡住,它仍能找回并继续跟随。

也叫
目标跟随、主动目标跟踪、Active Object Tracking
相关
目标跟踪、银河通用 TrackVLA、视觉语言导航、主动感知、社交导航、视觉-语言-动作模型
来源
End-to-end Active Object Tracking via Reinforcement Learning (Luo et al., ICML 2018)
TrackVLA: Embodied Visual Tracking in the Wild
TrackVLA project page
信息截至
2025-05

在完整名词表里查看 →