具身智能新手名词表English

以物体为中心的表示

Object-centric Representation进阶

把场景拆成一个个物体分别编码,而不是整张图压成一个向量

以物体为中心的表示指把图像或场景分解成若干物体,每个物体用自己的一组特征(位置、形状、类别等)表示,而不是把整幅画面压成一个特征向量。代表方法是 Locatello 等人 2020 年(NeurIPS)的 Slot Attention:若干个「槽」通过注意力相互竞争,无监督地各自绑定到一个物体。在机器人操作中,这种表示让策略只关注和任务有关的物体,换背景、加干扰物时更稳。2022 年的 VIOLA 用预训练视觉模型给出的物体候选构建物体级表示,再用 Transformer 策略挑出相关物体,论文报告成功率比最好的基线提升 45.8%。

例子桌上有杯子、碗和勺子,策略先把画面分成三个物体表示;执行「把勺子放进碗里」时只看勺子和碗,桌布换了颜色也不受影响。

也叫
物体中心表示、对象中心表征、Object-centric Learning
相关
表征学习、组合泛化、3D场景图、干扰物、视觉编码器、关键点检测
来源
Object-Centric Learning with Slot Attention
VIOLA: Imitation Learning for Vision-Based Manipulation with Object Proposal Priors

在完整名词表里查看 →