具身智能新手名词表English

对比学习

Contrastive Learning常用

让相似样本的表示靠近、不相似样本的表示远离,从无标签数据里学特征。

对比学习是一类自监督表征学习方法:构造「正样本对」(应当相似的两份数据,如同一张图的两种随机增强、一张图和它的配文)和「负样本」,训练编码器把正样本对的向量拉近、把负样本推远。常用损失是 InfoNCE,源自 2018 年的 CPC 论文。代表工作有 SimCLR、MoCo 和 CLIP。它不需要人工标签,能从海量图像、视频和图文里学到通用视觉特征。具身智能里,很多 VLA 的视觉编码器(如 CLIP、SigLIP)就是用对比目标训出来的;R3M 则在人类视频上用时间对比学习预训练机器人视觉表征。

例子CLIP 用 4 亿对网上图文训练,任务是判断哪段文字配哪张图;R3M 在 Ego4D 人类视频上结合时间对比学习等目标预训练,冻结后给 Franka 机械臂用,只需 20 条演示就能在真实杂乱的公寓里学会操作任务。

也叫
对比表征学习、Contrastive Representation Learning
相关
自监督学习、InfoNCE 损失、CLIP、SigLIP、时间对比学习、R3M
来源
Representation Learning with Contrastive Predictive Coding (arXiv 1807.03748)
Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)
R3M: A Universal Visual Representation for Robot Manipulation (arXiv 2203.12601)

在完整名词表里查看 →