具身智能新手名词表English

V-JEPA 2

V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning常用

Meta 的自监督视频模型,在特征空间里预测视频,可当世界模型规划机器人动作。

V-JEPA 2 是 Meta FAIR(Yann LeCun 团队)2025 年 6 月发布的开源视频模型,约 12 亿参数。它沿用 JEPA(联合嵌入预测架构)思路:不生成像素,而是遮住视频的一部分,让模型在抽象特征空间里预测被遮住的内容,以此学到运动和物理规律。第一阶段用 100 多万小时网络视频和 100 万张图片自监督预训练;第二阶段冻结编码器,用 DROID 数据集中不到 62 小时的无标注机器人视频训练一个输入动作的预测器,叫 V-JEPA 2-AC。使用时给一张目标图,模型在特征空间里搜索能让预测结果最接近目标的动作(模型预测控制)。在两个实验室的 Franka 机械臂上零样本抓取放置新物体,成功率 65%–80%。2026 年 Meta 又发布了改进稠密特征的 V-JEPA 2.1。

例子在一个没采过任何数据的新实验室,给 Franka 机械臂一张「物体已放到目标位置」的照片。V-JEPA 2-AC 每一步都在特征空间里想象多组候选动作的结果,选最接近目标图的那组执行,一步步把物体挪过去。

也叫
V-JEPA 2-AC、V-JEPA、V-JEPA 2.1
相关
联合嵌入预测架构、世界模型、隐空间世界模型、自监督学习、模型预测控制、DROID 数据集
来源
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)
Introducing V-JEPA 2 (Meta AI blog)
V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning (arXiv 2603.14482)
信息截至
2026-06

在完整名词表里查看 →