具身智能新手名词表English

视频预测模型

Video Prediction Model常用

根据已有画面(常加上计划执行的动作)预测接下来画面的模型。

视频预测模型输入过去几帧画面,输出未来的画面;在机器人里通常还输入计划执行的动作,回答「如果这样动,相机会看到什么」,这类叫动作条件视频预测。2016 年 Finn 和 Levine 提出视觉预见(Visual Foresight):机器人不靠人工标注、自己推动物体采集数据训练预测模型,再结合模型预测控制(每一步在模型里试多组动作,挑预测结果最接近目标的执行)完成推物体任务。它和视频生成模型的区别在于侧重接着已有画面往下演,而不是凭文字从零生成。近年改用大规模视频扩散模型,例如视频预测策略 VPP 用视频模型的预测特征驱动逆动力学模型输出动作。

例子要把桌上的积木推到目标位置时,机器人先在视频预测模型里试大量候选动作序列,比较各自预测出的画面哪个最接近目标图像,再执行这组动作的第一步,然后重复。

也叫
视觉预见、Visual Foresight、动作条件视频预测、Action-conditioned Video Prediction
相关
视频生成模型、世界模型、模型预测控制、正向动力学模型、视频预测策略、世界动作模型
来源
Deep Visual Foresight for Planning Robot Motion (arXiv 1610.00696)
Visual Foresight: Model-Based Deep Reinforcement Learning for Vision-Based Robotic Control (arXiv 1812.00568)
Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations (arXiv 2412.14803)

在完整名词表里查看 →