具身智能新手名词表English

视频预测策略

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual RepresentationsVPP进阶

用视频扩散模型内部的「对未来的预测特征」来指导动作生成的机器人策略

清华大学陈建宇团队联合星动纪元、UC Berkeley、上海人工智能实验室等 2024 年 12 月发布,入选 ICML 2025 Spotlight。常见视觉编码器只看单张图或两张图对比,抓不住「接下来会怎样动」。VPP 的假设是:视频扩散模型在预测未来帧时,内部特征同时包含当前画面和对未来动态的预测。做法是先用机器人数据和互联网人手操作视频微调一个预训练视频模型,再取它的中间预测表征作为条件,训练一个隐式逆动力学模型(由「预测的未来」反推动作)输出动作。论文报告在 CALVIN ABC-D 泛化基准上相对此前最好方法提升 18.6%,在真实灵巧手复杂操作任务上成功率提升 31.6%。

例子在 Franka 机械臂和 XHand 灵巧手上,VPP 根据语言指令先在模型内部形成对未来几帧的预测特征,再据此输出动作,而不需要把整段未来视频完整渲染出来。

也叫
Video Prediction Policy
相关
视频预测模型、逆动力学模型、扩散策略、CALVIN、生数 Vidar、星动纪元
来源
Video Prediction Policy (arXiv 2412.14803)
VPP project page
信息截至
2025-05

在完整名词表里查看 →