具身智能新手名词表English

Stable Video Diffusion

Stable Video Diffusion (SVD)SVD进阶

Stability AI 开源的图生视频扩散模型,常被机器人研究用作视频预测底座

Stability AI 于 2023 年 11 月 21 日发布的开源视频生成模型,属于潜在扩散模型(先把图像压缩到低维潜空间,再在潜空间里逐步去噪生成)。它在图像模型 Stable Diffusion 基础上插入时间层,并总结出三阶段训练:文生图预训练、大规模视频预训练、高质量视频微调,强调视频数据筛选的重要性。首发的是两个图生视频模型,分别生成 14 帧和 25 帧(后者即 SVD-XT),帧率可在每秒 3 到 30 帧间设置,当时以研究预览形式发布、不面向商用。由于权重开放、参数量约 15 亿,SVD 成了具身智能里常用的视频底座,例如视频预测策略(VPP)就在它上面加入语言条件、用机器人视频微调,再从中提取对未来的预测表征来输出动作。

例子视频预测策略(VPP)把 SVD 微调成操作视频预测模型:给定当前画面和「打开抽屉」指令,先预测接下来画面的特征,再据此输出机械臂动作。

也叫
SVD-XT、Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
相关
视频生成模型、潜在扩散模型、视频预测策略、文生视频 / 图生视频、世界模型、扩散模型
来源
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets (arXiv 2311.15127)
Introducing Stable Video Diffusion (Stability AI)
Video Prediction Policy (arXiv 2412.14803)
信息截至
2023-11

在完整名词表里查看 →