具身智能新手名词表English

视频生成模型

Video Generation Model常用

根据文字、图片或已有片段,生成一段连贯新视频的生成式模型。

视频生成模型能凭文字、图片或已有片段生成新视频。2022 年 Google 的 Video Diffusion Models 把图像扩散模型扩展到视频,此后主流做法是先用视频 VAE 把视频压到潜在空间,再用扩散 Transformer 或 U-Net 同时对多帧逐步去噪,保证前后连贯。代表有 OpenAI 的 Sora、Google 的 Veo、阿里开源的通义万相 Wan。模型从海量视频里学到物体怎么运动、怎么被推动,因此常被当作世界模型的起点:NVIDIA Cosmos 等世界基础模型、UniPi 这类先生成视频再推出动作的策略,以及 DreamZero 等世界动作模型,都建立在视频生成模型之上。

例子通义万相 Wan 开源了 1.3B 和 14B 两个规模,其中 1.3B 版本只需约 8GB 显存,消费级显卡就能跑文生视频。

也叫
视频扩散模型、Video Diffusion Model、视频生成大模型
相关
文生视频 / 图生视频、扩散模型、扩散 Transformer、视频预测模型、世界模型、通义万相
来源
Video Diffusion Models (arXiv 2204.03458)
Wan: Open and Advanced Large-Scale Video Generative Models (arXiv 2503.20314)
信息截至
2025-04

在完整名词表里查看 →