具身智能新手名词表English

文生视频 / 图生视频

Text-to-Video / Image-to-VideoT2V / I2V常用

按一段文字,或一张图片加文字,生成一段视频的任务。

文生视频(T2V)和图生视频(I2V)是视频生成模型最常见的两种用法:前者只给文字描述,模型从零生成视频;后者给一张图(通常当作第一帧)加文字,让画面接着动起来。Stability AI 的 Stable Video Diffusion、阿里的通义万相 Wan 都同时提供两种版本,主流做法是在 VAE 压缩出的潜在空间里用扩散或流匹配逐步去噪。对机器人来说 I2V 更有用:把相机当前画面当首帧、任务指令当文字,生成的视频就是对接下来会发生什么的预演。UniPi 用文本引导的视频生成做规划,NVIDIA 的 DreamZero 则直接在 Wan2.1 的图生视频 14B 模型上加动作输出。

例子给图生视频模型输入一张机械臂和桌上杯子的照片,加上指令「把杯子放进水槽」,模型从这张照片出发生成几秒钟的视频,展示机械臂完成任务的过程。

也叫
文本生成视频、图像生成视频、Text2Video、Image2Video
相关
视频生成模型、扩散模型、潜在扩散模型、变分自编码器、世界动作模型、UniPi
来源
Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets (arXiv 2311.15127)
Wan: Open and Advanced Large-Scale Video Generative Models (arXiv 2503.20314)
World Action Models are Zero-shot Policies (arXiv 2602.15922)
信息截至
2026-02

在完整名词表里查看 →