具身智能新手名词表English

时空块

Spacetime Patches进阶

把视频在时间和空间上一起切成的小立方块,每块当作一个 token 交给 Transformer。

时空块是视频版的「图像切块」。视觉 Transformer 把一张图切成固定大小的方块,每块当一个 token;视频多了时间维,就切成跨若干帧、若干像素的小立方体,谷歌的 ViViT(ICCV 2021)把这种块叫 tubelet,常用 3D 卷积来切。OpenAI 2024 年 2 月发布 Sora 时让「时空块」这个说法流行开:先用视频压缩网络把视频压进潜在空间,再把潜在表示切成时空块,交给扩散 Transformer 去噪。好处是不同分辨率、时长和宽高比的视频都能变成长短不一的 token 序列统一训练,不必先裁剪缩放。现在多数视频生成模型和视频世界模型都用类似方式把视频变成 token。

例子一段压缩后的潜在视频若切成「2 帧 × 2 × 2 格」的小块,每个小块展平后经线性层映射成一个 token;横屏和竖屏视频只是切出的块数和排布不同,可以放进同一批训练。

也叫
时空 patch、时空补丁、Spacetime Latent Patches、Tubelet(管状块)
相关
视觉 Transformer、扩散 Transformer、视频分词器、视频生成模型、token(词元)、Sora(视频生成即世界模拟器)
来源
Sora: A Review on Background, Technology, Limitations, and Opportunities (arXiv:2402.17177)
ViViT: A Video Vision Transformer (arXiv:2103.15691)
Wikipedia: Sora (text-to-video model)
信息截至
2024-02

在完整名词表里查看 →