3D VLA
3D / Spatial Vision-Language-Action Model进阶把深度、点云、3D 位置等空间信息显式放进模型的 VLA
普通 VLA(视觉-语言-动作模型,看图听指令直接输出动作)大多只吃 2D 图片,但机器人的动作发生在三维空间里,距离、高度、遮挡光靠 2D 图很难判断准。3D VLA 泛指在输入或中间表示里加入深度、点云或 3D 位置编码的一类 VLA。代表作有两篇:UMass Amherst 团队 2024 年 3 月的 3D-VLA,在 3D 大语言模型上加入交互 token,并用扩散模型生成目标图像和目标点云来「想象」操作后的场景;Qu 等人 2025 年 1 月的 SpatialVLA(RSS 2025),基于 PaliGemma2,用 Ego3D 位置编码把 3D 空间信息注入视觉特征,用自适应动作网格把连续动作离散成空间 token,并在 OXE 和 RH20T 的 110 万条真机轨迹上预训练。这类方法主要想让模型在换视角、换机器人时空间判断更稳。
例子SpatialVLA-4B 把每个图像块对应的 3D 位置编码进视觉 token,不需要相机标定,换到新机器人时可以重新划分动作网格来适配。
- 也叫
- 空间 VLA、Spatial VLA、SpatialVLA、SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model、3D-VLA、3D-VLA: A 3D Vision-Language-Action Generative World Model
- 相关
- 视觉-语言-动作模型、空间推理、点云、深度估计、3D 扩散策略、世界模型
- 来源
- 3D-VLA: A 3D Vision-Language-Action Generative World Model (arXiv 2403.09631)
SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model (arXiv 2501.15830)
SpatialVLA GitHub - 信息截至
- 2025-01