具身智能新手名词表English

BridgeVLA

BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models进阶

把 3D 点云投影成 2D 图、用热力图输出动作的 3D 操作 VLA。

BridgeVLA 由中科院自动化所、字节跳动 Seed 等团队 2025 年 6 月提出,发表于 NeurIPS 2025。问题在于:VLM 是在 2D 图文上预训练的,而 3D 操作要处理点云、输出 3D 位姿,两边对不齐,知识难迁移。BridgeVLA 把点云渲染成几张多视角 2D 图送进 PaliGemma,让模型在同一张图上输出 2D 热力图(每个像素表示「在这里动作」的可能性),再综合多视角热力图确定末端要去的 3D 位置;正式训练前还先用目标检测数据练它输出热力图。它在 RLBench 上把成功率从 81.4% 提到 88.2%。2026 年 8 月团队又开源了 BridgeVLA++。

例子真机上用 Franka Research 3 机械臂测试 10 多个任务,每个任务只给 3 条演示,平均成功率 96.8%。

也叫
BridgeVLA++
相关
3D VLA、PaliGemma、RVT-2、RLBench、The Colosseum、关键帧动作预测
来源
BridgeVLA (arXiv 2506.07961)
BridgeVLA GitHub
信息截至
2026-08

在完整名词表里查看 →