DreamVLA
DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge进阶先预测未来的动态区域、深度和语义特征,再据此生成动作的 VLA 模型。
DreamVLA 是上海交通大学、宁波东方理工大学、清华、北大、银河通用等机构于 2025 年 7 月提出的视觉-语言-动作模型(VLA),收录于 NeurIPS 2025。有些 VLA 会先「想象」下一帧完整画面再出动作,但整张图里大部分像素和任务无关。DreamVLA 只预测三类紧凑的「世界知识」:哪里会动(动态区域)、单目深度、高层语义(借助 DINOv2、SAM 的特征),再以它们为条件,用扩散 Transformer 生成未来一段动作,相当于先预测结果、再反推该怎么做(逆动力学思路)。为防三类信息在注意力里互相串扰,它用分块结构化注意力掩码把它们隔开。它是「VLA 融合世界模型式预测」这一方向的代表工作之一。
例子在 CALVIN ABC-D 长程任务基准上平均连续完成 4.44 个子任务,在真机操作任务上成功率 76.7%。
- 相关
- 视觉-语言-动作模型、世界模型、逆动力学模型、扩散 Transformer、注意力掩码、CALVIN
- 来源
- DreamVLA (arXiv 2507.04447)
DreamVLA 项目主页
DreamVLA 代码仓库(GitHub) - 信息截至
- 2025-09