RoboCerebra
RoboCerebra (A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation)进阶评测机器人长程操作中规划、反思与记忆能力的大规模仿真基准。
北京航空航天大学、新加坡国立大学、上海交通大学等的研究者 2025 年 6 月发布,入选 NeurIPS 2025。它关注「System 2」式的慢思考能力:先用 GPT 生成家务类长任务并拆成子任务序列,再由人在仿真中逐步执行,得到 100 个任务变体、1000 条人工轨迹,平均每条约 2972 个仿真步,论文称约为已有长程操作数据集的 6 倍,并附子任务时间段标注。测试任务分六类:理想、随机干扰、观测不一致、记忆探索、记忆执行和混合,场景会在执行中途变化。配套的分层框架用视觉语言模型(VLM)做高层规划并存入记忆,用 OpenVLA 做底层动作执行;论文借此比较 GPT-4o、Qwen2.5-VL 等 VLM 当规划器时在规划、反思(判断子任务是否完成)和记忆三方面的表现。
例子指令是「准备一杯饮料再收拾桌面」,高层模型要先拆出拿杯子、倒饮料、放回原处等子步骤;执行途中物体被随机挪动时,还要判断当前子任务是否完成并重新规划。
- 相关
- 长程任务、快慢双系统、具身记忆、LIBERO、OpenVLA、基准测试
- 来源
- RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation (arXiv 2506.06677)
- 信息截至
- 2025-10