具身智能新手名词表English

RoboFlamingo

RoboFlamingo (Vision-Language Foundation Models as Effective Robot Imitators)进阶

把开源 OpenFlamingo 视觉语言模型微调成机器人操作策略的早期工作

RoboFlamingo 由字节跳动研究院联合清华大学、上海交通大学、新加坡国立大学在 2023 年 11 月发布,是较早把开源视觉语言模型(VLM)直接改造成操作策略的工作。它以 OpenFlamingo 为骨干,每一步负责理解当前画面和语言指令,再接一个显式策略头(如 LSTM)汇总历史信息、输出机械臂动作,只在带语言标注的演示数据上做模仿学习微调。这种「理解」和「决策」分开的设计让它在一台 8 卡 GPU 服务器上就能训练。在 CALVIN 长程任务基准上,它平均能连续完成 4.09 个任务,明显高于此前方法;但论文只在仿真中验证。同一批作者后来把这条思路扩展成系统研究 RoboVLMs。

例子在 CALVIN 中连续给 5 条指令(如「打开抽屉」「把蓝色方块往左推」),RoboFlamingo 平均能连续做完约 4 条。

相关
视觉语言模型、视觉-语言-动作模型、CALVIN、模仿学习、RoboVLMs、Flamingo
来源
arXiv 2311.01378: Vision-Language Foundation Models as Effective Robot Imitators
RoboFlamingo 项目主页
GitHub: RoboFlamingo
信息截至
2024-02

在完整名词表里查看 →