具身智能新手名词表English

CogACT

CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation进阶

在 VLM 后面接扩散 Transformer 动作模块的开源 VLA 模型。

CogACT 是微软亚洲研究院联合清华大学、中国科学技术大学等 2024 年 11 月发布的视觉-语言-动作模型。当时 OpenVLA 等让 VLM 直接输出离散动作 token,精度和连续性受限。CogACT 把认知和动作拆开:用 Prismatic-7B 这类 VLM 理解图像和指令,输出一个认知特征;再用最多约 3 亿参数的扩散 Transformer(DiT)动作模块,以该特征为条件生成连续动作序列。推理时用自适应动作集成,只把相似的动作预测做平均,避免把不同模式混在一起。它在 Open X-Embodiment 的约 40 万条轨迹上训练,SIMPLER 仿真中比 OpenVLA 高 35% 以上、真机高 55%,仿真还超过 55B 参数的 RT-2-X。

例子研究者在 Realman 和 Franka 两种真实机械臂上测试 CogACT,面对没见过的物体和背景仍能完成操作任务。

相关
视觉-语言-动作模型、扩散动作头、动作专家、OpenVLA、Prismatic VLM、时序集成
来源
CogACT (arXiv 2411.19650)
CogACT 项目主页
信息截至
2024-11

在完整名词表里查看 →