具身智能新手名词表English

ChatVLA

ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model进阶

既能看图问答、又能控制机器人的统一 VLA 模型。

ChatVLA 由美的集团、华东师范大学等团队 2025 年 2 月提出,入选 EMNLP 2025 主会口头报告。它针对 VLA 的一个常见毛病:在机器人数据上微调后,底座 VLM 原有的看图问答能力会被冲掉(论文称为虚假遗忘),而控制和理解两类数据一起训又会互相干扰。做法有二:一是分阶段对齐训练,先只用机器人数据练会控制,再按 1:3 混入图文数据恢复理解能力;二是混合专家结构,注意力层共享,前馈层分成理解专家和控制专家,按任务走不同路径。模型基于 Qwen2-VL-2B,在 MMStar 上得 47.2 分,多模态理解明显强于以往 VLA,在 25 个真机任务上也优于 OpenVLA 和 ECoT。

例子同一个 ChatVLA 既能回答关于图片的问题,也能在浴室、厨房、桌面等场景执行抓取、放置、推、挂等操作指令。

相关
视觉-语言-动作模型、灾难性遗忘、混合专家模型、协同训练、DexVLA、知识隔离
来源
ChatVLA (arXiv 2502.14420)
ChatVLA 项目主页
信息截至
2025-11

在完整名词表里查看 →