MolmoAct
MolmoAct: Action Reasoning Models that can Reason in Space (Ai2)进阶Ai2 开源的「动作推理模型」,先推深度、画轨迹,再输出动作的 VLA
Ai2 在 2025 年 8 月发布,基于自家的 Molmo 视觉语言模型,70 亿参数,模型、代码、数据和评测脚本全部开源。它把 VLA 的决策拆成三步:先输出带深度信息的感知 token 理解三维空间,再在图像上画出末端要走的路点轨迹,最后把轨迹解码成机械臂和夹爪的具体动作。因为计划轨迹直接叠在图像上,人能在执行前看到它打算怎么做,也可以在手机或平板上画出路径来引导它。发布时报告在 SimplerEnv 分布外任务上成功率 72.1%、LIBERO 上 86.6%。2026 年 5 月的 MolmoAct2 改用具身推理骨干 Molmo2-ER,接上流匹配动作专家,单次动作推理从约 6.7 秒降到 180 毫秒,并开放了 720 多小时的双臂 YAM 数据集。
例子给指令「把枕头摆到沙发上」,MolmoAct 先在相机画面上画出一条从枕头到沙发的轨迹,用户确认或在平板上改画后,它再转成机械臂动作执行。
- 也叫
- MolmoAct2、MolmoAct 2、Action Reasoning Model (ARM)
- 相关
- 视觉-语言-动作模型、Molmo、具身推理、动作思维链、流匹配、BimanualYAM 数据集
- 来源
- MolmoAct (Ai2 blog)
MolmoAct: Action Reasoning Models that can Reason in Space (arXiv 2508.07917)
MolmoAct 2 (Ai2 blog) - 信息截至
- 2026-05