小米 MiMo-Embodied
MiMo-Embodied: X-Embodied Foundation Model (Xiaomi)进阶小米开源的 7B 视觉语言模型,同时覆盖自动驾驶和具身智能的理解与规划
小米具身智能团队 2025 年 11 月发布技术报告并开源的视觉语言模型(VLM),参数约 70 亿,权重在 Hugging Face 公开。出发点是:自动驾驶和室内机器人都需要空间理解与规划,却通常各训各的。MiMo-Embodied 把两类数据放进同一个模型,经过多阶段训练、精选数据以及思维链和强化学习微调,同时覆盖具身侧的可供性预测、任务规划、空间理解,和驾驶侧的环境感知、状态预测、驾驶规划。报告称它在 17 个具身基准和 12 个自动驾驶基准上达到或超过同类开源与闭源模型,并观察到两个领域之间存在正迁移,互相促进。它评测的是理解、推理和规划能力,本身不直接输出机器人的关节动作。
例子给它一张厨房照片问「杯子该从哪里抓」,它能在图上指出可抓的位置;给它一段行车画面,它能描述周围车辆状态并给出下一步驾驶规划。
- 也叫
- MiMo-Embodied-7B
- 相关
- 视觉语言模型、具身推理、可供性、空间推理、自动驾驶、跨本体
- 来源
- MiMo-Embodied: X-Embodied Foundation Model Technical Report (arXiv 2511.16518)
XiaomiMiMo/MiMo-Embodied (GitHub) - 信息截至
- 2026-04