具身智能新手名词表English

小米 Xiaomi-Robotics-0

Xiaomi-Robotics-0: An Open-Sourced Vision-Language-Action Model with Real-Time Execution进阶

小米开源的 47 亿参数 VLA,主打在消费级显卡上实时、流畅地执行动作

小米 2026 年 2 月发布并开源的视觉-语言-动作模型,共 47 亿参数,以 Qwen3-VL-4B 为视觉语言骨干,外接一个用流匹配生成动作的扩散 Transformer 动作专家。预训练用了约 2 亿时间步的跨本体机器人轨迹(DROID、MolmoAct 数据及自采数据)和 8000 万条以上视觉语言数据。它重点解决推理慢导致的动作卡顿:采用异步执行,边执行上一段动作边推理下一段,并把已确定执行的动作作为前缀喂回模型,配合 Λ 形注意力掩码保证前后衔接平滑,在 RTX 4090 上推理延迟约 80 毫秒。2026 年 7 月小米又发布了用 10 万小时以上真机数据训练的 Xiaomi-Robotics-1。

例子官方报告 LIBERO 平均成功率 98.7%、CALVIN ABC→D 平均连续完成 4.75 个任务;真机上演示了拆乐高和叠毛巾两个双臂任务。

相关
视觉-语言-动作模型、异步推理、实时动作分块、动作专家、小米、小米 MiMo-Embodied
来源
Xiaomi-Robotics-0 (arXiv:2602.12684)
Xiaomi-Robotics-0 技术报告 HTML 版
Xiaomi-Robotics-1 (arXiv:2607.15330)
信息截至
2026-07

在完整名词表里查看 →