上海AI实验室 InternVLA 系列
InternVLA (Shanghai AI Laboratory: InternVLA-M1 / A1 / A1.5 / N1)进阶上海 AI 实验室开源的一组具身模型:M1、A1 做操作,N1 做导航。
InternVLA 是上海人工智能实验室具身团队(GitHub 组织 InternRobotics)开源的一组 VLA(视觉-语言-动作模型)。InternVLA-M1(2025 年 10 月)以 Qwen2.5-VL 为骨干,先用 230 万条框、点、轨迹标注做空间定位预训练,再用空间提示引导扩散 Transformer 动作专家出动作。InternVLA-A1(2026 年 1 月,有 2B 和 3B 两个尺寸)用混合 Transformer 架构把理解、未来画面预测、动作三个专家放进一个模型,在真机数据、合成仿真数据(如 InternData-A1)和人类视频上预训练,共 6.92 亿帧。A1.5(2026 年 7 月)改用 Qwen3.5-2B,训练时让冻结的 Wan2.2 视频模型监督「预见 token」,推理时不生成视频。InternVLA-N1 用于导航:慢系统在图像上标出路点,快系统用扩散策略以 30Hz 以上出轨迹。
例子InternVLA-A1 做传送带分拣时,要先预判物体下一刻移到哪里再去抓;论文当前版本称在这类动态任务上比 π0.5 高 26.7%。
- 也叫
- InternVLA-M1、InternVLA-A1、InternVLA-A1.5、InternVLA-N1
- 相关
- 视觉-语言-动作模型、快慢双系统、InternData-A1 数据集、视觉语言导航、上海人工智能实验室、世界动作模型
- 来源
- InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy (arXiv 2510.13778)
InternVLA-A1: Unifying Understanding, Generation and Action for Robotic Manipulation (arXiv 2601.02456)
InternVLA-N1 项目主页 - 信息截至
- 2026-07