具身智能新手名词表English

通义千问 Qwen-VL

Qwen-VL series (Qwen-VL / Qwen2-VL / Qwen2.5-VL / Qwen3-VL)Qwen-VL常用

阿里通义千问团队的开源视觉语言模型系列,常被用作 VLA 的骨干。

Qwen-VL 是阿里巴巴通义千问(Qwen)团队发布的视觉语言模型系列,能看图、看视频并用文字回答。初代发布于 2023 年 8 月;Qwen2.5-VL 发布于 2025 年初,有 3B 到 72B 多种规模,支持动态分辨率输入,能用框或点标出物体位置;Qwen3-VL 从 2025 年 9 月起陆续发布,有 2B 到 32B 的稠密版和 30B-A3B、235B-A22B 两个混合专家版,原生支持 256K 上下文。权重开放、有小尺寸、定位能力强,使它常被选作 VLA 的视觉语言骨干。2026 年 2 月起的 Qwen3.5 等主线模型本身已原生支持图像输入。

例子小米 Xiaomi-Robotics-0 以 Qwen3-VL-4B-Instruct 为视觉语言骨干,后接扩散 Transformer 生成动作;上海 AI 实验室的 InternVLA-M1 用 Qwen2.5-VL-3B 做 System 2。

也叫
通义千问视觉语言模型、千问 VL、Qwen2-VL、Qwen2.5-VL、Qwen3-VL
相关
视觉语言模型、多模态大语言模型、PaliGemma、书生 InternVL、视觉-语言-动作模型、动态分辨率(原生分辨率输入)
来源
QwenLM/Qwen3-VL GitHub (News)
Qwen2.5-VL Technical Report (arXiv 2502.13923)
Xiaomi-Robotics-0 (arXiv 2602.12684)
信息截至
2026-09

在完整名词表里查看 →