书生 InternVL
InternVL (Shanghai AI Laboratory open VLM series)InternVL进阶上海 AI 实验室开源的视觉语言模型系列,起点是一个 60 亿参数的视觉编码器。
InternVL 是上海人工智能实验室 OpenGVLab 团队开源的视觉语言模型系列,中文名「书生·万象」。初代论文 2023 年 12 月发布,入选 CVPR 2024 口头报告,思路是把视觉编码器 InternViT 放大到 60 亿参数,再逐步与大语言模型对齐,在 32 个视觉-语言基准上评测。此后的 1.5、2、2.5、3、3.5 版沿用「视觉编码器 + MLP 投影层 + 大语言模型」结构,尺寸从 10 亿到 2410 亿总参数不等,代码以 MIT 协议开源,截至 2026 年 9 月最新是 3.5 系列。具身领域常把它当作 VLA(视觉-语言-动作模型)的视觉语言骨干。
例子智元 GO-1 的潜在规划器以 InternVL2.5-2B 为骨干:它读入多路相机画面和指令,先预测潜在动作 token,再交给动作专家生成连续动作。
- 也叫
- 书生·万象、InternVL-Chat、OpenGVLab InternVL
- 相关
- 视觉语言模型、多模态大语言模型、上海人工智能实验室、InternVL(书生·万象)、上海AI实验室 InternVLA 系列、智元 GO-1(启元大模型)
- 来源
- InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks (arXiv 2312.14238)
OpenGVLab/InternVL (GitHub) - 信息截至
- 2026-09