Gemini 系列(谷歌多模态大模型)
Google Gemini (multimodal LLM family)常用谷歌 DeepMind 的原生多模态大模型系列,也是 Gemini Robotics 等机器人模型的底座。
Gemini 是谷歌 DeepMind 开发的多模态大模型系列,接替 LaMDA 和 PaLM 2。首版 Gemini 1.0 于 2023 年 12 月发布,分 Ultra、Pro、Nano 三档。它从训练开始就同时处理文字、图像、音频、视频和代码,而不是先训好语言模型再外接视觉模块,这种做法常被称为「原生多模态」。之后迭代很快:2024 年的 1.5(超长上下文),2024 年底到 2025 年的 2.0、2.5,2025 年 11 月的 Gemini 3,截至 2026 年 9 月已更新到 3.x 系列的多个版本。在具身智能里它有两种用法:一是直接调用它看图理解场景、拆解任务、做高层规划;二是当底座训练机器人模型,谷歌 2025 年 3 月发布的 Gemini Robotics(VLA)和 Gemini Robotics-ER(具身推理)都建立在 Gemini 2.0 之上。
例子Gemini Robotics 在 Gemini 2.0 的基础上把「物理动作」加为新的输出模态:模型看到相机画面、听到指令后,直接输出控制机器人的动作。
- 也叫
- Gemini、谷歌 Gemini
- 相关
- 多模态大语言模型、原生多模态、Gemini Robotics、Gemini Robotics-ER、谷歌 DeepMind、视觉语言模型
- 来源
- Gemini: A Family of Highly Capable Multimodal Models (arXiv 2312.11805)
Gemini (language model) - Wikipedia
Gemini Robotics brings AI into the physical world (Google DeepMind blog) - 信息截至
- 2026-09