具身智能新手名词表English

BAGEL

BAGEL: Emerging Properties in Unified Multimodal Pretraining (ByteDance Seed)进阶

字节 Seed 开源的统一多模态模型,同一个模型既能看懂图也能生成和编辑图

BAGEL 是字节跳动 Seed 团队 2025 年 5 月开源的统一多模态基础模型,代码和权重以 Apache 2.0 协议发布,一个模型同时做图文理解、文生图和图像编辑。它以 Qwen2.5 大语言模型为基础,采用混合 Transformer(MoT)结构:理解专家和生成专家各有一套参数,但每层所有 token 共享自注意力,激活参数 7B、总参数 14B;理解侧用 SigLIP2 视觉编码器,生成侧用 FLUX 的 VAE 把图像压到潜空间。模型在数万亿 token 的图文、视频、网页交错数据上预训练,论文报告随规模增大出现了自由形式图像编辑、未来帧预测、视角旋转和「世界导航」等能力。它展示了把理解和生成放进同一个模型的做法,和具身方向的统一多模态模型、世界模型路线相关。

例子给 BAGEL 一张图和一句修改指令,它能直接输出编辑后的图片;给出前进、转向等导航指令,它能生成视角移动后的画面。

也叫
BAGEL-7B-MoT
相关
统一多模态模型、混合 Transformer 架构、SigLIP、变分自编码器、世界模型、字节跳动 Seed
来源
BAGEL: Emerging Properties in Unified Multimodal Pretraining (arXiv 2505.14683)
ByteDance-Seed/Bagel GitHub
BAGEL 论文 HTML 版
信息截至
2025-05

在完整名词表里查看 →