自回归-扩散混合架构
Hybrid Autoregressive-Diffusion Architecture进阶同一个模型里,离散内容用自回归逐个生成、连续内容用扩散生成的架构。
自回归指像大语言模型那样按顺序逐个预测下一个 token,擅长文本、推理这类离散内容;扩散模型从噪声出发逐步去噪,擅长图像、动作这类连续高维数据。混合架构把两者放进同一个网络。Meta 等机构 2024 年提出的 Transfusion 用一个 Transformer 处理图文混排序列,对文字算下一个 token 预测损失、对图像算扩散损失;何恺明等人的 MAR 则在自回归框架里用扩散损失建模每个连续值 token,省掉了向量量化。机器人领域,2025 年的 HybridVLA 让一个大语言模型同时做扩散去噪和自回归动作预测,再自适应地融合两路动作。动机在于:把连续动作硬切成离散 token 会损失精度,纯扩散的动作头又较难直接利用语言模型的推理能力。
例子HybridVLA 在同一个语言模型里,既通过扩散去噪生成连续动作,又自回归地预测离散化的动作 token,执行时把两路结果融合成最终动作。
- 也叫
- 自回归与扩散混合模型、AR + Diffusion、Hybrid AR-Diffusion
- 相关
- HybridVLA、扩散模型、自回归解码、统一多模态模型、扩散动作头、动作分词器
- 来源
- Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model (arXiv:2408.11039)
Autoregressive Image Generation without Vector Quantization (MAR, arXiv:2406.11838)
HybridVLA: Collaborative Diffusion and Autoregression in a Unified VLA Model (arXiv:2503.10631) - 信息截至
- 2025-06