vLLM
进阶开源的大语言模型高吞吐推理与服务引擎。
vLLM 起源于加州大学伯克利分校 Sky Computing 实验室,核心技术 PagedAttention 发表于 SOSP 2023。大模型推理时,每条请求都要保存 KV 缓存(已生成内容的注意力键值),长度不定,传统做法按最大长度预留显存,浪费严重。PagedAttention 借鉴操作系统分页,把 KV 缓存切成小块按需分配,再配合连续批处理(新请求随时插入正在运行的批次),同一张卡能同时服务更多请求。它支持主流开源 LLM 和 VLM,可一键起 OpenAI 兼容的 API。具身里常用于部署任务规划用的大模型,也被 veRL 等框架用作强化学习的生成引擎。
例子在服务器上运行 vllm serve 加载一个 Qwen2.5-VL 模型,机器人端通过 HTTP 发送图像和指令,拿回分解好的子任务列表。
- 相关
- KV 缓存、大语言模型、视觉语言模型、TensorRT-LLM、veRL、推理部署
- 来源
- vllm-project/vllm GitHub
Efficient Memory Management for Large Language Model Serving with PagedAttention (arXiv)