GPU 显存
GPU Memory (VRAM)VRAM常用显卡自带的内存,决定能装下多大的模型和批量。
GPU 显存是显卡上独立的高速内存,模型参数、梯度、优化器状态、中间激活值和输入数据都要放在里面才能被 GPU 计算。显存大小直接决定能训练或推理多大的模型、批大小(一次喂进去的样本数)能开多大。训练比推理吃显存得多,因为还要存梯度和优化器状态。显存不够时常见办法有:降低数值精度(如 BF16、INT8 量化)、LoRA 只训练少量参数、梯度检查点、多卡分摊。对具身智能来说,它决定了一个 VLA 模型能否在实验室的显卡上微调,以及能否塞进机器人上的端侧芯片。
例子openpi 文档给出的参考:π0 推理需 8 GB 以上显存,LoRA 微调约 22.5 GB 以上,全参数微调约 70 GB 以上。
- 也叫
- 显存
- 相关
- 参数量、低秩适配、训练后量化、梯度检查点(激活重计算)、批大小、端侧部署
- 来源
- Video random-access memory - Wikipedia
openpi - Physical Intelligence (GitHub)