上下文长度
Context Length进阶模型一次最多能处理的 token 数,决定它能同时「看到」多少输入
上下文长度(也叫上下文窗口)指 Transformer 类模型一次能处理的 token 总数上限,按 token 计,不按字数。超出长度的内容要么被截断,要么得先摘要再输入。自注意力的计算量随序列长度平方增长,KV 缓存占的显存随长度线性增长,所以上下文越长,推理越慢、越占显存。据 IBM 2024 年 10 月的整理,GPT-4o 和 Llama 3.1 为 12.8 万 token,Gemini 1.5 Pro 最高 200 万 token。对 VLA 来说图像特别占上下文:PaliGemma 在 224×224 分辨率下每张图就是 256 个视觉 token,多相机、多帧历史会让序列迅速变长,这是很多 VLA 只看当前帧、需要另外设计记忆模块或剪枝视觉 token 的原因之一。
例子用 PaliGemma 编码 3 路 224×224 相机画面,仅图像就占 768 个 token;如果每路再带 4 帧历史,就是 12 张图、3072 个 token。
- 也叫
- 上下文窗口、Context Window
- 相关
- token(词元)、KV 缓存、视觉 token、具身记忆、记忆增强 VLA、视觉 token 剪枝
- 来源
- What is a context window? (IBM Think)
PaliGemma – Google's Cutting-Edge Open Vision Language Model (Hugging Face Blog) - 信息截至
- 2024-10