解码策略(贪心 / 温度采样 / Top-k / Top-p)
Decoding Strategies (Greedy / Temperature / Top-k / Top-p Sampling)进阶模型给出下一个 token 的概率分布后,决定具体选哪个 token 的规则。
自回归模型每一步只输出一个概率分布,解码策略决定从中怎么挑。贪心解码每步选概率最大的,结果确定但容易重复;束搜索同时保留几条候选序列;采样则按概率随机抽。温度用来调分布的尖锐程度,温度越低越接近贪心,越高越随机。Top-k 只在概率最高的 k 个里抽,Fan 等人 2018 年把它用于故事生成;Top-p(核采样)只在累计概率刚超过 p 的最小集合里抽,由 Holtzman 等人 2019 年提出,用来缓解最大化解码带来的乏味重复。同一个模型换解码策略,输出质量可能差别很大。输出动作 token 的 VLA 部署时常关掉随机采样,让动作更稳定。
例子OpenVLA 官方示例调用 predict_action 时设置 do_sample=False,即对动作 token 做贪心解码,同一画面、同一指令每次得到相同动作。
- 也叫
- 采样策略、核采样、Nucleus Sampling、束搜索
- 相关
- 自回归解码、大语言模型、动作分词器、最优 N 采样、推理时计算、Softmax(归一化指数函数)
- 来源
- How to generate text: using different decoding methods for language generation with Transformers (Hugging Face)
The Curious Case of Neural Text Degeneration (arXiv:1904.09751)
openvla/openvla-7b model card