动作分词器
Action Tokenizer常用把连续动作编码成离散 token、推理时再解码回动作的模块。
动作分词器把连续动作(通常是一段动作块)转成离散 token,推理时再解码回可执行的动作,让 VLA 能用「预测下一个 token」的方式输出动作。最简单的是逐维分箱(RT-2、OpenVLA 每维 256 箱),但高频数据里相邻时刻的动作几乎一样,分箱会产生大量冗余 token,模型难学。Physical Intelligence 等 2025 年 1 月提出的 FAST 先对每个动作维度做离散余弦变换(DCT,把信号转到频域),量化后再用字节对编码(BPE)压缩,配合 π0 训练时间最多缩短到约五分之一。另一类做法用向量量化(VQ)学一个动作码本。
例子叠 T 恤任务中 1 秒、50Hz 的动作,逐维分箱需要 700 个 token,FAST 压缩后只要 53 个。
- 也叫
- 动作 tokenizer、动作 token、动作 token 化、Action Tokenization、Action Token
- 相关
- 分箱离散化、离散余弦变换、字节对编码、向量量化、π0-FAST、动作表示
- 来源
- FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv:2501.09747)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246) - 信息截至
- 2025-01