分箱离散化
Action Binning / Discretization常用把每个连续动作维度等分成若干区间,用区间编号当离散 token。
分箱离散化是把连续机器人动作变成离散符号的最简单办法:对每个动作维度(如末端 x 方向位移、夹爪开合)划定取值范围,等分成若干个「箱」,用数值落入的箱编号代表它。RT-2 把每维分成 256 个箱,再把箱编号对应到语言模型词表里的 token,动作就能像文字一样被预测。OpenVLA 沿用 256 箱,但用训练数据的第 1 和第 99 百分位代替最小、最大值来定范围,避免个别离群值把区间撑大、降低精度。缺点是每个时间步、每个维度都要一个 token,高频控制时 token 多且相邻 token 高度相关,模型难学,FAST 等压缩式动作分词器就是为此提出的。
例子若 x 方向位移的范围是 -2 到 2 厘米,分成 256 箱后每箱宽约 0.016 厘米,0.5 厘米就记为第 160 号箱。
- 也叫
- 动作离散化、分桶、动作分箱、Action Binning
- 相关
- 动作分词器、动作表示、离散余弦变换、RT-2、OpenVLA、π0-FAST
- 来源
- OpenVLA: An Open-Source Vision-Language-Action Model (arXiv:2406.09246)
RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control (arXiv:2307.15818)
FAST: Efficient Action Tokenization for Vision-Language-Action Models (arXiv:2501.09747)