动作表示
Action Representation常用用什么量、相对什么坐标、什么格式来描述机器人要做的动作。
动作表示指策略输出的动作用什么形式来写,是搭机器人学习系统时最先要定的事之一。它包含几层选择:控制什么量(关节角度、末端执行器位姿,还是速度、力矩);相对于什么(全局绝对坐标、相对上一步的增量,还是相对当前位姿的一整段轨迹);旋转怎么写(欧拉角、四元数,或被证明对神经网络更连续、更好学的 6D 表示);以及输出格式(连续数值、离散 token,或潜在动作、轨迹点等更抽象的中间表示)。同一个模型换一种动作表示,成功率可能差很多,所以论文里通常会专门说明并做对比。
例子UMI 论文在摆杯子任务上对比:相对当前末端位姿的整段轨迹成功 20/20,逐步增量 16/20(误差会累积),全局绝对坐标只有 5/20。
- 也叫
- 动作参数化、Action Parameterization
- 相关
- 动作空间、增量动作 / 绝对动作、6D 旋转表示、动作分词器、潜在动作、末端位姿
- 来源
- Universal Manipulation Interface (UMI, arXiv:2402.10329)
On the Continuity of Rotation Representations in Neural Networks (arXiv:1812.07035)
A Survey on Vision-Language-Action Models: An Action Tokenization Perspective (arXiv:2507.01925)