动作空间
Action Space入门必知智能体每一步能做出的所有动作的集合,以及动作的数值格式。
动作空间是强化学习和机器人学习的基础概念,指智能体每一步可选的全部动作。它分两类:离散动作空间只有有限个选项,比如 Atari 游戏的几个按键;连续动作空间里动作是一串实数,比如机械臂各关节的目标角度,或末端执行器(臂最末端的夹爪或工具)的位移加夹爪开合。机器人的底层控制基本是连续动作空间,但也有离散的例子,如具身导航基准常用「前进、左转、右转、停止」几个动作。同一任务可以用关节角或末端位姿、增量或绝对值来表示动作,不同机器人的维度也不同,这正是跨本体训练要处理的难题。VLA 模型常见的做法是把连续动作离散成 token 输出,或用扩散、流匹配、直接回归等方式生成连续值。
例子CartPole 小车只有「向左推」「向右推」两个动作,是离散动作空间;OpenVLA 输出的机械臂动作是 3 维平移 + 3 维旋转 + 1 维夹爪开合,共 7 维连续动作空间。
- 也叫
- 连续动作空间、离散动作空间、Continuous Action Space、Discrete Action Space
- 相关
- 状态空间、观测、策略、增量动作 / 绝对动作、动作分词器、统一动作空间
- 来源
- OpenAI Spinning Up: Key Concepts in RL
Gymnasium Documentation: Basic Usage