状态空间
State Space常用系统所有可能状态的集合;机器人里常由关节角、位姿、速度等量构成。
在强化学习和控制里,状态是描述系统此刻情况、足以预测下一步变化的一组量,所有可能状态合起来就是状态空间。马尔可夫决策过程(MDP,强化学习的标准数学框架)把它记作 S,可以是离散的(如棋盘格子),也可以是连续的(实数向量)。机器人的状态通常包括关节角与角速度、末端位姿、夹爪开合,以及物体的位置等。真实机器人往往拿不到完整状态,只能通过相机和传感器得到「观测」,这时问题就变成部分可观测 MDP。VLA 论文里的 state 多指机器人自身的关节量,与图像一起输入模型。它和 Mamba 这类「状态空间模型」不是一回事。
例子一台 7 自由度机械臂加平行夹爪,本体状态可以是 7 个关节角、7 个关节角速度和 1 个夹爪开度,共 15 维实数向量。
- 也叫
- 状态、State、状态集合
- 相关
- 观测、动作空间、马尔可夫决策过程、部分可观测马尔可夫决策过程、本体感知、状态空间模型
- 来源
- Markov decision process - Wikipedia
State space (computer science) - Wikipedia