具身智能新手名词表English

参考状态初始化

Reference State InitializationRSI进阶

动作模仿训练时,每回合从参考动作的随机时刻开始,而不总从第一帧开始。

参考状态初始化是 Peng 等人 2018 年在 DeepMimic 中提出的强化学习训练技巧,用于让仿真角色或机器人模仿一段参考动作(如动捕数据)。如果每回合都从动作开头出发,策略只能先学前半段再学后半段;像后空翻,不先学会落地,起跳反而更容易摔、得分更低。RSI 每回合随机抽参考动作中的一个时刻,把角色的根部位置、朝向、速度和关节状态直接设成那一帧,让各阶段并行练习。它常和提前终止(摔倒就结束回合)一起用,已是人形机器人动作跟踪训练的常用配置;BeyondMimic 进一步按失败率自适应地选择起始位置。

例子DeepMimic 的消融实验中,不用 RSI 训练的后空翻策略始终没学会完整空翻,只会向后小跳;ASAP 在宇树 G1 上训练模仿 C 罗标志性跳跃等高动态动作时也采用了 RSI。

相关
DeepMimic、提前终止、运动跟踪、ASAP、BeyondMimic、探索与利用
来源
Peng et al. 2018: DeepMimic: Example-Guided Deep Reinforcement Learning of Physics-Based Character Skills
He et al. 2025: ASAP: Aligning Simulation and Real-World Physics for Learning Agile Humanoid Whole-Body Skills
Liao et al. 2025: BeyondMimic

在完整名词表里查看 →