具身智能新手名词表English

确定性策略 / 随机策略

Deterministic vs. Stochastic Policy进阶

确定性策略同一状态总给同一动作;随机策略给出动作的概率分布再采样。

这是按输出形式对策略(从观测到动作的映射)做的分类。确定性策略写作 a = μ(s),同一状态永远输出同一个动作;随机策略写作 a ~ π(·|s),输出的是动作的概率分布,每次采样可能不同。离散动作常用分类分布,像分类器一样用 softmax 给出各动作概率;连续动作常用对角高斯分布,网络输出均值和对数标准差。强化学习里随机策略自带探索,PPO、SAC 用的都是它;DDPG、TD3 用确定性策略,训练时另外加噪声探索,好处是策略梯度估计更高效。模仿学习里用均方误差回归的行为克隆本质上是确定性的,演示中同一场景有多种做法时会被平均成一个错误动作;扩散策略、高斯混合模型等随机策略能表示这种动作多峰性。

例子机械臂绕过障碍物去抓杯子,演示里一半从左绕、一半从右绕。用均方误差回归的确定性策略会输出两者的平均,直直撞向障碍物;扩散策略这类随机策略每次采样会落在左绕或右绕中的一种。

也叫
确定性策略、随机策略、Deterministic Policy、Stochastic Policy
相关
策略、高斯策略、动作多峰性、深度确定性策略梯度、扩散策略、探索与利用
来源
OpenAI Spinning Up: Key Concepts in RL (Policies)
Deterministic Policy Gradient Algorithms (ICML 2014)
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)

在完整名词表里查看 →