具身智能新手名词表English

重要性采样

Importance Sampling进阶

用一个分布采的样本,乘上两分布的概率比作权重,估计另一个分布下的期望。

一种蒙特卡洛估计技巧。想求分布 p 下某个量的期望,手上却只有从分布 q 采来的样本,就给每个样本乘上权重 p(x)/q(x),加权平均后仍是对 p 下期望的无偏估计(前提是 q 能覆盖 p 可能取到的值)。在强化学习里,p 和 q 通常是两个策略:用旧策略或行为策略采的数据去评估、更新新策略,权重就是新旧策略在同一动作上的概率比。异策略学习和离线策略评估都要用它;TRPO 和 PPO 目标里的概率比 r(θ) 也是它,PPO 通过裁剪这个比值防止一次更新过大。主要问题是两个分布差得越远,权重方差越大,所以实践中常截断或裁剪权重。

例子PPO 每轮用旧策略采一批数据,再在这批数据上更新好几遍,每条数据的损失都乘以新旧策略概率比,并把比值裁剪到 [1−ε, 1+ε]。

也叫
重要性权重、Importance Weighting
相关
异策略、近端策略优化、离线策略评估、策略梯度、信赖域策略优化、蒙特卡洛方法(蒙特卡洛回报)
来源
Importance sampling (Wikipedia)
Policy Gradient Algorithms (Lilian Weng)

在完整名词表里查看 →