噪声空间策略引导
Noise-Space Policy Steering进阶不改扩散策略的权重,只用强化学习挑选它的输入噪声,从而改变输出动作。
扩散策略和流匹配策略生成动作时,先采一个随机噪声,再逐步去噪变成动作;同一个模型换一个输入噪声,就会给出不同的动作。噪声空间策略引导把这个噪声当作可控的「动作」:冻结原策略,另训一个小的强化学习策略,根据当前观测输出该用哪个噪声,让原策略产出更好的动作。代表方法是 UC Berkeley 等团队 2025 年提出的 DSRL。它只需黑盒调用原策略,不必对多步去噪过程反向传播,也不改大模型权重,因此样本效率高,适合在真机上在线改进,可用于 π0 这类通用 VLA 的现场适配。相应地,改进幅度受原策略能生成的动作范围所限。
例子DSRL 引导在 DROID 数据上训练的公开 π0 检查点,让 Franka 机械臂打开烤面包机,约 80 个在线回合后成功率从 5/20 提升到 18/20。
- 也叫
- 扩散噪声空间强化学习、潜在噪声空间 RL、扩散引导(Diffusion Steering)
- 相关
- DSRL(扩散策略噪声空间强化学习)、扩散策略、流匹配、强化学习微调、残差强化学习、π0
- 来源
- Wagenmaker et al. 2025: Steering Your Diffusion Policy with Latent Space Reinforcement Learning (DSRL)
- 信息截至
- 2025-06