具身智能新手名词表English

DSRL(扩散策略噪声空间强化学习)

Diffusion Steering via Reinforcement Learning (Steering Your Diffusion Policy with Latent Space RL)DSRL进阶

不改扩散策略的权重,只用强化学习挑选输入噪声,引导它产生更好的动作。

DSRL 由 UC 伯克利 Sergey Levine 组的 Andrew Wagenmaker 等人与华盛顿大学、亚马逊的研究者于 2025 年 6 月提出,发表于 CoRL 2025。扩散策略生成动作时先采一个随机噪声再去噪,同一观测下换不同初始噪声会得到不同动作。DSRL 把这个初始噪声当作新的「动作空间」,训练一个小的强化学习策略(MLP)根据观测输出噪声,再交给冻结的扩散策略去噪。基础策略权重完全不动,只需黑盒调用;由于噪声最终都映射成演示数据里合理的动作,探索更有方向,需要的真机交互也少。它适合让行为克隆训练出的策略在新环境里快速自主改进,是噪声空间策略引导的代表工作。

例子作者把公开的 π0(DROID 权重)当作黑盒,只在它的噪声空间上跑强化学习,就在真机操作任务上改进了表现,无需微调 π0 本身。

也叫
Diffusion Steering、扩散引导强化学习
相关
噪声空间策略引导、扩散策略、π0、真机强化学习、残差强化学习、DPPO(扩散策略策略优化)
来源
Steering Your Diffusion Policy with Latent Space Reinforcement Learning (arXiv:2506.15799)
DSRL 项目主页
信息截至
2025-06

在完整名词表里查看 →