具身智能新手名词表English

扩散策略

Diffusion Policy: Visuomotor Policy Learning via Action DiffusionDP入门必知

用扩散模型从噪声中逐步「去噪」生成机器人动作序列的模仿学习策略。

扩散策略由哥伦比亚大学宋舒然组的 Cheng Chi 等人与丰田研究院、MIT 合作提出,2023 年 3 月上线 arXiv,发表于 RSS 2023,扩展版 2024 年刊于 IJRR。它把策略写成条件去噪扩散过程:以相机图像等观测为条件,从随机噪声出发逐步去噪,得到一段未来动作。好处是能表达动作多峰性——同一场景下有几种都对的做法时,不会像直接回归那样把它们平均成一个错误动作。论文还结合了滚动时域控制(预测一段、执行一部分、再重新预测),在 4 个基准的 12 个任务上比当时最好的方法平均提升 46.9%。它是后来 3D 扩散策略、π0 等模型里扩散/流匹配动作头的重要来源。

例子Push-T 是它的招牌任务:机器人用一根圆柱末端把桌上的 T 形块推到指定位置和朝向。从左侧或右侧绕过去推都可以,演示里两种做法都有,扩散策略两种都学会,但每次执行只坚持其中一种。

也叫
Diffusion Policy、DP
相关
扩散模型、动作多峰性、去噪扩散概率模型、动作分块、3D 扩散策略、Push-T
来源
Diffusion Policy: Visuomotor Policy Learning via Action Diffusion (arXiv 2303.04137)
Diffusion Policy 项目主页
信息截至
2024-03

在完整名词表里查看 →