具身智能新手名词表English

稠密奖励

Dense Reward常用

几乎每一步都给反馈、告诉智能体离目标更近还是更远的奖励设计。

稠密奖励指强化学习中几乎每个时间步都给出有信息量的奖励,与只在任务成功时才给奖励的稀疏奖励相对。它通常由人把任务拆成若干项加权相加,如到目标的距离、速度跟踪误差、能耗惩罚。好处是智能体从一开始就知道往哪个方向改进,学得快;腿足运控的强化学习几乎都用稠密奖励。代价是设计费力,各项权重没调好时,智能体会钻空子刷分而不完成真正的目标,即奖励黑客。Eureka 等工作尝试让大模型自动写这类奖励函数代码。

例子Gymnasium-Robotics 的 FetchReach 有两个版本:稀疏版在末端离目标超过 5 厘米时每步给 -1、到达给 0;稠密版 FetchReachDense 每步给末端到目标的负欧氏距离。legged_gym 的四足行走奖励由速度跟踪、关节力矩惩罚、碰撞惩罚等多项组成,每个仿真步都计算。

也叫
密集奖励、稠密回报
相关
稀疏奖励、奖励塑形、奖励函数、奖励工程、奖励黑客、Eureka
来源
Gymnasium-Robotics: Fetch Reach
Learning to Walk in Minutes Using Massively Parallel Deep Reinforcement Learning (arXiv 2109.11978)

在完整名词表里查看 →