具身智能新手名词表English

组相对策略优化

Group Relative Policy OptimizationGRPO常用

对同一输入采样一组结果,用组内相对得分代替价值网络的强化学习算法。

GRPO 由 DeepSeek 团队在 2024 年 2 月的 DeepSeekMath 论文中提出,是 PPO(近端策略优化)的变体。PPO 要额外训练一个和策略差不多大的价值网络(评论家)估计基线,GRPO 去掉了它:对同一个输入采样一组输出,分别打分,再用「得分减组内均值、除以组内标准差」作为每个输出的优势,省下大量显存。它还把与参考模型的 KL 散度(偏离程度)直接加进损失,约束更新幅度。DeepSeek-R1 用 GRPO 训练推理能力后,它被广泛采用。具身领域也开始用它对 VLA 做强化学习微调:同一任务推演多条轨迹,按成功与否给 0 或 1 的奖励。

例子SimpleVLA-RL 用 GRPO 训练 OpenVLA-OFT:每个任务采样 8 条轨迹,成功记 1、失败记 0,去掉 KL 项,并过滤全成功或全失败的组,LIBERO 平均成功率从 91.0% 提到 99.1%。

也叫
群组相对策略优化
相关
近端策略优化、优势函数、强化学习微调、基于可验证奖励的强化学习、KL 正则化、SimpleVLA-RL
来源
DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning
信息截至
2025-09

在完整名词表里查看 →