Embodied-R1
Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation进阶天津大学的 3B 具身推理模型,以「指向」为中间表示,用强化微调训练。
Embodied-R1 是天津大学团队 2025 年 8 月发布的工作,已被 ICLR 2026 接收。作者把「看得懂却做不到」称为 seeing-to-doing gap,提出用「指向」(在图上输出点、区域或一串轨迹点)作为与机器人本体无关的中间表示,定义了指代定位、区域定位、功能部位定位和视觉轨迹生成四种能力。模型基于 Qwen2.5-VL-3B,在自建的 Embodied-Points-200K 数据上做两阶段强化微调:用 GRPO 算法,按任务设计可自动判分的奖励。模型输出的点和轨迹再交给运动规划等底层模块去执行。权重和数据集已开源。
例子不做任何任务专门微调,Embodied-R1 在 SimplerEnv 仿真中成功率 56.2%,在 8 个 xArm 真机任务上达到 87.5%,论文称比强基线提升 62%。
- 也叫
- Embodied R1
- 相关
- 具身推理模型、指向(点预测)、强化学习微调、组相对策略优化、中间表示、可供性
- 来源
- Embodied-R1: Reinforced Embodied Reasoning for General Robotic Manipulation (arXiv 2508.13998)
Embodied-R1 GitHub 仓库 - 信息截至
- 2026-03