具身智能新手名词表English

PoliFormer

PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators进阶

用大规模同策略强化学习训练的 Transformer 导航策略,仿真训完直接上真机

艾伦人工智能研究所(Ai2)2024 年 6 月发布,CoRL 2024 论文。它只用 RGB 图像:视觉 Transformer 编码器(代码中用 DINOv2)编码每一帧,再接一个因果 Transformer 解码器汇总较长的历史,输出导航动作。训练完全在仿真里:在 ProcTHOR 程序化生成的大量房屋中做同策略强化学习,多机并行推演,累计数亿次交互。它在 CHORES-S 物体目标导航基准上成功率 85.5%,比此前最好方法绝对提升 28.5 个百分点;不经额外调整就能部署到 LoCoBot 和 Stretch RE-1 两种真机,还能直接用于物体跟踪、开放词汇导航等下游任务。它说明强化学习配上 Transformer 和大规模仿真同样能靠规模涨性能。

例子对 Stretch 机器人说「找到厨房里的苹果」,PoliFormer 只根据头部摄像头画面逐步决定前进或转向,看到苹果后停在旁边。

相关
物体目标导航、同策略、ProcTHOR、AI2-THOR、艾伦人工智能研究所、仿真到现实迁移
来源
arXiv 2406.20083: PoliFormer
GitHub: allenai/poliformer
信息截至
2024-11

在完整名词表里查看 →