Q-Transformer
Q-Transformer: Scalable Offline Reinforcement Learning via Autoregressive Q-Functions进阶用 Transformer 逐个动作维度估计 Q 值的大规模离线强化学习方法
Google DeepMind 的 Yevgen Chebotar、Sergey Levine 等人 2023 年 9 月发布,发表于 CoRL 2023。它要解决的是:机器人既有人类演示、又有大量自主采集(含失败)的数据,怎样用离线强化学习(只用已有数据训练)把两者都用上。做法是用 Transformer 表示 Q 函数(给「状态+动作」打分的价值函数):把每个动作维度离散成若干档,像生成 token 一样逐维预测 Q 值;再用保守正则(把没见过的动作压到最低值)和蒙特卡洛回报稳定训练。在 RT-1 的真机多任务上,它优于 RT-1、IQL 和决策 Transformer,尤其善于利用失败数据。
例子在 RT-1 的真机多任务数据上,Q-Transformer 把人类演示和机器人自主尝试得到的失败片段一起用于训练,比只模仿成功演示的 RT-1 表现更好。
- 相关
- QT-Opt、离线强化学习、Q 函数、RT-1、保守 Q 学习、决策 Transformer
- 来源
- Q-Transformer (arXiv 2309.10150)
Q-Transformer project page - 信息截至
- 2023-09