动作分块强化学习
Q-Chunking (Reinforcement Learning with Action Chunking)QC进阶策略和 Q 函数都以「一段连续动作」为单位来做强化学习。
Q-chunking 是伯克利 Sergey Levine 团队 2025 年提出的强化学习方法,面向离线到在线(先用已有数据训练,再上线交互)的长程、稀疏奖励任务。它把模仿学习里常用的动作分块搬进强化学习:策略一次输出连续 h 步动作,Q 函数(评判动作好坏的网络)也以「状态 + 整段动作」为输入。好处有两点:按块执行让探索更连贯,能沿用离线数据里的行为习惯;整段动作一起评估,可以做无偏的多步时序差分更新,价值传得更快。为防止策略偏离数据,它从流匹配策略里采样多个动作块、挑 Q 值最高的一个,或加蒸馏约束。
例子在 OGBench 的方块、拼图类操作任务和 robomimic 任务上,先离线预训练 100 万步、再在线交互 100 万步,块长取 5 的 Q-chunking 明显优于 RLPD 等离线到在线基线,任务越难差距越大。
- 也叫
- Q-chunking、Q 分块
- 相关
- 动作分块、离线到在线强化学习、时序差分学习、利用先验数据的强化学习、流匹配、稀疏奖励
- 来源
- Li, Zhou, Levine 2025: Reinforcement Learning with Action Chunking
- 信息截至
- 2025-07