具身智能新手名词表English

想象中学习

Learning in Imagination (World-Model-Based RL)进阶

先学一个世界模型,再让策略在模型「想象」出的轨迹里训练。

想象中学习是基于模型的强化学习的一种做法:先用真实交互数据学一个世界模型(根据当前状态和动作预测下一步和奖励的模型),再让策略在世界模型生成的虚拟轨迹里反复试错,少碰真实环境。Ha 与 Schmidhuber 2018 年的 World Models 论文较早演示了这一思路;Hafner 等人的 Dreamer 系列把它做成通用算法:在压缩的潜在空间里想象轨迹,并把价值估计的梯度沿轨迹回传来训练策略。好处是省真机交互、更安全;风险是世界模型不准时,策略会学到只在「梦里」有效的漏洞。

例子DayDreamer(2022)在真机上运行 Dreamer,四足机器人约 1 小时真实交互就从零学会站立和行走;Dreamer 4(2025)只用离线数据在世界模型里训练,成为首个这样在《我的世界》中拿到钻石的智能体。

也叫
在世界模型中训练、世界模型强化学习、梦境训练
相关
世界模型、基于模型的强化学习、DreamerV3、Dreamer 4、DayDreamer、World Models 论文(Ha & Schmidhuber)
来源
Dream to Control: Learning Behaviors by Latent Imagination (Dreamer, arXiv:1912.01603)
DayDreamer: World Models for Physical Robot Learning (arXiv:2206.14176)
Training Agents Inside of Scalable World Models (Dreamer 4, arXiv:2509.24527)
信息截至
2025-09

在完整名词表里查看 →