Ctrl-World
Ctrl-World: A Controllable Generative World Model for Robot Manipulation进阶按动作生成多视角未来画面的操作世界模型,用来在「想象」里评测和改进策略。
斯坦福 Chelsea Finn 组与清华陈建宇组 2025 年 10 月提出,收录于 ICLR 2026。评测和改进通用机器人策略通常要大量真机试跑,又慢又贵。Ctrl-World 从 15 亿参数的视频扩散模型 Stable Video Diffusion 初始化,在 DROID 数据集(约 9.5 万条轨迹、564 个场景)上训练成「给动作就生成未来画面」的世界模型,做了三处改动:两个第三视角和一个腕部相机联合预测;稀疏采样历史帧并嵌入机械臂位姿,让模型按位姿找回相关的过去画面,保持长时一致;逐帧注入动作,控制精度到厘米级。策略能在里面连续交互 20 秒以上,用来给 π0、π0-FAST、π0.5 排名与真机结果吻合;从想象中挑成功轨迹微调 π0.5,陌生指令和物体上的成功率从 38.7% 提到 83.4%。
例子给 π0.5 一条没练过的指令,在 Ctrl-World 里通过改写指令、随机重置机械臂跑 400 次想象试验,人工挑出 25–50 条成功轨迹,再用它们微调策略 2000 步。
- 也叫
- 可控机器人世界模型
- 相关
- 世界模型、世界模型评测、DROID 数据集、π0.5、Stable Video Diffusion、合成数据
- 来源
- Ctrl-World (arXiv:2510.10125)
Ctrl-World 项目主页(ICLR 2026) - 信息截至
- 2026-03