具身智能新手名词表English

世界模型评测

World-Model-based Policy Evaluation常用

用可交互的视频世界模型代替真机,闭环推演策略来估计它的表现。

世界模型评测是把机器人策略接到一个以动作为条件的视频生成模型上闭环运行:策略看生成的画面输出动作,世界模型据此预测接下来的画面,如此循环,最后由人或视觉语言模型判断任务是否完成。它针对的是真机评测慢、贵、难复现,而传统仿真器搭场景费力、画面和物理又不够真的问题。2025 年起出现了 WorldEval、WorldGym、Ctrl-World 等工作;谷歌 DeepMind 用 Veo 视频模型评测 Gemini Robotics 策略,并以 1600 多次真机评测对照,显示它能预测不同策略的相对优劣,还能用于分布外泛化和安全红队测试。2026 年仍有新工作跟进,当前主要用来给检查点排序和筛查风险。

例子谷歌 DeepMind 在 Veo 世界模拟器里给场景换上新物体、新背景和干扰物,比较 8 个 Gemini Robotics 策略检查点在 5 个双臂任务上的表现,再用真机结果验证排序是否一致。

也叫
世界模型当评估器、基于世界模型的策略评估、World Model as Policy Evaluator
相关
世界模型、Veo 世界模拟器、WorldEval、Ctrl-World、仿真-真机相关性、真机评测
来源
Evaluating Gemini Robotics Policies in a Veo World Simulator (arXiv 2512.10675)
WorldEval: World Model as Real-World Robot Policies Evaluator (arXiv 2505.19017)
信息截至
2026-07

在完整名词表里查看 →