08仿真与评测
在电脑里练和考:仿真器怎么工作、仿真和真机的差距,以及常用的评测基准。 · 210 条
- 8.1仿真基本概念14
- 8.2物理引擎:刚体与接触19
- 8.3软体、流体与可微仿真10
- 8.4渲染与传感器仿真12
- 8.5主流仿真器与框架26
- 8.6场景、资产与室内平台17
- 8.7从仿真到真机19
- 8.8评测方法与指标21
- 8.9桌面操作基准28
- 8.10家务、导航与问答基准13
- 8.11强化学习与运动控制基准14
- 8.12真机与世界模型评测17
8.1仿真基本概念
在电脑里练机器人的第一步:仿真器是什么、怎么一步步交互、怎样又快又真。
- 仿真器Simulator在电脑里模拟机器人、物体和传感器怎么运动、怎么相互作用的软件。
- 物理引擎Physics Engine按物理规律一步步计算物体受力、碰撞和运动的软件核心。
- 环境(Env)与 reset / step 接口Environment (Env; reset/step interface)强化学习和机器人仿真的标准交互接口:reset 开一局,step 执行一步动作。
- 推演Rollout让策略在环境里从开始一直执行到结束,得到一整段交互轨迹。
- 终止与截断Termination vs. Truncation回合结束分两种:任务本身到头叫终止,因步数上限被人为打断叫截断。
- 仿真步长Simulation Timestep物理引擎每算一步推进的仿真时间,决定精度、稳定性和速度。
- 控制降频Control Decimation策略每出一个动作,物理引擎要跑几个仿真步;这个步数就是 decimation。
- 子步Substeps把一个仿真步再切成几段小步积分,换取更稳定、更准的物理。
- 实时因子Real-Time Factor仿真时间与现实流逝时间之比,衡量仿真比现实跑得快还是慢。
- 并行环境Vectorized Environments同时运行许多份相互独立的环境副本,一次批量收集交互数据。
- GPU 并行仿真GPU-Accelerated Parallel Simulation在一张 GPU 上同时跑成千上万个仿真环境,把机器人训练从几天缩到几分钟。
- 仿真吞吐量Simulation Throughput (Steps / Frames Per Second)仿真器每秒能产出多少环境步或帧,决定造数据和训练有多快
- 无头模式Headless Mode不开图形窗口运行仿真器,常用于在服务器上批量训练和采集数据。
- 仿真保真度Simulation Fidelity仿真和真实世界有多像:物理上算得准不准,看起来像不像。
8.2物理引擎:刚体与接触
拆开上一节的物理引擎,看它每一步怎样算刚体运动、碰撞和接触力。
- 刚体仿真Rigid-Body Simulation假设物体不会变形,只计算它们平移、转动和相互碰撞的物理仿真。
- 关节体仿真Articulated-Body Simulation (Articulation)把机器人当作由关节串起来的一组刚体,计算它怎么运动、受多大力的仿真。
- 关节坐标仿真 vs 笛卡尔坐标仿真(约化坐标 / 最大坐标)Generalized (Reduced) Coordinates vs. Cartesian (Maximal) Coordinates Simulation物理引擎描述多连杆机器人的两种方式:按关节角算,还是各刚体单独算再加约束。
- 碰撞检测(物理引擎)Collision Detection物理引擎每一步找出哪些物体碰上了、碰在哪、穿进去多深。
- 碰撞体Collision Geometry (Collider)物理引擎用来算碰撞的简化形状,通常和画面上看到的模型不是同一个。
- 凸分解Convex Decomposition (Approximate Convex Decomposition)把凹形网格切成若干近似凸块,给仿真当碰撞体用
- 符号距离场Signed Distance Field / Function给出空间每一点到物体表面的距离、并用正负号区分内外的函数
- 宽相 / 窄相碰撞检测Broad-phase / Narrow-phase Collision Detection碰撞检测分两步:先用包围盒粗筛可能相撞的对,再精确算接触。
- 碰撞过滤(碰撞组)Collision Filtering (Collision Groups)事先规定哪些物体之间不算碰撞,既省计算又避免不该有的接触。
- 连续碰撞检测(隧穿问题)Continuous Collision Detection (Tunneling)按物体在一步内的运动轨迹找碰撞,防止高速物体直接穿过障碍物。
- 穿模Interpenetration仿真或动画里本该挡住的两个物体互相穿进对方体内的错误现象。
- 接触模型Contact Model物理引擎里规定两个物体接触时产生多大力、怎么摩擦的数学规则。
- 软接触Soft Contact Model允许物体间有微小穿透、按弹簧阻尼方式产生接触力的接触建模方式
- 约束求解器Constraint Solver物理引擎里算接触力和关节约束力的模块,保证物体不穿透、关节不脱开。
- 线性互补问题Linear Complementarity Problem求两组非负变量「一个为正另一个就为零」的数学问题,经典接触力求解就归结为它。
- 投影高斯-赛德尔求解器Projected Gauss-Seidel物理引擎中逐个约束迭代求解接触力、并截断到合法范围的经典方法。
- 求解器迭代次数Solver Iteration Count (Position / Velocity Iterations)物理引擎每一步反复修正接触和关节约束的轮数,越多越准也越慢
- 积分器Numerical Integrator (Semi-implicit Euler / RK4)物理引擎里根据当前受力,把速度和位置往前推进一个时间步的数值方法。
- 仿真爆炸Simulation Instability (Blow-up)物理仿真数值发散,机器人抽搐、物体乱飞,状态变成 NaN 或极大值。
8.3软体、流体与可微仿真
从不变形的刚体扩展到布、绳、液体等会变形的物体,再看能求梯度的仿真。
- 软体仿真Deformable-Body Simulation模拟布、绳、海绵、面团、液体这类会变形物体的物理仿真。
- 布料仿真Cloth Simulation在计算机里模拟布料拉伸、弯曲、褶皱和碰撞,衣物操作研究离不开它。
- 流体仿真Fluid Simulation用数值方法在计算机里模拟水、烟等流体怎么流动、怎么受力。
- 有限元法Finite Element Method把物体切成许多小单元分别近似求解、再拼成整体的数值计算方法。
- 基于位置的动力学Position-Based Dynamics直接修正物体位置来满足约束的仿真方法,稳定快速,常用于布料和软体。
- 物质点法Material Point Method用粒子携带材料状态、借背景网格计算受力的连续体仿真方法。
- 光滑粒子流体动力学Smoothed Particle Hydrodynamics把流体拆成大量粒子、用邻近粒子加权求和来计算运动的无网格仿真方法
- 离散元法Discrete Element Method把材料当成大量独立颗粒、逐个算受力和运动的仿真方法
- 增量势接触Incremental Potential Contact用障碍势能保证物体永不相互穿透的接触仿真算法,擅长软体大变形接触。
- 可微仿真Differentiable Simulation能对仿真结果求梯度的仿真器,可以直接用梯度下降优化动作或物理参数。
8.4渲染与传感器仿真
物理之外的另一半:把场景画成相机图像,并模拟触觉等传感器的读数。
- 渲染Rendering (Rendering Engine)把三维场景算成相机图像的过程,仿真里相机类传感器的数据都靠它生成。
- 光栅化Rasterization把三维三角形投影到屏幕并逐像素上色的渲染方法,速度快,是实时图形主流。
- 光线追踪Ray Tracing从相机反向追踪光线的反射、折射来生成图像的渲染方法,真实感高但慢。
- 路径追踪Path Tracing用大量随机光线路径模拟光在场景里的多次反弹,渲染出物理上逼真画面的方法。
- 基于物理的渲染Physically Based Rendering按真实光学规律建模光照和材质的渲染思路,让物体在任何光照下看起来都可信。
- 照片级真实感渲染Photorealistic Rendering按真实光学规律计算画面,让仿真图像看起来像真实相机拍的照片。
- 批量渲染Batched / Tiled Rendering一次性渲染成百上千个并行环境的相机画面,给视觉策略训练高速供图。
- 传感器仿真Sensor Simulation在仿真器里生成相机、激光雷达、IMU、力传感器等的模拟读数。
- 触觉仿真Tactile Simulation在仿真器里模拟触觉传感器读数,让带触觉的策略能在仿真中训练。
- TACTOTACTO: A Fast, Flexible, and Open-source Simulator for High-Resolution Vision-based Tactile SensorsMeta 开源的视触觉仿真器,配合 PyBullet 渲染 DIGIT 等触觉图像。
- TaximTaxim: An Example-based Simulation Model for GelSight Tactile Sensors用少量真实数据标定的 GelSight 视触觉传感器样例式仿真模型。
- TacSL 视触觉仿真库TacSL: A Library for Visuotactile Sensor Simulation and Learning英伟达开源的 GPU 视触觉传感器仿真与策略学习库。
8.5主流仿真器与框架
物理和渲染落到具体软件上:MuJoCo、Isaac 两大家族和其他常用仿真器。
- MuJoCoMuJoCo (Multi-Joint dynamics with Contact)擅长接触模拟的开源物理引擎,由谷歌 DeepMind 维护,机器人研究常用。
- MJXMuJoCo XLA用 JAX 实现的 MuJoCo,在 GPU/TPU 上批量并行仿真,可求导。
- 谷歌用 JAX 写的可微刚体物理引擎,附带强化学习训练库。
- DeepMind 牵头的 GPU 加速机器人学习环境集,单卡快训、零样本上真机。
- DeepMind 与 NVIDIA 用 Warp 重写的 GPU 版 MuJoCo,面向大批量并行。
- PhysXNVIDIA PhysXNVIDIA 的开源实时物理引擎,Isaac Sim 和 Isaac Lab 的物理内核。
- Isaac GymNVIDIA Isaac GymNVIDIA 2021 年推出的 GPU 强化学习仿真器,已停止支持。
- Isaac SimNVIDIA Isaac Sim英伟达基于 Omniverse 的开源机器人仿真器,物理和画面都追求高保真。
- Isaac LabNVIDIA Isaac Lab英伟达开源的 GPU 并行机器人学习框架,用来在仿真里大规模训练策略。
- Orbit / IsaacGymEnvs(Isaac Lab 前身)Orbit / IsaacGymEnvs / OmniIsaacGymEnvs (predecessors of Isaac Lab)英伟达三套已停止维护的机器人学习框架,后来统一被 Isaac Lab 取代。
- 光轮智能开源的 Isaac Lab 遥操作采数框架,把 SO-101 机械臂接进 LeRobot 流程。
- Newton 物理引擎Newton Physics EngineNVIDIA、DeepMind、迪士尼联合发起的开源 GPU 机器人物理引擎。
- 用 Isaac Lab 式接口加 MuJoCo Warp 物理的轻量 GPU 机器人学习框架。
- GenesisGenesis Simulator2024 年底开源的多物理场 GPU 仿真平台,主打速度快、刚体软体流体统一模拟。
- PyBulletPyBullet (Bullet Physics)物理引擎 Bullet 的 Python 接口,早年机器人强化学习最常用的仿真器之一。
- 面向机器人与强化学习的多体物理引擎,以快速精确的接触求解著称。
- SAPIENSAPIEN (SimulAted Part-based Interactive ENvironment)UCSD 开发的机器人仿真平台,擅长抽屉、柜门这类带可动部件的铰接物体交互
- ManiSkillManiSkill (ManiSkill3)UCSD 团队开发的开源机器人操作仿真框架和基准,主打 GPU 并行。
- 基于 MuJoCo 的模块化机器人学习仿真框架和基准,由 ARISE 计划维护。
- RoboMimicrobomimic斯坦福与 UT Austin 研究者做的演示学习框架,含标准数据集和离线学习算法。
- ROS 生态里最常用的开源机器人仿真器,由 Open Robotics 维护。
- 瑞士 Cyberbotics 维护的开源桌面机器人仿真软件,入门友好,常用于教学。
- 瑞士 Coppelia Robotics 的通用机器人仿真器,前身是 V-REP
- 游戏引擎Game Engine开发电子游戏的软件框架,集渲染、物理、动画于一体,也常被拿来做仿真。
- 基于虚幻引擎的开源自动驾驶仿真器,常用于驾驶策略的闭环测试。
- RoboVerseRoboVerse (MetaSim): Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning用统一接口打通多款仿真器的机器人学习平台,附带合成数据集和评测基准
8.6场景、资产与室内平台
有了仿真器,还要往里放东西:物体资产、现成室内场景,以及自动批量造场景。
- 仿真资产Simulation Assets仿真里用的机器人、物体和场景模型,既要外观像,也要带物理属性。
- 铰接物体Articulated Object由关节连接、部件能相对转动或滑动的物体,如柜门、抽屉、笔记本电脑。
- SimReady 资产SimReady Assets英伟达提出的 3D 资产规范:模型自带物理、材质和语义标注,放进仿真即可用
- 高度场地形Heightfield Terrain用二维网格存每个点的地面高度来表示起伏地形,足式机器人训练最常用。
- 艾伦人工智能研究所的可交互室内 3D 仿真环境,常用于导航和家务任务研究。
- VirtualHome 家庭活动仿真VirtualHome: Simulating Household Activities via Programs用「程序」驱动虚拟人在 Unity 家庭场景里做家务的仿真平台。
- HabitatHabitat (Habitat-Sim / Habitat-Lab)Meta 开源的具身智能仿真平台,主要用于室内导航、物体重排和人机协作任务。
- iGibsoniGibson (Interactive Gibson)斯坦福推出的室内交互式仿真平台,用于家庭场景中的导航与移动操作研究。
- 斯坦福基于 Omniverse 的家庭场景仿真器,BEHAVIOR-1K 的底座。
- InternUtopiaInternUtopia (formerly GRUtopia)上海人工智能实验室基于 Isaac Sim 的城市级具身智能仿真平台,原名 GRUtopia。
- 程序化生成Procedural Generation用规则加随机数自动批量造出场景、物体和地形,而不是逐个手工搭建。
- ProcTHORProcTHOR (Large-Scale Embodied AI Using Procedural Generation)艾伦 AI 研究所推出的、程序化批量生成可交互 3D 房屋的具身仿真框架。
- Infinigen 程序化世界生成Infinigen (Infinite Photorealistic Worlds using Procedural Generation; Infinigen Indoors / Infinigen-Articulated)普林斯顿开源的程序化三维世界生成器,所有资产都由随机数学规则从零生成。
- 生成式仿真Generative Simulation用大模型自动生成仿真任务、场景和训练监督,批量产出机器人训练数据。
- Holodeck 语言生成三维环境Holodeck: Language Guided Generation of 3D Embodied AI Environments输入一句话描述,用 GPT-4 和 Objaverse 资产自动生成可交互的三维室内场景。
- MolmoSpacesMolmoSpaces (MolmoSpaces-Bench)艾伦人工智能研究所开放的大规模室内仿真场景与机器人评测生态。
- 智元 Genie SimGenie Sim (AgiBot)智元机器人开源的具身仿真平台,集场景生成、数据合成和评测基准于一体。
8.7从仿真到真机
在仿真里练好后怎么上真机:先认清虚实差距,再学随机化和把现实搬进仿真。
- 虚实差距Sim-to-Real Gap (Reality Gap)仿真和真实世界之间的差异,导致仿真里练好的策略上真机后变差。
- 仿真到现实迁移Sim-to-Real Transfer把在仿真里训练好的策略搬到真机上,并让它照样能用。
- 现实到仿真Real-to-Sim把真实场景、物体和机器人复刻进仿真器,让仿真尽量贴近现实。
- 真-仿-真闭环Real-to-Sim-to-Real先把真实场景复刻进仿真,在仿真里训练或造数据,再把策略部署回真机。
- 域随机化Domain Randomization在仿真里随机改变外观和物理参数,让策略把真实世界当成又一种变化。
- 动力学随机化Dynamics Randomization训练时随机改变仿真里的质量、摩擦等物理参数,让策略能适应真机。
- 视觉随机化Visual Randomization训练时随机改变仿真画面的纹理、颜色、光照和相机,让视觉策略不挑画面。
- Omniverse Replicator 合成数据生成NVIDIA Omniverse Replicator英伟达 Omniverse 里的合成数据框架,随机化仿真场景并自动输出带标注的数据。
- 自动域随机化Automatic Domain Randomization随策略变强自动扩大随机化范围的域随机化方法,由 OpenAI 提出。
- 执行器建模Actuator Modeling (Actuator Network)在仿真里模拟真实电机从收到指令到输出力矩的响应,缩小虚实差距。
- Factory / IndustReal 接触丰富装配仿真Factory: Fast Contact for Robotic Assembly / IndustReal: Transferring Contact-Rich Assembly Tasks from Simulation to Reality英伟达的装配仿真与迁移方案:先把拧螺母这类接触仿真做快,再把策略搬到真机。
- 仿真到仿真迁移Sim-to-Sim Transfer把在一个仿真器里训好的策略放到另一个仿真器里跑,提前暴露问题。
- 硬件在环 / 软件在环仿真Hardware-in-the-Loop / Software-in-the-Loop Simulation把真控制器或真控制代码接到仿真的被控对象上测试,是上真机前的验证手段。
- 数字孪生Digital Twin与真实物体、机器人或工厂一一对应,并用真实数据保持同步的虚拟副本。
- 数字表亲Digital Cousin不求一比一复刻、只求几何和语义相似的仿真场景
- 高斯泼溅仿真Gaussian Splatting-based Simulation用 3D 高斯泼溅重建真实场景来渲染画面,再配合物理引擎算运动的仿真方式。
- RoboGSimRoboGSim: A Real2Sim2Real Robotic Gaussian Splatting Simulator用 3D 高斯泼溅重建真实场景、再接上物理引擎的机器人仿真器
- DISCOVERSEDISCOVERSE: Efficient Robot Simulation in Complex High-Fidelity Environments用 3D 高斯泼溅渲染加 MuJoCo 物理的开源真-仿-真仿真框架
- GS-PlaygroundGS-Playground: A High-Throughput Photorealistic Simulator for Vision-Informed Robot Learning清华等推出的高吞吐仿真器,用批量 3D 高斯泼溅快速渲染真实感画面。
8.8评测方法与指标
练完开始考:成功率怎么算,真机和仿真怎么测,结果怎样才可信、可比。
- 成功率Success Rate策略多次试做同一任务时成功的比例,是最常用的机器人评测指标。
- 真机评测Real-world Evaluation把策略部署到真实机器人上反复试跑,统计成功率等指标。
- 仿真评测Simulation-based Evaluation把策略放进仿真环境里批量跑任务、统计成功率,代替或补充真机测试。
- 闭环评测Closed-loop Evaluation让策略真正控制机器人、边看边做,按任务最后有没有完成来打分。
- 开环评测Open-loop Evaluation不让策略真去控制,只在离线数据上比预测动作和演示动作差多少。
- 离线策略评估Off-Policy Evaluation只用其他策略收集的历史数据,估计一个新策略真正部署后能拿到多少回报。
- 基准测试Benchmark一套固定的任务、数据和评分规则,让不同方法在同样条件下比高低。
- 评测协议Evaluation Protocol规定策略在什么条件下测、测几次、怎样算成功的一套规则
- 基线方法Baseline论文里拿来做对照的已有方法或简单方法,用来衡量新方法到底好多少。
- 最先进水平State of the Art某个任务或基准上当前公开报告的最好结果,常缩写为 SOTA。
- 消融实验Ablation Study去掉或替换方法里的某个组件,看性能怎么变,以判断它到底有没有用。
- 评测统计显著性(置信区间 / 序贯检验 / 多随机种子)Statistical Rigor in Policy Evaluation (Confidence Intervals / Sequential Testing / Multiple Seeds)用统计方法判断策略之间的成功率差距是真提升还是运气。
- 泛化与鲁棒性评测Generalization / Robustness Evaluation (Perturbation Test)故意改变光照、位置、物体、指令等条件,测策略离开训练环境后还剩几成本事。
- 进度分数Progress Score按机器人完成了任务的几步来给分,而不只记成功或失败的评测指标。
- 干预率Intervention Rate策略自主运行时需要人出手接管或纠正的频率,越低说明越能独立干活。
- 平均干预间隔Mean Time Between Interventions机器人连续工作时,平均隔多久需要人来干预一次。
- 仿真-真机相关性Sim-to-Real Correlation (Pearson r)衡量仿真评测成绩能否反映真机表现,常用皮尔逊相关系数 r 表示。
- 平均最大排名违背Mean Maximum Rank Violation衡量仿真评测给策略排的名次是否与真机一致的指标,越低越好。
- Elo 评分Elo Rating (Bradley-Terry Model)用两两对比的胜负结果,估算每个选手或策略相对实力的打分方法。
- 双盲成对比较Double-blind Pairwise Comparison评测者不知道谁是谁,只判断两个策略哪个更好的评测方式
- 基准饱和Benchmark Saturation主流模型在某个基准上分数都接近满分,它再也分不出方法好坏。
8.9桌面操作基准
用上一节的方法读具体考卷,先从最常见的机械臂桌面操作基准开始。
- LIBEROLIBERO Benchmark (Benchmarking Knowledge Transfer for Lifelong Robot Learning)含 130 个桌面操作任务的仿真基准,VLA 论文最常报的榜单之一。
- LIBERO-PlusLIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models在 LIBERO 上加 7 类扰动、专门检验 VLA 鲁棒性的评测基准。
- LIBERO-PROLIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization给 LIBERO 加物体、位置、指令、环境扰动,检验 VLA 是否在死记硬背。
- SimplerEnvSimplerEnv (SIMPLER: Simulated Manipulation Policy Evaluation for Real Robot Setups)照着常用真机场景复刻的仿真评测套件,用来低成本给操作策略打分。
- 视觉匹配Visual Matching (SimplerEnv)SimplerEnv 的一种评测设置:把仿真画面做得尽量和真机相机画面一样。
- 变体聚合Variant Aggregation (SimplerEnv)SimplerEnv 的评测方式之一:在多个视觉变体场景里测策略再取平均。
- CALVINCALVIN Benchmark考机器人能否连续听懂并完成 5 条语言指令的桌面操作仿真基准。
- 平均完成长度Average Length (CALVIN)CALVIN 评测里策略平均能连续完成几条指令,满分 5。
- 伦敦帝国理工推出的 100 个机械臂操作任务仿真基准,基于 CoppeliaSim。
- 基于 RLBench 的仿真基准,分四级测语言操作策略对新任务的泛化能力。
- The ColosseumThe Colosseum: A Benchmark for Evaluating Generalization for Robotic Manipulation在 RLBench 任务上系统施加 14 类环境扰动,测操作策略泛化能力的基准。
- 用圆形推头把 T 形块推到目标位姿的二维任务,常用来测模仿学习策略。
- ALOHA 仿真任务ALOHA Sim (Transfer Cube / Insertion)ACT 论文在 MuJoCo 里搭的两个双臂仿真任务:交接方块和空中插销。
- RoboTwinRoboTwin (RoboTwin 2.0)港大、上海 AI 实验室等推出的双臂操作仿真数据生成器与评测基准。
- 含 50 个机械臂操作任务的仿真基准,用来测多任务和元强化学习。
- MuJoCo 厨房场景,Franka 机械臂按顺序完成开微波炉、挪水壶等子任务。
- Adroit 灵巧手任务Adroit (Dexterous Manipulation Suite with ShadowHand in MuJoCo)在 MuJoCo 中控制 24 自由度仿真五指手完成开门、敲钉等四项任务的基准。
- Bi-DexHandsBi-DexHands (DexterousHands)北京大学团队基于 Isaac Gym 的双 Shadow 灵巧手强化学习基准。
- SoftGymSoftGym: Benchmarking Deep Reinforcement Learning for Deformable Object Manipulation基于英伟达 FleX 的柔性物体操作仿真基准,包含布料、绳子和液体任务
- 用图文交错的多模态提示描述任务的桌面操作仿真基准,带四级泛化测试。
- GenManipGenManip: LLM-driven Simulation for Generalizable Instruction-Following Manipulation上海 AI 实验室基于 Isaac Sim、用大模型自动造任务的操作仿真评测平台。
- ARNOLDARNOLD (A Benchmark for Language-Grounded Task Learning with Continuous States in Realistic 3D Scenes)在 Isaac Sim 中考察机器人按语言把物体操作到指定连续状态的基准。
- VLABenchVLABench: A Large-Scale Benchmark for Language-Conditioned Robotics Manipulation with Long-Horizon Reasoning Tasks复旦发布的语言条件操作基准,侧重常识、隐含意图和长程多步推理。
- RoboCerebraRoboCerebra (A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation)评测机器人长程操作中规划、反思与记忆能力的大规模仿真基准。
- 专测机器人记忆能力的桌面操作基准,任务要求记住被遮挡或已消失的信息。
- VLA-ArenaVLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models北大团队的开源 VLA 评测框架,按任务、语言、视觉三条轴分级测能力边界。
- Isaac Lab-ArenaNVIDIA Isaac Lab-Arena英伟达开源的 Isaac Lab 扩展,用来组合搭建仿真基准、并行评测机器人策略。
- 光轮 RoboFinals 工业级仿真评测平台RoboFinals (Lightwheel industrial-grade simulation evaluation platform)光轮智能推出、专门评测 VLA 等机器人基础模型的工业级仿真评测平台。
8.10家务、导航与问答基准
从桌面扩展到整栋房子:长程家务、语言导航、具身问答和大模型当大脑。
- RoboCasaRoboCasa (RoboCasa365)UT Austin 做的大规模厨房家务仿真框架与基准,最新版叫 RoboCasa365。
- BEHAVIOR-1KBEHAVIOR-1K (BEHAVIOR Challenge)斯坦福做的 1000 个日常家务任务仿真基准,跑在 OmniGibson 上。
- 开放词汇移动操作基准Open-Vocabulary Mobile Manipulation (HomeRobot OVMM)让机器人在没见过的房子里找到任意指定物体,并放到指定家具上的评测基准。
- ALFREDALFRED (Action Learning From Realistic Environments and Directives)让智能体按自然语言指令在仿真家庭里完成多步家务的基准。
- ALFWorldALFWorld (Aligning Text and Embodied Environments for Interactive Learning)把 ALFRED 家务任务同步做成文字游戏,可先在文字里学、再到画面中执行。
- R2R / VLN-CE 视觉语言导航基准Room-to-Room / VLN in Continuous Environments视觉语言导航最常用的基准:照着人写的路线说明在陌生房屋里走到终点。
- 导航误差 / Oracle 成功率 / 轨迹长度Navigation Error / Oracle Success Rate / Trajectory Length视觉语言导航的三项基本指标:停下时离目标多远、途中是否到过目标、一共走了多远。
- 路径长度加权成功率Success weighted by Path Length导航评测指标:既看有没有到达目标,也看走的路是否接近最短路径。
- 归一化动态时间规整normalized Dynamic Time Warping衡量智能体路线与参考路线在形状和顺序上有多贴合的导航指标,取值 0 到 1。
- OpenEQA 开放词汇具身问答基准OpenEQA (Open-Vocabulary Embodied Question Answering Benchmark)Meta 推出的具身问答基准,考智能体能否凭对真实环境的观察用自然语言答题。
- ERQA 具身推理问答基准ERQA (Embodied Reasoning Question Answer Benchmark)谷歌 DeepMind 发布的 400 道具身推理图文选择题基准
- EmbodiedBenchEmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents评测多模态大模型当具身智能体大脑能力的基准,含 4 个环境
- Embodied Arena 具身评测竞技场Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI统一接入具身问答、导航、任务规划基准并实时排榜的评测平台
8.11强化学习与运动控制基准
换一类任务:强化学习的经典考题,以及足式、人形机器人练走路的环境和基准。
- Atari 游戏基准(街机学习环境 / Atari 100k)Arcade Learning Environment / Atari 100k用雅达利 2600 游戏测试强化学习的标准平台;Atari 100k 是小样本版。
- Minecraft 环境(MineDojo / MineRL)Minecraft Environments (MineDojo / MineRL)基于游戏《我的世界》搭建的开放世界智能体训练与评测平台。
- Gym MuJoCo 连续控制任务Gym/Gymnasium MuJoCo Tasks (HalfCheetah, Hopper, Walker2d, Ant, Humanoid)Gymnasium 里基于 MuJoCo 的一组经典连续控制环境,强化学习论文的常用考题。
- DeepMind 控制套件DeepMind Control SuiteDeepMind 基于 MuJoCo 的连续控制强化学习标准任务集
- D4RL 离线强化学习基准D4RL: Datasets for Deep Data-Driven Reinforcement Learning离线强化学习领域最常用的标准数据集和评测基准
- OGBench 离线目标条件强化学习基准OGBench: Benchmarking Offline Goal-Conditioned RL专门考离线目标条件强化学习算法的基准,含 8 类环境、85 个数据集。
- legged_gymlegged_gym (Isaac Gym Environments for Legged Robots)ETH 开源的足式机器人强化学习训练环境,基于 Isaac Gym。
- unitree_rl_gymunitree_rl_gym (Unitree RL Gym)宇树官方开源的强化学习运控示例框架,覆盖仿真训练到真机部署。
- robot_lab(Isaac Lab 强化学习扩展库)robot_lab (RL extension library based on Isaac Lab)基于 Isaac Lab 的开源库,内置多款四足、轮足和人形机器人的强化学习训练环境
- Humanoid-GymHumanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer星动纪元开源的人形机器人强化学习行走训练框架,主打零样本仿真到真机。
- ProtoMotionsProtoMotions (NVIDIA GPU-accelerated humanoid simulation & learning framework)英伟达开源的、用 GPU 仿真训练数字人和人形机器人运动技能的框架。
- HumanoidBenchHumanoidBench: Simulated Humanoid Benchmark for Whole-Body Locomotion and Manipulation伯克利等推出的仿真人形机器人基准,含 27 个全身运动与操作任务。
- LocoMuJoCoLocoMuJoCo (Imitation Learning Benchmark for Whole-Body Locomotion)基于 MuJoCo 的全身运动模仿学习基准,含人形、四足和人体肌骨模型。
- 平均关节位置误差Mean Per-Joint Position Error预测关节位置与真值的平均距离,衡量姿态估计或动作跟踪有多准。
8.12真机与世界模型评测
跳出固定的仿真考卷:真机上大规模评测,用世界模型评策略,以及怎么评世界模型。
- FurnitureBenchFurnitureBench: Reproducible Real-World Benchmark for Long-Horizon Complex ManipulationKAIST 等提出的可复现真机家具组装基准,考长程、精细的机器人操作。
- AutoEvalAutoEval (Autonomous Evaluation of Generalist Robot Manipulation Policies in the Real World)伯克利搭建的全天候无人值守真机评测系统,自动判成败、自动复位。
- 多个实验室分布式做真机双盲对比,再汇总成排名的通用机器人策略评测平台。
- 原力灵机与 Hugging Face 办的真机在线评测平台,首个基准叫 Table30。
- RoboDojoRoboDojo (A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies)统一仿真与真机的通用操作策略评测基准,含 42 个仿真和 18 个真机任务。
- RobotArena ∞RobotArena Infinity (RobotArena ∞: Scalable Robot Benchmarking via Real-to-Sim Translation)把真实机器人视频自动转成仿真场景,再靠打分和人类投票给 VLA 排名的评测基准
- 神经模拟器Neural Simulator (Learned Simulator)用神经网络从数据里学出来的模拟器,代替手写物理方程预测下一步。
- 世界模型评测World-Model-based Policy Evaluation用可交互的视频世界模型代替真机,闭环推演策略来估计它的表现。
- WorldEvalWorldEval: World Model as Real-World Robot Policies Evaluator用视频世界模型代替真机跑推演,给机器人策略打分和排名的评测方法。
- 弗雷歇初始距离Fréchet Inception Distance衡量一批生成图像与真实图像在整体分布上有多接近的指标,越低越好。
- 弗雷歇视频距离Fréchet Video Distance衡量一批生成视频与真实视频整体有多像的指标,数值越低越好。
- PSNR / SSIM / LPIPS 图像相似度指标Peak Signal-to-Noise Ratio / Structural Similarity Index / Learned Perceptual Image Patch Similarity衡量生成图和参考图有多像的三项常用指标,越往后越贴近人眼感受。
- VBench 视频生成评测基准VBench: Comprehensive Benchmark Suite for Video Generative Models把视频生成质量拆成 16 个维度分别打分的开源评测基准。
- WorldScore 世界生成评测WorldScore: A Unified Evaluation Benchmark for World Generation斯坦福的世界生成统一评测,让 3D、4D 场景生成和视频模型用同一把尺子比。
- Physics-IQ 物理理解基准Physics-IQ (Do generative video models understand physical principles?)用真实拍摄的视频检验视频生成模型是否真懂物理规律的基准。
- EWMBench 具身世界模型评测EWMBench: Evaluating Scene, Motion, and Semantic Quality in Embodied World Models智元等提出的基准,专门评测机器人操作视频生成模型生成得对不对。
- WorldArena 具身世界模型基准WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models清华牵头的具身世界模型基准,同时考生成画面质量和对下游任务的实际用处。