具身智能新手名词表English

Seer(预测式逆动力学模型)

Seer: Predictive Inverse Dynamics Models are Scalable Learners for Robotic ManipulationPIDM进阶

先预测接下来的画面、再用逆动力学推出动作的端到端机器人操作策略

上海人工智能实验室等机构 2024 年 12 月发布,入选 ICLR 2025 口头报告。常见做法要么直接从当前画面模仿动作(行为克隆),要么先用视频模型生成未来画面、再单独推算动作,两步分开训练。Seer 提出「预测式逆动力学模型」(PIDM):在一个端到端训练的 Transformer 里,先预测机器人接下来会看到的画面,再用逆动力学模型(根据当前状态和目标状态反推该做什么动作)从「现在」和「预测的未来」之间算出动作,视觉预测和动作预测一起优化。它可以先在 DROID 等大规模机器人数据上预训练,再少量微调到下游任务。论文报告相比此前最好的方法,在 LIBERO-LONG 上提升 13%,在 CALVIN ABC-D 上提升 21%,真机任务提升 43%。

例子执行「打开抽屉」时,Seer 先预测下一刻夹爪贴近把手的画面,再根据当前画面和这张预测图算出机械臂该怎么移动。

也叫
Seer、预测式逆动力学模型、Predictive Inverse Dynamics Model
相关
逆动力学模型、视频预测策略、DROID 数据集、CALVIN、LIBERO、上海人工智能实验室
来源
Predictive Inverse Dynamics Models are Scalable Learners for Robotic Manipulation (arXiv 2412.15109)
OpenRobotLab/Seer (GitHub)
信息截至
2025-01

在完整名词表里查看 →