具身智能新手名词表English

OmniManip

OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints进阶

把 VLM 的推理落成物体坐标系里「点+方向」约束的零样本操作框架

北京大学董豪团队与智元机器人(PKU-AgiBot 联合实验室)2025 年 1 月发布,CVPR 2025 Highlight。VLM 懂常识,却给不出精确的三维位置和朝向。OmniManip 先把物体摆进它的标准空间(canonical space,按功能对齐的物体自身坐标系),在里面取「交互点+交互方向」这类交互原语,当作空间约束交给 VLM 挑选和验证;执行时用 6D 位姿跟踪实时更新轨迹,于是规划和执行各有一个闭环。整个过程不微调 VLM,就能在多种操作任务上零样本泛化。它和 ReKep、VoxPoser、CoPa 同属「VLM + 中间表示」路线,作者也提到可用它自动生成仿真数据。

例子以「把茶倒进杯子」为例:VLM 先认出茶壶和杯子,在茶壶的标准空间里取壶嘴点和倾倒方向、在杯子上取杯口点,据此求出末端位姿;执行中持续跟踪两者的 6D 位姿并修正轨迹。

相关
ReKep、VoxPoser、CoPa、可供性、中间表示、6D位姿估计
来源
arXiv 2501.03841: OmniManip
OmniManip 项目主页
信息截至
2025-06

在完整名词表里查看 →