具身智能新手名词表English

生数 Vidar

Vidar: VIdeo Diffusion for Action Reasoning (Tsinghua & ShengShu)Vidar进阶

先用视频扩散模型预测未来画面、再反推动作的机器人操作模型

清华大学朱军团队(TSAIL)2025 年 7 月发布,名字取自 VIdeo Diffusion for Action Reasoning;真机实验以生数科技的视频模型 Vidu 2.0 为基座,论文注明部分工作在生数完成,据报道由生数与清华联合推出。思路分两步:视频扩散模型先根据指令和当前画面「想象」接下来的视频;再由掩码逆动力学模型(MIDM,根据前后帧反推动作)把视频翻译成机器人动作,它会自动学出只关注机械臂等与动作相关的像素,以屏蔽背景干扰。视频模型先用 3 个机器人平台、75 万条多视角轨迹做具身领域的继续预训练。换到没见过的机器人上,论文称只需约 20 分钟人类演示即可超过基线,并能泛化到新任务、新背景和新相机布局。

例子给一台新的 Aloha 双臂机器人只采约 20 分钟人类演示做适配,Vidar 就能根据新的语言指令先生成完成任务的视频,再由逆动力学模型把视频逐段翻译成关节动作去执行。

也叫
Vidar: Embodied Video Diffusion Model for Generalist Manipulation
相关
视频生成模型、逆动力学模型、视频预测策略、跨本体、世界动作模型、生数科技
来源
Vidar (arXiv 2507.12898)
Vidar 论文 HTML v4(机构与 Vidu 2.0 基座)
Vidar & AnyPos project page
信息截至
2025-12

在完整名词表里查看 →