北京人形 Pelican-VL
Pelican-VL: A Foundation Brain Model for Embodied Intelligence (X-Humanoid)进阶北京人形机器人创新中心开源的具身「大脑」视觉语言模型
北京人形机器人创新中心(X-Humanoid)2025 年 10 月底发布技术报告、11 月开源权重的具身大脑模型,基于 Qwen2.5-VL,首批开源 7B 和 72B 两个规格(Apache 2.0)。它不直接输出关节动作,而是负责空间理解、可供性推理、任务规划和函数调用,给下层控制器或 VLA 下指令。训练上提出 DPPO(刻意练习策略优化):先用 GRPO 强化学习找出模型做不好的难例,再把难例整理成数据做监督微调,RL 与 SFT 循环交替。报告称相对基座平均提升 20.3%,在 Where2Place、RefSpatialBench 等具身基准上领先同量级开源模型。其 Hugging Face 主页后来又上传了 3B、235B-A22B 等规格。
例子报告中的真机实验:模型根据画面预测并持续修正抓取力度,完成接触丰富的抓取;另一个实验里由它充当统一的「大脑」,调度多台不同机器人完成长程任务。
- 也叫
- Pelican-VL 1.0、Pelican1.0-VL
- 相关
- 具身推理模型、视觉语言模型、通义千问 Qwen-VL、组相对策略优化、大脑-小脑架构(大小脑)、北京人形机器人创新中心
- 来源
- arXiv 2511.00108: Pelican-VL 1.0
Hugging Face: X-Humanoid/Pelican1.0-VL-7B
Hugging Face: X-Humanoid 组织页 - 信息截至
- 2026-09