VLA-0
VLA-0: Building State-of-the-Art VLAs with Zero Modification进阶英伟达提出的极简 VLA:不改模型结构,让 VLM 直接把动作写成数字文本。
VLA-0 是英伟达 Ankit Goyal 等人 2025 年 10 月发布的工作。常见 VLA(视觉-语言-动作模型)要么往视觉语言模型词表里加专门的动作 token,要么外挂动作头;VLA-0 什么都不改,直接让 Qwen2.5-VL-3B 用普通文本输出动作:把每个连续动作维度归一化成 0–1000 的整数写出来,再解码回去。论文指出要让这种做法好用,需要几项技巧:训练时随机遮掉目标数字串里的字符,逼模型看图而不是顺着文本续写;推理时把相邻时刻的预测做集成平均。结果在 LIBERO 上平均成功率 94.7%,超过同样只用该基准数据训练的 OpenVLA-OFT、SmolVLA 等,也超过用了大规模机器人数据预训练的 π0、GR00T N1 等;真机 SO-100 上比 SmolVLA 高 12.5 个百分点。它提醒大家先把简单基线做扎实。
例子给定相机画面和指令,模型像回答问题一样输出一串 0–1000 之间的整数文本,每个数对应一个动作维度,反归一化后交给机械臂执行。
- 也叫
- VLA-0(动作即文本)
- 相关
- 视觉-语言-动作模型、动作分词器、分箱离散化、通义千问 Qwen-VL、LIBERO、SmolVLA
- 来源
- VLA-0: Building State-of-the-Art VLAs with Zero Modification (arXiv 2510.13054)
VLA-0 项目主页 - 信息截至
- 2025-10