具身智能新手名词表English

可学习查询

Learnable Query / Action Query进阶

作为模型参数训练的一组向量,通过注意力从输入中汇总任务需要的信息。

可学习查询是一组随机初始化、随训练更新的向量,本身不来自输入,而是在注意力计算中充当「查询」去读取输入特征,把需要的信息汇总到固定数量的输出上。2020 年 Facebook 的目标检测模型 DETR 用一组 object query,每个输出一个检测结果;2023 年 BLIP-2 的 Q-Former 用 32 个可学习查询从冻结的图像编码器中抽取视觉特征,再送进大语言模型。机器人模型里,Octo 在序列中插入读出 token:它们能看到前面的观测和任务 token,却不会被这些 token 看到,动作头在其输出上生成动作;2025 年的 VLA-Adapter 在视觉语言模型中加入 ActionQuery(实验中 64 个效果最好),专门汇总与动作相关的多模态信息交给策略网络。它的作用是把长度不定的输入压缩成固定大小、面向任务的表示。

例子BLIP-2 中,一张图片先被视觉编码器变成数百个特征 token,Q-Former 的 32 个查询向量通过交叉注意力把它们汇总成 32 个输出,投影后接在文字前面送进大语言模型。

也叫
动作查询、Action Query、读出 token、Readout Token、Object Query、查询向量
相关
Q-Former、交叉注意力、Perceiver 重采样器、动作头、Octo、VLA-Adapter
来源
BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and LLMs (arXiv:2301.12597)
Octo: An Open-Source Generalist Robot Policy (arXiv:2405.12213)
VLA-Adapter: An Effective Paradigm for Tiny-Scale VLA Model (arXiv:2509.09372)
信息截至
2025-09

在完整名词表里查看 →