具身智能新手名词表English

记忆增强 VLA

Memory-Augmented VLA (Memory-Augmented Vision-Language-Action Model)进阶

给 VLA 加上历史记忆模块,让它依据过去发生的事而不只是当前画面来决策。

记忆增强 VLA 是一类研究方向的统称,不特指某个模型。主流 VLA(视觉-语言-动作模型)大多只看当前一帧或最近几帧来出动作,默认当前画面包含决策所需的全部信息。但很多操作任务依赖历史:按钮按下后外观不变,看不出按过没有;物体被盖住后画面里也看不到。把长历史帧全塞进模型又会让 token 数和推理时间暴涨。这类方法额外维护一个记忆:把过去的观测压缩成特征存入记忆库,决策时检索相关条目、与当前特征融合后交给动作头。代表工作有清华与原力灵机等 2025 年提出的 MemoryVLA;MIKASA-Robo 基准专门用 32 个桌面操作任务测试这种记忆能力。

例子MemoryVLA 的真机任务「按指定颜色顺序按下三个按钮」里,按过和没按过的按钮看起来一样,只看当前画面无法判断进度;MemoryVLA 靠记忆库保存的历史信息完成任务,论文报告其在长程时序任务上比最强基线高出 26 分。

也叫
带记忆的 VLA、Memory VLA
相关
MemoryVLA、视觉-语言-动作模型、具身记忆、长程任务、部分可观测马尔可夫决策过程、历史编码器
来源
MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation (arXiv:2508.19236)
Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning (MIKASA, arXiv:2502.10550)
信息截至
2026-03

在完整名词表里查看 →