动作思维链
Action Chain-of-ThoughtACoT进阶让 VLA 先在动作空间里推出一条粗轨迹,再据此生成精细动作
思维链原指大模型先写出中间推理步骤再给答案。VLA 里已有的推理方式多是先预测子任务文字或生成目标图像,这些中间结果都不是动作本身。北京航空航天大学与智元机器人团队 2026 年 1 月提出 ACoT-VLA(已被 CVPR 2026 接收),主张直接在动作空间里推理:显式动作推理器(EAR)用流匹配先生成一条粗粒度参考轨迹;隐式动作推理器(IAR)用可学习查询从 VLM 内部特征中提取潜在动作先验;两路信息再通过交叉注意力引导动作头输出最终动作序列。论文报告 LIBERO 平均成功率 98.5%。它可以看作具身思维链、视觉思维链之后的另一种推理形式。另有 2026 年的导航工作也用 Action-CoT 指代逐步的动作推理。
例子ACoT-VLA 在智元 G1 真机上的三项操作任务里报告平均成功率 66.7%,在 LIBERO-Plus 上监督微调后平均成功率 88.0%。
- 也叫
- Action-CoT、ACoT-VLA
- 相关
- 思维链、具身思维链、视觉思维链、视觉-语言-动作模型、动作头、流匹配
- 来源
- ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models (arXiv 2601.11404)
ACoT-VLA 论文 HTML 版 - 信息截至
- 2026-01