视觉思维链
Visual Chain-of-ThoughtVisual CoT进阶让模型先产出图像、框选区域等视觉中间结果,再据此给出答案或动作。
思维链(CoT)原本指让大语言模型先写出推理步骤再给答案;视觉思维链把中间步骤换成视觉形式。在多模态大模型领域,2024 年 Shao 等人发布的 Visual CoT 数据集含 43.8 万条带中间边界框的问答,训练模型先圈出图中关键区域、聚焦细看,再作答。机器人领域更常见的是先「想象」目标画面:2025 年英伟达、斯坦福等提出的 CoT-VLA(CVPR 2025)先自回归生成一张未来的子目标图像,再生成动作块,真机任务比此前最好的 VLA 高 17%,仿真高 6%。好处是把「要达到什么状态」显式画出来,便于检查、利于长程任务;代价是多生成一张图,推理更慢。它和用文字写子任务、物体位置的具身思维链,以及动作思维链,是几种并列的中间表示。
例子CoT-VLA 接到一条操作指令后,先生成若干步之后应该出现的画面作为子目标(例如物体已被夹起并靠近目标位置),再以这张图为条件输出一段动作;执行完后重新观察,再想象下一张子目标图。
- 也叫
- 视觉 CoT、视觉推理链
- 相关
- 思维链、具身思维链、动作思维链、CoT-VLA、视觉-语言-动作模型、视频预测模型
- 来源
- CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models (arXiv:2503.22020)
Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning (arXiv:2403.16999)