思维链
Chain-of-ThoughtCoT常用让模型先一步步写出中间推理过程,再给最终答案。
思维链指模型在给出答案前,先生成一串中间推理步骤。2022 年谷歌 Wei 等人提出「思维链提示」:只要在提示里放几个带推理过程的示例,大模型就会模仿着分步思考;用 8 个这样的示例提示 5400 亿参数的 PaLM,就在数学应用题基准 GSM8K 上取得当时最好成绩。后来它从提示技巧变成训练目标,OpenAI o1、DeepSeek-R1 等推理模型用强化学习训练出更长的思考过程。机器人领域把它引入 VLA:具身思维链(ECoT,2024)先让模型写出任务计划、子任务、动作描述和物体检测框,再输出动作,使 OpenVLA 在泛化任务上的成功率绝对提升 28%。
例子收到「把勺子放到毛巾上」,ECoT 类模型先写出计划(抓勺子→移到毛巾上方→松开)、当前子任务和勺子的检测框,最后才输出动作 token。
- 也叫
- 思维链推理、思维链提示、Chain-of-Thought Prompting
- 相关
- 具身思维链、视觉思维链、推理(思考)、具身推理、CoT-VLA、大语言模型
- 来源
- Chain-of-Thought Prompting Elicits Reasoning in Large Language Models (arXiv:2201.11903)
Robotic Control via Embodied Chain-of-Thought Reasoning (arXiv:2407.08693) - 信息截至
- 2025-01