具身智能新手名词表English

Socratic Models(苏格拉底模型)

Socratic Models: Composing Zero-Shot Multimodal Reasoning with LanguageSMs进阶

用自然语言当接口,把多个现成大模型零样本串起来完成多模态任务的框架

谷歌 Andy Zeng、Pete Florence 等人 2022 年 4 月发布。不同基础模型各有所长:视觉语言模型(VLM,能看图说话)懂图像,大语言模型(LLM)懂常识和推理,音频模型懂声音。Socratic Models 不做任何微调,而是用自然语言当公共接口,把一个模型的输出写进另一个模型的提示词里,让它们像对话一样交换信息,零样本组合出新能力。论文展示了第一人称视频问答、多模态助手对话,以及机器人感知与规划:先由视觉模型把桌面物体转成文字描述,再由 LLM 把指令拆成一步步抓取放置动作,交给预训练的语言条件策略执行。它和同期的 SayCan、代码即策略一起,代表了「用大语言模型当机器人规划器」的早期路线。

例子用户说「把水果都放进碗里」,视觉模型先列出桌上有苹果、香蕉和碗,语言模型据此写出「拿起苹果放进碗里;拿起香蕉放进碗里」,再由底层抓放策略逐步执行。

也叫
Socratic Models、苏格拉底模型
相关
大语言模型、视觉语言模型、零样本、SayCan、代码即策略、Inner Monologue
来源
Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language (arXiv 2204.00598)
Socratic Models project page
信息截至
2022-05

在完整名词表里查看 →