具身智能新手名词表English

语音识别

Automatic Speech RecognitionASR进阶

把人说的话自动转成文字,是机器人听懂口头指令的第一步。

语音识别是把语音信号转换成文字的技术,也叫语音转文字(STT)。常用评测指标是词错误率 WER,即(替换数+删除数+插入数)除以参考词数,中文一般按字计算,称字错误率 CER。近年的代表模型是 OpenAI 2022 年发布的 Whisper,用 68 万小时弱监督的多语种音频训练,在多个标准基准上不经微调就接近有监督方法的成绩,模型和推理代码都已开源。在具身智能系统里,语音识别通常是交互链路的入口:麦克风阵列拾音、降噪后交给 ASR 转成文字,再送进大语言模型或 VLA 生成计划和动作,最后用语音合成(TTS)回话。也有原生多模态模型直接输入音频、不经过文字中转。机器人上还要应对电机噪声、远场拾音等问题。

例子用户说「把桌上的红杯子递给我」,Whisper 之类的 ASR 模型先把它转成文字,再作为语言指令交给 VLA 模型执行。

也叫
自动语音识别、语音转文字、Speech-to-Text、STT
相关
麦克风阵列、大语言模型、指令跟随、人机交互、原生多模态、视觉-语言-动作模型
来源
Robust Speech Recognition via Large-Scale Weak Supervision (Whisper, arXiv:2212.04356)
Wikipedia: Speech recognition

在完整名词表里查看 →