做一个能自然接话的语音 Agent,过去常像同时组装耳朵、大脑和嘴巴:每一段都要选模型,还得处理它们之间的实时通信。Hugging Face 开源的 speech-to-speech,把这套流程接成一条低延迟流水线,让开发者可以直接搭建,也能逐段更换零件。
它依次用 VAD 判断用户何时说完,STT 把语音转成文字,再交给 LLM(负责组织回答的语言模型),最后由 TTS 把文字合成为声音。整条链路可通过 WebSocket 或 WebRTC——两种持续传输实时数据的连接方式——对外提供服务。LLM 接口兼容 OpenAI 常用的请求格式,因此既能连接托管服务,也能换成本机运行的 vLLM 或 llama.cpp。
这套工具链已经作为数千台 Reachy Mini 机器人的对话后端投入生产。默认组合使用本地 Parakeet TDT 识别语音、Qwen3-TTS 输出声音;Apple Silicon Mac 的全本地配置建议准备至少 16 GB 统一内存,核心模型权重约 7.5 GB。不过这些内存数字只是单次对话的规划估算,实际占用仍取决于上下文、音频长度和后端版本。