和 AI 语音聊天,背后并不是一个模型包办全部:系统先判断你何时说话,再把声音写成文字、生成回答,最后把文字读出来。Hugging Face 的开源项目 speech-to-speech 把这四步串成一套低延迟流水线,为想在自己的设备或服务器上运行实时语音 Agent 的开发者提供了直接入口。录音与计算可以留在本地,更适合看重隐私、离线能力和数据控制的场景。
这套方案的关键是模块化,也就是每一环都能单独替换。默认组合使用 Parakeet TDT 做 STT(语音转文字),以兼容 OpenAI 接口的 LLM(语言模型)生成回答,再由 Qwen3-TTS 把文字合成为语音;LLM 也可接入本机的 llama.cpp 或 vLLM 服务,组成全本地、全开放的链路。它还提供兼容 OpenAI Realtime 的 WebSocket API——一条持续双向传输的连接,可边接收音频、边返回结果。项目方称,这条流水线已作为数千台 Reachy Mini 机器人的对话后端;不过材料未披露延迟、硬件占用等量化测试。