做语音助手,难点不只是让 AI 听懂并回答。用户会停顿、插话,还可能从手机拨入;系统既要传输音视频,也要调用模型、安排任务,并判断这一轮话是否说完。LiveKit Agents 想把这些环节接成一套服务端框架,让团队开发能听、能看、能实时回应的多模态 Agent。
它支持自由组合 STT(把语音转成文字)、LLM(理解并生成回答)和 TTS(把文字变回语音),也能接入 Realtime API。用户设备与 Agent 之间的低延迟音视频传输由 WebRTC 承担;框架还内置任务调度、电话接打、客户端数据交换和测试能力。一个值得注意的细节是“语义轮次检测”:它用 Transformer 模型判断用户是否已经说完,目标是减少助手抢话。
项目完全开源,整套系统可运行在自有服务器上。现有材料没有提供延迟、识别效果或实际部署规模的对比数据,因此更适合把它看作实时多模态 Agent 基础设施的一种完整方案,而非已经得到性能验证的胜出者。