Loading...
🎙️
实时语音智能体(RVA)
在单一流式会话中基于 speech-to-speech 模型构建的低延迟语音智能体,取代了传统的“语音识别→LLM→语音合成”流水线。单个模型直接对音频进行推理,因此响应足够快,感觉如同自然对话;轮次检测、插话打断(barge-in)、对话中途的工具调用、护栏和交接都在实时会话内完成。
复杂度: highUI/UX与人机AI交互
In 30 seconds
- What
- 通过单一流式模型处理语音输入并生成语音输出,无需离开音频流即可实现打断和工具调用。
- When to use
- 电话支持、客户服务,或任何需要自然对话节奏和低于 200 毫秒响应延迟的交互场景。
- Watch out
- 工具调用、网络中断或语音活动检测出错造成的延迟尖峰会打破自然感的错觉,让期待实时对话的用户感到沮丧。
Loading technique guide…