正在加载模式…
🎙️
实时语音智能体(RVA)
在单一流式会话中基于 speech-to-speech 模型构建的低延迟语音智能体,取代了传统的“语音识别→LLM→语音合成”流水线。单个模型直接对音频进行推理,因此响应足够快,感觉如同自然对话;轮次检测、插话打断(barge-in)、对话中途的工具调用、护栏和交接都在实时会话内完成。
复杂度: highUI/UX与人机AI交互
30秒速览
- 是什么
- 通过单一流式模型处理语音输入并生成语音输出,无需离开音频流即可实现打断和工具调用。
- 何时使用
- 电话支持、客户服务,或任何需要自然对话节奏和低于 200 毫秒响应延迟的交互场景。
- 注意
- 工具调用、网络中断或语音活动检测出错造成的延迟尖峰会打破自然感的错觉,让期待实时对话的用户感到沮丧。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
实时语音智能体: 概览
在单一流式会话中基于 speech-to-speech 模型构建的低延迟语音智能体,取代了传统的“语音识别→LLM→语音合成”流水线。单个模型直接对音频进行推理,因此响应足够快,感觉如同自然对话;轮次检测、插话打断(barge-in)、对话中途的工具调用、护栏和交接都在实时会话内完成。
- Single speech-to-speech model instead of a chained STT to LLM to TTS pipeline
- Server-side voice activity detection and turn detection for natural turn-taking
- Barge-in handling: the user can interrupt and the agent truncates its own speech
- Mid-conversation tool calls and guardrail checks without leaving the audio stream
- Agent-to-agent and agent-to-human handoffs on policy triggers during a live call
- Telephony and SIP integration for phone-based support and outbound calling
获取 Agent UX 实战指南
21 个智能体 UX 模式浓缩成一份指南:每个模式是什么、何时使用、在生产中会踩什么坑。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
由本目录背后的工程师执行
为你的智能体架构做一次评审
本页讲的是一个模式。真实系统会同时跑几十个,而多数故障恰恰出在它们的衔接处。我们按本目录的 288 个模式评审你的整体设计:架构、可靠性、评测与成本,每一条结论都对应到能修复它的模式。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前