パターンを読み込んでいます…
リアルタイム音声エージェント(RVA)
単一のストリーミングセッション上でspeech-to-speechモデルを用いて構築された低遅延の音声エージェントで、従来の「音声認識→LLM→音声合成」というパイプラインを置き換えます。単一のモデルが音声を直接推論するため、応答が十分に速く届き、自然な会話のように感じられます。話者交代の検出、割り込み(バージイン)、会話中のツール呼び出し、ガードレール、ハンドオフはすべてライブセッション内で処理されます。
30秒でわかる概要
- 概要
- 単一のストリーミングモデルで音声入力を処理し音声出力を生成し、音声ストリームを離れることなく割り込みやツール呼び出しを可能にする。
- 使いどころ
- 電話サポートやカスタマーサービスなど、自然な会話のリズムと 200 ミリ秒未満の応答レイテンシが求められるあらゆる対話。
- 注意点
- ツール呼び出しやネットワーク断、音声区間検出のエラーによるレイテンシの急増は自然さの錯覚を壊し、リアルタイムの会話を期待するユーザーを苛立たせる。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
リアルタイム音声エージェント: 概要
単一のストリーミングセッション上でspeech-to-speechモデルを用いて構築された低遅延の音声エージェントで、従来の「音声認識→LLM→音声合成」というパイプラインを置き換えます。単一のモデルが音声を直接推論するため、応答が十分に速く届き、自然な会話のように感じられます。話者交代の検出、割り込み(バージイン)、会話中のツール呼び出し、ガードレール、ハンドオフはすべてライブセッション内で処理されます。
- Single speech-to-speech model instead of a chained STT to LLM to TTS pipeline
- Server-side voice activity detection and turn detection for natural turn-taking
- Barge-in handling: the user can interrupt and the agent truncates its own speech
- Mid-conversation tool calls and guardrail checks without leaving the audio stream
- Agent-to-agent and agent-to-human handoffs on policy triggers during a live call
- Telephony and SIP integration for phone-based support and outbound calling
エージェントUXフィールドガイドを受け取る
21のエージェントUXパターンを1冊に凝縮:それぞれが何か、いつ使うか、本番で何が問題になるか。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで