Loading...
🎙️
リアルタイム音声エージェント(RVA)
単一のストリーミングセッション上でspeech-to-speechモデルを用いて構築された低遅延の音声エージェントで、従来の「音声認識→LLM→音声合成」というパイプラインを置き換えます。単一のモデルが音声を直接推論するため、応答が十分に速く届き、自然な会話のように感じられます。話者交代の検出、割り込み(バージイン)、会話中のツール呼び出し、ガードレール、ハンドオフはすべてライブセッション内で処理されます。
複雑さ: highUI/UXと人間とAIのインタラクション
In 30 seconds
- What
- 単一のストリーミングモデルで音声入力を処理し音声出力を生成し、音声ストリームを離れることなく割り込みやツール呼び出しを可能にする。
- When to use
- 電話サポートやカスタマーサービスなど、自然な会話のリズムと 200 ミリ秒未満の応答レイテンシが求められるあらゆる対話。
- Watch out
- ツール呼び出しやネットワーク断、音声区間検出のエラーによるレイテンシの急増は自然さの錯覚を壊し、リアルタイムの会話を期待するユーザーを苛立たせる。
Loading technique guide…