Loading...
合成ユーザーシミュレーション(SIM)
LLM で駆動されるユーザーシミュレーターを、混乱している、敵対的である、せっかちである、目標を途中で変えるといった多様なペルソナでパラメータ化し、会話型エージェントを多数のマルチターン対話へと自律的に導くテストハーネスとして用います。こうしたシミュレーション対話を大規模に実行することで、実ユーザーが遭遇する前にコンテキストの欠落、ポリシー違反、ハルシネーションを表面化させ、静的なシングルターンのゴールデンケースでは到達できない対話ツリーの分岐を探索します。実ユーザーよりも従順に振る舞う単一の協力的なシミュレーターという盲点を避けるため、意図的なペルソナの多様性と目標の整合が必要です。単一のユーザーシミュレーターを組み込んだ固定ベンチマークである tau-bench とは異なり、また、ゴールデンが静的なシングルターンのケースである eval-driven-agent-development とも異なり、この手法は動的なマルチターンのトラフィックを生成します。
In 30 seconds
- What
- パラメータ化された LLM ペルソナが自律的にエージェントとマルチターン対話を行い、実際のユーザーが遭遇する前に各対話分岐の不具合を洗い出します。
- When to use
- 静的なテストケースでは、多くのターンやユーザー種別をまたいで初めて現れる文脈の欠落、ポリシー違反、ハルシネーションを捉えられない会話型エージェントに。
- Watch out
- 明示的に制約しないと、シミュレーターのペルソナは非現実的な振る舞いに収束し、実際のユーザーなら別の形で引き起こす本物の障害パターンを覆い隠します。
Loading technique guide…