Loading...
🎭
合成用户模拟(SIM)
由 LLM 驱动的用户模拟器,通过多样的人物画像(如困惑型、对抗型、急躁型或中途改变目标的用户)进行参数化,用作测试框架,自主地驱动对话式智能体完成大量多轮对话。大规模运行这些模拟对话,能在真实用户遇到之前就暴露出上下文丢失、策略违规和幻觉,并探索静态单轮黄金用例无法触及的对话树分支。它需要刻意保持人物画像的多样性并对齐目标,以避免单一配合型模拟器的盲点,因为这种模拟器的表现会比真实用户更顺从。它区别于 tau-bench(一个内嵌单个用户模拟器的固定基准测试),也区别于 eval-driven-agent-development(其黄金用例是静态的单轮用例),而本方法生成的是动态的多轮流量。
复杂度: medium评估与监控
In 30 seconds
- What
- 参数化的 LLM 人物角色自主与你的智能体进行多轮对话,在真实用户遇到之前暴露各个对话分支上的故障。
- When to use
- 适用于会话式智能体:静态测试用例无法捕捉那些只有跨越多轮对话和多种用户类型才会显现的上下文丢失、策略违规或幻觉。
- Watch out
- 若不加以明确约束,模拟器人物角色可能收敛到不真实的行为,从而掩盖真实用户会以不同方式触发的故障模式。
Loading technique guide…