Loading...
tau-bench (Tool-Agent-User)(TAU)
Benchmark qui place l'agent entre un utilisateur humain simulé et un ensemble d'API métier (commerce de détail, compagnie aérienne), tout en lui imposant de respecter un document de règles écrit. Plutôt que de vérifier une seule réponse, il compare l'état final de la base de données à un état cible à l'issue de la conversation complète. Sa métrique emblématique est pass^k, la probabilité de réussir les k essais indépendants d'une même tâche, ce qui met en évidence des défauts de constance que masquent les scores pass@1 moyennés.
In 30 seconds
- What
- Évalue les agents en simulant une conversation entre l'utilisateur, l'agent et les API, puis compare l'état final de la base de données à l'état cible sur plusieurs essais indépendants afin de mesurer la régularité.
- When to use
- Pour vérifier si un agent respecte de façon fiable les règles métier malgré la pression de l'utilisateur, tout en modifiant l'état réel du système dans des scénarios de commerce de détail, de transport aérien ou de télécommunications.
- Watch out
- Une forte variance des scores pass^k peut masquer un agent qui réussit une fois par chance mais échoue systématiquement ; il faut de nombreux essais pour révéler la vraie fragilité.
Loading technique guide…