Chargement des modèles…
tau-bench (Tool-Agent-User)(TAU)
Benchmark qui place l'agent entre un utilisateur humain simulé et un ensemble d'API métier (commerce de détail, compagnie aérienne), tout en lui imposant de respecter un document de règles écrit. Plutôt que de vérifier une seule réponse, il compare l'état final de la base de données à un état cible à l'issue de la conversation complète. Sa métrique emblématique est pass^k, la probabilité de réussir les k essais indépendants d'une même tâche, ce qui met en évidence des défauts de constance que masquent les scores pass@1 moyennés.
Aperçu en 30 secondes
- Quoi
- Évalue les agents en simulant une conversation entre l'utilisateur, l'agent et les API, puis compare l'état final de la base de données à l'état cible sur plusieurs essais indépendants afin de mesurer la régularité.
- Quand l'utiliser
- Pour vérifier si un agent respecte de façon fiable les règles métier malgré la pression de l'utilisateur, tout en modifiant l'état réel du système dans des scénarios de commerce de détail, de transport aérien ou de télécommunications.
- Vigilance
- Une forte variance des scores pass^k peut masquer un agent qui réussit une fois par chance mais échoue systématiquement ; il faut de nombreux essais pour révéler la vraie fragilité.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
tau-bench (Tool-Agent-User): Vue d’ensemble
Benchmark qui place l'agent entre un utilisateur humain simulé et un ensemble d'API métier (commerce de détail, compagnie aérienne), tout en lui imposant de respecter un document de règles écrit. Plutôt que de vérifier une seule réponse, il compare l'état final de la base de données à un état cible à l'issue de la conversation complète. Sa métrique emblématique est pass^k, la probabilité de réussir les k essais indépendants d'une même tâche, ce qui met en évidence des défauts de constance que masquent les scores pass@1 moyennés.
- Agent mediates between a simulated user (LLM-driven) and domain APIs
- Two domains: retail and airline, each with tools and a written policy document
- Scores the final database state against a goal state, not just the text reply
- pass^k reliability metric across k independent trials of the same task
- Policy adherence testing: agent must follow domain rules under user pressure
- tau2-bench extends the setting with a dual-control telecom domain and stronger user simulation
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre