Muster werden geladen…
tau-bench (Tool-Agent-User)(TAU)
Benchmark, der den Agenten zwischen einen simulierten menschlichen Nutzer und eine Reihe von Domänen-APIs (Einzelhandel, Fluggesellschaft) stellt, wobei er ein schriftliches Richtliniendokument befolgen muss. Statt eine einzelne Antwort zu prüfen, vergleicht er nach dem vollständigen Gespräch den finalen Datenbankzustand mit einem Zielzustand. Seine charakteristische Kennzahl ist pass^k, die Wahrscheinlichkeit, alle k unabhängigen Versuche derselben Aufgabe zu bestehen, was Konsistenzfehler aufdeckt, die gemittelte pass@1-Werte verbergen.
In 30 Sekunden
- Was
- Bewertet Agenten, indem ein Gespräch zwischen Nutzer, Agent und API simuliert und der finale Datenbankzustand über mehrere unabhängige Durchläufe hinweg mit dem Zielzustand verglichen wird, um die Konsistenz zu messen.
- Wann einsetzen
- Um zu prüfen, ob Agenten unter Nutzerdruck zuverlässig Fachrichtlinien einhalten, während sie echten Systemzustand in Abläufen aus Handel, Luftfahrt oder Telekommunikation verändern.
- Achtung
- Hohe Varianz der pass^k-Werte kann verdecken, dass ein Agent einmal zufällig erfolgreich ist, aber systematisch scheitert; echte Brüchigkeit zeigt sich erst nach vielen Durchläufen.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
tau-bench (Tool-Agent-User): Überblick
Benchmark, der den Agenten zwischen einen simulierten menschlichen Nutzer und eine Reihe von Domänen-APIs (Einzelhandel, Fluggesellschaft) stellt, wobei er ein schriftliches Richtliniendokument befolgen muss. Statt eine einzelne Antwort zu prüfen, vergleicht er nach dem vollständigen Gespräch den finalen Datenbankzustand mit einem Zielzustand. Seine charakteristische Kennzahl ist pass^k, die Wahrscheinlichkeit, alle k unabhängigen Versuche derselben Aufgabe zu bestehen, was Konsistenzfehler aufdeckt, die gemittelte pass@1-Werte verbergen.
- Agent mediates between a simulated user (LLM-driven) and domain APIs
- Two domains: retail and airline, each with tools and a written policy document
- Scores the final database state against a goal state, not just the text reply
- pass^k reliability metric across k independent trials of the same task
- Policy adherence testing: agent must follow domain rules under user pressure
- tau2-bench extends the setting with a dual-control telecom domain and stronger user simulation
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September