Loading...
tau-bench (Tool-Agent-User)(TAU)
Benchmark, der den Agenten zwischen einen simulierten menschlichen Nutzer und eine Reihe von Domänen-APIs (Einzelhandel, Fluggesellschaft) stellt, wobei er ein schriftliches Richtliniendokument befolgen muss. Statt eine einzelne Antwort zu prüfen, vergleicht er nach dem vollständigen Gespräch den finalen Datenbankzustand mit einem Zielzustand. Seine charakteristische Kennzahl ist pass^k, die Wahrscheinlichkeit, alle k unabhängigen Versuche derselben Aufgabe zu bestehen, was Konsistenzfehler aufdeckt, die gemittelte pass@1-Werte verbergen.
In 30 seconds
- What
- Bewertet Agenten, indem ein Gespräch zwischen Nutzer, Agent und API simuliert und der finale Datenbankzustand über mehrere unabhängige Durchläufe hinweg mit dem Zielzustand verglichen wird, um die Konsistenz zu messen.
- When to use
- Um zu prüfen, ob Agenten unter Nutzerdruck zuverlässig Fachrichtlinien einhalten, während sie echten Systemzustand in Abläufen aus Handel, Luftfahrt oder Telekommunikation verändern.
- Watch out
- Hohe Varianz der pass^k-Werte kann verdecken, dass ein Agent einmal zufällig erfolgreich ist, aber systematisch scheitert; echte Brüchigkeit zeigt sich erst nach vielen Durchläufen.
Loading technique guide…