Loading...
AgentBench(AgentBench)
Die ursprüngliche AgentBench-Studie evaluierte ihr veröffentlichtes Modellportfolio über 8 unterschiedliche Umgebungen sowie mehrstufige, offene Szenarien hinweg.
In 30 seconds
- What
- Schickt Agenten durch acht unterschiedliche Umgebungen (SQL, Spiele, Web, Betriebssysteme) mit mehrstufigen Interaktionen, um praxisnahe Fähigkeiten über Domänen hinweg zu messen.
- When to use
- Agentenmodelle vergleichen oder prüfen, ob Ihr Agent vielfältige, offene Aufgaben jenseits von Einzeldomänen-Benchmarks bewältigt.
- Watch out
- Hohe Komplexität und Rechenkosten; Ergebnisse lassen sich nicht zwangsläufig auf Ihre konkreten Anwendungsfälle oder eigenen Umgebungen übertragen.
Loading technique guide…