Loading...
TheAgentCompany Benchmark(TAC)
Bewertet LLM-Agenten anhand folgenreicher realer Aufgaben, die typischerweise von mehreren Berufsrollen in einem Softwareentwicklungsunternehmen erledigt würden.
In 30 seconds
- What
- Misst die Leistung von Agenten bei mehrstufigen Berufsaufgaben aus verschiedenen Softwareentwicklungsrollen und bewertet vollständige Erledigung und Teilerfolg getrennt.
- When to use
- Um LLM-Agenten vor dem Produktivbetrieb an realistischen Arbeitsszenarien zu vergleichen oder Fähigkeitszuwächse über Modellversionen hinweg zu verfolgen.
- Watch out
- Teilerfolgswerte können verdecken, dass ein Agent an entscheidenden Schritten scheitert: Ein Teilwert von 39 % kann unfertige Arbeit ohne jeden Nutzen kaschieren.
Loading technique guide…