Muster werden geladen…
TheAgentCompany Benchmark(TAC)
Bewertet LLM-Agenten anhand folgenreicher realer Aufgaben, die typischerweise von mehreren Berufsrollen in einem Softwareentwicklungsunternehmen erledigt würden.
In 30 Sekunden
- Was
- Misst die Leistung von Agenten bei mehrstufigen Berufsaufgaben aus verschiedenen Softwareentwicklungsrollen und bewertet vollständige Erledigung und Teilerfolg getrennt.
- Wann einsetzen
- Um LLM-Agenten vor dem Produktivbetrieb an realistischen Arbeitsszenarien zu vergleichen oder Fähigkeitszuwächse über Modellversionen hinweg zu verfolgen.
- Achtung
- Teilerfolgswerte können verdecken, dass ein Agent an entscheidenden Schritten scheitert: Ein Teilwert von 39 % kann unfertige Arbeit ohne jeden Nutzen kaschieren.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
TheAgentCompany Benchmark: Überblick
Bewertet LLM-Agenten anhand folgenreicher realer Aufgaben, die typischerweise von mehreren Berufsrollen in einem Softwareentwicklungsunternehmen erledigt würden.
- Real-world professional tasks
- Multiple job role simulations
- Partial completion scoring
- Industry-relevant scenarios
- Comprehensive task diversity
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September