Loading...
HELM-Framework zur Agentenbewertung(HELM-AE)
Die Holistic Evaluation of Language Models des Stanford CRFM, erweitert um Agentenfähigkeiten. Das ausgearbeitete Beispiel ist eine veraltete Benchmark-Momentaufnahme und keine aktuelle Modellempfehlung.
In 30 seconds
- What
- Misst die Leistung eines Agenten über sieben Dimensionen: Genauigkeit, Kalibrierung, Robustheit, Fairness, Bias, Toxizität und Effizienz, einschließlich Werkzeugnutzung und API-Interaktion in standardisierten Szenarien.
- When to use
- Mehrere Agenten vor dem Einsatz vergleichen oder Leistungsregressionen über Modellversionen und Werkzeugintegrationen hinweg verfolgen.
- Watch out
- Benchmark-Werte sagen die Leistung in der Praxis nicht voraus; Ihre tatsächlichen Aufgaben können deutlich von den 42 Testszenarien abweichen.
Loading technique guide…