Loading...
METR RE-Bench(RE-Bench)
Benchmark zur Messung der Leistung von Agenten auf Basis von Frontier-Modellen bei ML-Forschungs-Engineering-Aufgaben im Vergleich zu den Fähigkeiten menschlicher Experten.
In 30 seconds
- What
- Misst die Leistung von Agenten auf Basis von Frontier-Modellen bei ML-Forschungs- und Engineering-Aufgaben im Vergleich zu menschlichen Expertenbenchmarks, und zwar bei Abschlussquote, Codequalität und Forschungserkenntnissen.
- When to use
- Wenn Sie beurteilen wollen, ob Frontier-Modelle echte Forschungs- und Engineering-Arbeit bewältigen, oder wenn Sie Fähigkeitszuwächse zwischen Modellversionen vergleichen.
- Watch out
- Die Auswahl der Aufgaben verzerrt die Ergebnisse stark: zu enge oder den Trainingsdaten zu ähnliche Aufgaben blähen die Agentenwerte gegenüber der realen Vielfalt der Forschung auf.
Loading technique guide…