Loading...
MLR-Bench(MLR-Bench)
Umfassender Benchmark zur Bewertung von KI-Agenten anhand offener Forschungsaufgaben des maschinellen Lernens von führenden ML-Konferenzen.
In 30 seconds
- What
- Standardisierter Benchmark mit 201 ML-Forschungsaufgaben von Spitzenkonferenzen und automatisierter Bewertung entlang der Dimensionen Methodik, Umsetzung und Analyse.
- When to use
- Wenn Sie beurteilen wollen, ob Ihr Forschungsagent offene ML-Probleme auf dem Niveau publizierter Konferenzarbeiten über mehrere Teilgebiete hinweg bewältigt.
- Watch out
- Die Werte spiegeln die Leistung auf engen Aufgaben wider; Agenten können sich an Benchmark-Muster überanpassen, ohne auf neuartige Forschungsrichtungen außerhalb dieser 9 Bereiche zu generalisieren.
Loading technique guide…