Loading...
SWE-bench-Suite(SWE-bench)
Benchmark-Suite für Software-Engineering mit SWE-bench, SWE-bench Verified und SWE-bench Live. Die im Beispiel als Vergleich genannten Modelle sind historische Referenzwerte.
In 30 seconds
- What
- Bewertet Coding-Agenten anhand echter GitHub-Issues aus populären Repositories, mit von Menschen validierten Teilmengen und monatlich aktualisierten Live-Varianten, um die Problemlösefähigkeit zu messen.
- When to use
- Vergleich der Agentenleistung bei echten Software-Engineering-Aufgaben, Verfolgen von Fortschritten über die Zeit oder Nachweis, dass Agenten Probleme ohne Kontamination durch Trainingsdaten lösen.
- Watch out
- Die Ergebnisse hängen stark davon ab, welche Repositories und Issue-Typen enthalten sind; die Leistung auf SWE-bench lässt sich nicht unbedingt auf die Muster oder den Technologie-Stack Ihrer Codebasis übertragen.
Loading technique guide…