Muster werden geladen…
SWE-bench-Suite(SWE-bench)
Benchmark-Suite für Software-Engineering mit SWE-bench, SWE-bench Verified und SWE-bench Live. Die im Beispiel als Vergleich genannten Modelle sind historische Referenzwerte.
In 30 Sekunden
- Was
- Bewertet Coding-Agenten anhand echter GitHub-Issues aus populären Repositories, mit von Menschen validierten Teilmengen und monatlich aktualisierten Live-Varianten, um die Problemlösefähigkeit zu messen.
- Wann einsetzen
- Vergleich der Agentenleistung bei echten Software-Engineering-Aufgaben, Verfolgen von Fortschritten über die Zeit oder Nachweis, dass Agenten Probleme ohne Kontamination durch Trainingsdaten lösen.
- Achtung
- Die Ergebnisse hängen stark davon ab, welche Repositories und Issue-Typen enthalten sind; die Leistung auf SWE-bench lässt sich nicht unbedingt auf die Muster oder den Technologie-Stack Ihrer Codebasis übertragen.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
SWE-bench-Suite: Überblick
Benchmark-Suite für Software-Engineering mit SWE-bench, SWE-bench Verified und SWE-bench Live. Die im Beispiel als Vergleich genannten Modelle sind historische Referenzwerte.
- Real GitHub issues from 12+ popular repositories
- Human-validated problem subset (SWE-bench Verified)
- Live benchmark updated monthly (SWE-bench Live)
- Multimodal variant with visual elements
- Contamination-free evaluation
- Industry standard for coding agents
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (ICLR 2024)arXiv:2310.06770
- Introducing SWE-bench Verified - OpenAI (2024)
- swebench.com
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September