Muster werden geladen…
SWE-bench Pro(SWE-Pro)
Software engineering tasks long enough to take a professional hours or days, drawn from repositories chosen so that memorising the answer is not an option.
In 30 Sekunden
- Was
- Sets long-horizon software engineering tasks across 41 repositories chosen so that remembering the accepted patch is not a route to a good score.
- Wann einsetzen
- SWE-bench numbers have saturated for the systems you are comparing, or contamination is the specific question being asked.
- Achtung
- It moves the contamination horizon rather than removing it. This is still a fixed published set, and it will date the way its predecessor did.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
SWE-bench Pro: Überblick
Software engineering tasks long enough to take a professional hours or days, drawn from repositories chosen so that memorising the answer is not an option.
- 1,865 problems across 41 actively maintained repositories
- Business, B2B and developer-tool codebases, not only popular OSS
- Patches typically span multiple files and substantial rewrites
- Held-out and commercially licensed subsets to resist contamination
- Human-verified problem statements and interfaces
- Built as the answer to SWE-bench saturation and leakage
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Auch bekannt als: Long-horizon SWE benchmark, Enterprise coding benchmark
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September