Chargement des modèles…
Suite SWE-bench
Suite de benchmarks d'ingénierie logicielle comprenant SWE-bench, SWE-bench Verified et SWE-bench Live. Les modèles cités à titre de comparaison dans l'exemple sont des références historiques.
Aperçu en 30 secondes
- Quoi
- Évalue les agents de programmation sur de véritables tickets GitHub issus de dépôts populaires, avec des sous-ensembles validés par des humains et des variantes actualisées chaque mois, afin de mesurer la capacité de résolution de problèmes.
- Quand l'utiliser
- Comparer les performances d'agents sur de véritables tâches de génie logiciel, suivre leur progression dans le temps, ou vérifier qu'ils résolvent des problèmes sans contamination par les données d'entraînement.
- Vigilance
- Les résultats dépendent fortement des dépôts et des types de tickets retenus ; les performances sur SWE-bench ne se transposent pas forcément aux schémas ou à la pile technique de votre base de code.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Suite SWE-bench: Vue d’ensemble
Suite de benchmarks d'ingénierie logicielle comprenant SWE-bench, SWE-bench Verified et SWE-bench Live. Les modèles cités à titre de comparaison dans l'exemple sont des références historiques.
- Real GitHub issues from 12+ popular repositories
- Human-validated problem subset (SWE-bench Verified)
- Live benchmark updated monthly (SWE-bench Live)
- Multimodal variant with visual elements
- Contamination-free evaluation
- Industry standard for coding agents
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues? (ICLR 2024)arXiv:2310.06770
- Introducing SWE-bench Verified - OpenAI (2024)
- swebench.com
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre