Dans l'actualité
Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- Les meilleurs agents de code sur SWE-bench obtiennent des scores si proches que les petits écarts ne classent plus fiablement leur performance.
- Pourquoi ça compte
- Les ingénieurs évaluant ou construisant des systèmes de génération de code doivent en tenir compte pour interpréter les positions au classement.
- Vigilance
- Les tests statistiques montrent que la plupart des paires du top trente ne diffèrent pas significativement; les classements dépendent surtout du couple modèle-scaffold.
- agent
- eval
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.