Dans l'actualité
Can LLMs Reason About Runtime Behavior? A Repository-Level Dynamic Benchmark
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- SWE-Flux est un benchmark de 480 cas de test évaluant si les LLMs raisonnent correctement sur l'exécution de code Python dans des dépôts réels.
- Pourquoi ça compte
- Pertinent pour les ingénieurs évaluant des LLMs pour l'analyse de code, particulièrement quand il faut comprendre le comportement à l'exécution et l'état du programme.
- Vigilance
- Le meilleur modèle atteint seulement 37% de précision. Les LLMs peinent avec le dataflow, l'exécution cross-fonction et le raisonnement d'état précis.
- llm
- language model
- reasoning
- eval
- benchmark
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.