Dans l'actualité
OSWorld-Pro: Process-based Evaluation for Computer Use Agents
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- OSWorld-Pro ajoute plus de 300 tâches avec 2800 sous-objectifs et 67000 annotations humaines pour évaluer les agents informatiques étape par étape, pas seulement les résultats finaux.
- Pourquoi ça compte
- Les ingénieurs construisant ou testant des agents IA qui interagissent avec des interfaces graphiques ont besoin d'une analyse granulaire des défaillances au-delà des métriques réussite-échec.
- Vigilance
- Les meilleurs modèles comme Claude Opus 5 obtiennent 75,7% sur OSWorld-Pro contre 83,4% sur OSWorld, suggérant que le benchmark est nettement plus difficile.
- agent
- eval
- phi
Les patterns derrière cette actualité
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.