Dans l'actualité
EarthVerse: Benchmarking Scientific Agents Across Dynamic Earth Systems and Natural Hazards
arXiv cs.AI · Publié le · 3 min de lecture
En 30 secondes
- Ce qui s'est passé
- EarthVerse est un benchmark de 405 tâches testant les agents IA sur l'analyse des systèmes terrestres à travers 199 événements de risques naturels documentés.
- Pourquoi ça compte
- Pertinent pour les ingénieurs construisant des systèmes IA scientifiques devant raisonner sur des sources de données hétérogènes et maintenir la cohérence physique.
- Vigilance
- Les meilleurs systèmes atteignent 84,65% de précision par étape mais seulement 34,81% en bout-en-bout strict, révélant des lacunes dans les chaînes cohérentes.
Écouter ce résumé
- agent
- eval
- benchmark
Les patterns derrière cette actualité
- Eval-Driven Development (Agent CI)
- Agentic Context Engineering (Evolving Playbook)
- tau-bench (Tool-Agent-User)
Chacun explique le fonctionnement de la technique, quand elle vaut son coût et où elle casse.
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.