Chargement des modèles…
Développement piloté par les évals (CI d'agents)(EDD)
Discipline du cycle de développement consistant à concevoir d'abord les agents et les prompts en fonction des évals. Des jeux de données de référence soigneusement constitués (environ 50 à 500 cas, pondérés vers les modes de défaillance connus) sont versionnés aux côtés des prompts, exécutés comme suite de non-régression à chaque pull request, et la fusion ou la promotion est conditionnée à des seuils de métriques. Le pipeline fige les versions du modèle et du juge, si bien qu'une mise à jour silencieuse du modèle côté fournisseur est détectée comme une régression au lieu d'être absorbée en douce ; il enchaîne ses vérifications sous forme de lint, puis d'éval hors ligne, puis d'un garde-fou sur les coûts avant qu'un changement ne puisse être fusionné. À distinguer de agent-observability-tracing, qui relève de la télémétrie à l'exécution et non d'un contrôle avant fusion, et des benchmarks publics figés, qui ne sont pas des suites de non-régression détenues par l'équipe dans la CI.
Aperçu en 30 secondes
- Quoi
- Des jeux de données de référence versionnés s'exécutent comme suites de non-régression sur chaque PR, conditionnant la fusion à des seuils métriques, avec des versions de modèle et de juge figées.
- Quand l'utiliser
- Équipes livrant des agents où les mises à jour silencieuses de modèle doivent être détectées, où les modes de défaillance connus exigent une couverture continue et où les changements de prompt demandent une validation mesurable.
- Vigilance
- Les jeux de données de référence deviennent obsolètes ou décorrélés des vraies défaillances en production s'ils ne sont pas activement entretenus et pondérés vers les modes de défaillance actuels.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Développement piloté par les évals (CI d'agents): Vue d’ensemble
Discipline du cycle de développement consistant à concevoir d'abord les agents et les prompts en fonction des évals. Des jeux de données de référence soigneusement constitués (environ 50 à 500 cas, pondérés vers les modes de défaillance connus) sont versionnés aux côtés des prompts, exécutés comme suite de non-régression à chaque pull request, et la fusion ou la promotion est conditionnée à des seuils de métriques. Le pipeline fige les versions du modèle et du juge, si bien qu'une mise à jour silencieuse du modèle côté fournisseur est détectée comme une régression au lieu d'être absorbée en douce ; il enchaîne ses vérifications sous forme de lint, puis d'éval hors ligne, puis d'un garde-fou sur les coûts avant qu'un changement ne puisse être fusionné. À distinguer de agent-observability-tracing, qui relève de la télémétrie à l'exécution et non d'un contrôle avant fusion, et des benchmarks publics figés, qui ne sont pas des suites de non-régression détenues par l'équipe dans la CI.
- Version-controlled golden datasets (~50-500 cases) weighted toward known failure modes
- Regression suite runs on every pull request; merge gated on metric thresholds
- Pinned model and judge versions so silent provider updates surface as regressions
- Staged CI pipeline: lint, then offline eval, then cost gate before merge
- LLM-as-judge and code-based scorers combined per failure dimension
- Prompt and dataset changes reviewed together as a single diff
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre