Chargement des modèles…
Déploiement progressif et mode fantôme(PRS)
Le versant déploiement de la mise en production sécurisée d'une version d'agent ou de prompt. Le candidat s'exécute d'abord en mode fantôme : il tourne sur le trafic de production réel, mais sa sortie est masquée aux utilisateurs et comparée hors ligne à la version en service, puis il passe à une phase canary sur 1 à 5 pour cent du trafic réel, noté par des évals en ligne face à un groupe témoin, puis à une montée en charge progressive, avec rollback automatique dès qu'une métrique surveillée se dégrade. Coupler les évals en ligne (qui notent le trafic réel à la volée) aux évals hors ligne permet de détecter les défaillances de longue traîne qu'un jeu de référence statique ne peut pas prévoir. À distinguer de eval-driven-agent-development, qui contrôle les changements hors ligne avant la fusion, tandis que ce modèle gouverne la montée en charge en ligne après la fusion.
Aperçu en 30 secondes
- Quoi
- Exécute l'agent candidat sur le trafic de production sans en servir la sortie, puis l'expose progressivement aux utilisateurs avec retour arrière automatique en cas de régression des métriques.
- Quand l'utiliser
- Livrer des changements d'agent ou de prompt lorsque les défaillances de longue traîne sur le trafic réel comptent plus que des jeux de tests statiques, et que vous avez besoin de confiance avant un déploiement complet.
- Vigilance
- La latence et le coût de l'évaluation en ligne croissent avec le volume de trafic ; un évaluateur lent ou coûteux peut devenir le goulot d'étranglement avant même que vous ne détectiez de vrais problèmes.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Déploiement progressif et mode fantôme: Vue d’ensemble
Le versant déploiement de la mise en production sécurisée d'une version d'agent ou de prompt. Le candidat s'exécute d'abord en mode fantôme : il tourne sur le trafic de production réel, mais sa sortie est masquée aux utilisateurs et comparée hors ligne à la version en service, puis il passe à une phase canary sur 1 à 5 pour cent du trafic réel, noté par des évals en ligne face à un groupe témoin, puis à une montée en charge progressive, avec rollback automatique dès qu'une métrique surveillée se dégrade. Coupler les évals en ligne (qui notent le trafic réel à la volée) aux évals hors ligne permet de détecter les défaillances de longue traîne qu'un jeu de référence statique ne peut pas prévoir. À distinguer de eval-driven-agent-development, qui contrôle les changements hors ligne avant la fusion, tandis que ce modèle gouverne la montée en charge en ligne après la fusion.
- Shadow mode: candidate runs on live traffic, output withheld, compared offline
- Canary on 1-5% of live traffic scored by online evals against a control
- Progressive ramp with predefined promotion and rollback thresholds
- Automatic rollback triggered by a monitored metric regression
- Online evals (in-flight scoring) paired with offline evals for long-tail failures
- Per-request telemetry span ties the eval score to the routing decision for auto-gating
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre