Chargement des modèles…
Confinement du rayon d'impact et limites d'autonomie(BRC)
Limite l'impact le plus défavorable d'un agent défaillant avant qu'il n'agisse, au lieu de se contenter de détecter les abus après coup. Les outils sont classés par réversibilité et par impact (la lecture est libre, l'écriture est validée, les actions destructrices sont mises en pause) ; l'autorité est cadrée selon le moindre privilège pour chaque tâche ; l'autonomie est graduée (de l'assistance, à la proposition-et-approbation, à l'action-et-audit, jusqu'à l'observation) et se mérite à mesure que la fiabilité est démontrée ; les étapes irréversibles déclenchent une simulation ou un aperçu du plan afin qu'un humain examine le plan plutôt que ses conséquences ; et un coupe-circuit avec capture d'état et mise en quarantaine peut arrêter l'agent en pleine exécution. À distinguer de l'humain dans la boucle : celui-ci relève d'une posture de supervision, tandis que ce modèle borne les capacités par la réversibilité. À distinguer du bac à sable pour agents : celui-ci isole l'environnement d'exécution, tandis que ce modèle hiérarchise la réversibilité par outil et gradue l'autonomie. À distinguer de la prévention des abus d'outils : celle-ci défend contre les abus provoqués par injection, et non contre la classification du rayon d'impact.
Aperçu en 30 secondes
- Quoi
- Classe les outils selon leur réversibilité (lecture, écriture, destruction), accorde le moindre privilège pour chaque tâche, élargit l'autonomie à mesure que la fiabilité se confirme et présente les actions irréversibles en simulation avant exécution.
- Quand l'utiliser
- Des systèmes à fort enjeu où les erreurs d'un agent causent de vrais dégâts (bases de données, infrastructure, paiements) et où il faut borner l'impact du pire scénario avant que l'agent n'agisse.
- Vigilance
- Le coût de classification de chaque outil et de gestion des niveaux d'autonomie progressifs peut ralentir le déploiement ; une confiance excessive dans le classement de réversibilité conduit à sous-estimer le rayon d'impact.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Confinement du rayon d'impact et limites d'autonomie: Vue d’ensemble
Limite l'impact le plus défavorable d'un agent défaillant avant qu'il n'agisse, au lieu de se contenter de détecter les abus après coup. Les outils sont classés par réversibilité et par impact (la lecture est libre, l'écriture est validée, les actions destructrices sont mises en pause) ; l'autorité est cadrée selon le moindre privilège pour chaque tâche ; l'autonomie est graduée (de l'assistance, à la proposition-et-approbation, à l'action-et-audit, jusqu'à l'observation) et se mérite à mesure que la fiabilité est démontrée ; les étapes irréversibles déclenchent une simulation ou un aperçu du plan afin qu'un humain examine le plan plutôt que ses conséquences ; et un coupe-circuit avec capture d'état et mise en quarantaine peut arrêter l'agent en pleine exécution. À distinguer de l'humain dans la boucle : celui-ci relève d'une posture de supervision, tandis que ce modèle borne les capacités par la réversibilité. À distinguer du bac à sable pour agents : celui-ci isole l'environnement d'exécution, tandis que ce modèle hiérarchise la réversibilité par outil et gradue l'autonomie. À distinguer de la prévention des abus d'outils : celle-ci défend contre les abus provoqués par injection, et non contre la classification du rayon d'impact.
- Tools classified by reversibility and impact (read free, write validated, destructive paused)
- Least-privilege tool scoping granted per task
- Graduated autonomy levels earned as reliability is proven
- Dry-run and plan-preview before irreversible actions
- Kill switch with state capture and quarantine
- Worst-case impact bounded before the agent acts, not after
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
Par l’ingénieur derrière ce catalogue
Faites red-teamer votre système d’agents
Les protections décrites ici ne tiennent que si quelqu’un tente de les casser. Faites tester le vôtre comme le ferait un vrai attaquant : injection de prompt, jailbreaks, détournement d’outils et exfiltration de données, chaque constat rédigé avec son correctif.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre