Muster werden geladen…
Blast-Radius-Eindämmung und Autonomiegrenzen(BRC)
Begrenzt die Worst-Case-Auswirkung eines fehlgeleiteten Agenten, bevor er handelt, statt Missbrauch erst im Nachhinein zu erkennen. Tools werden nach Umkehrbarkeit und Auswirkung klassifiziert (Lesen ist frei, Schreiben wird validiert, Destruktives wird pausiert); Befugnisse werden pro Aufgabe nach dem Least-Privilege-Prinzip eingegrenzt; die Autonomie ist abgestuft (von Assistieren über Vorschlagen-und-Genehmigen und Handeln-und-Auditieren bis Beobachten) und wird verdient, sobald sich Zuverlässigkeit erwiesen hat; unumkehrbare Schritte lösen einen Probelauf oder eine Planvorschau aus, sodass ein Mensch den Plan prüft und nicht die Folgen; und ein Kill-Switch mit Zustandserfassung und Quarantäne kann den Agenten mitten im Lauf stoppen. Abzugrenzen von Human-in-the-Loop: Das ist eine Aufsichtshaltung, während dies die Fähigkeiten anhand der Umkehrbarkeit begrenzt. Abzugrenzen von Agent-Sandboxing: Das isoliert die Ausführungsumgebung, während dies die Umkehrbarkeit pro Tool staffelt und die Autonomie abstuft. Abzugrenzen von der Verhinderung von Tool-Missbrauch: Das verteidigt gegen injektionsgetriebenen Missbrauch, nicht gegen die Klassifizierung des Blast-Radius.
In 30 Sekunden
- Was
- Klassifiziert Werkzeuge nach Umkehrbarkeit (Lesen, Schreiben, Zerstörend), vergibt pro Aufgabe minimale Rechte, weitet die Autonomie aus, sobald sich Zuverlässigkeit zeigt, und legt unumkehrbare Aktionen vor der Ausführung als Trockenlauf zur Prüfung vor.
- Wann einsetzen
- Systeme mit hohem Einsatz, in denen Fehler eines Agenten echten Schaden anrichten (Datenbanken, Infrastruktur, Zahlungen) und Sie den schlimmstmöglichen Schaden begrenzen müssen, bevor der Agent handelt.
- Achtung
- Der Aufwand, jedes Werkzeug zu klassifizieren und gestufte Autonomiestufen zu verwalten, kann den Rollout bremsen; falsches Vertrauen in die Umkehrbarkeitseinstufung führt dazu, dass der Wirkungsradius unterschätzt wird.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Blast-Radius-Eindämmung und Autonomiegrenzen: Überblick
Begrenzt die Worst-Case-Auswirkung eines fehlgeleiteten Agenten, bevor er handelt, statt Missbrauch erst im Nachhinein zu erkennen. Tools werden nach Umkehrbarkeit und Auswirkung klassifiziert (Lesen ist frei, Schreiben wird validiert, Destruktives wird pausiert); Befugnisse werden pro Aufgabe nach dem Least-Privilege-Prinzip eingegrenzt; die Autonomie ist abgestuft (von Assistieren über Vorschlagen-und-Genehmigen und Handeln-und-Auditieren bis Beobachten) und wird verdient, sobald sich Zuverlässigkeit erwiesen hat; unumkehrbare Schritte lösen einen Probelauf oder eine Planvorschau aus, sodass ein Mensch den Plan prüft und nicht die Folgen; und ein Kill-Switch mit Zustandserfassung und Quarantäne kann den Agenten mitten im Lauf stoppen. Abzugrenzen von Human-in-the-Loop: Das ist eine Aufsichtshaltung, während dies die Fähigkeiten anhand der Umkehrbarkeit begrenzt. Abzugrenzen von Agent-Sandboxing: Das isoliert die Ausführungsumgebung, während dies die Umkehrbarkeit pro Tool staffelt und die Autonomie abstuft. Abzugrenzen von der Verhinderung von Tool-Missbrauch: Das verteidigt gegen injektionsgetriebenen Missbrauch, nicht gegen die Klassifizierung des Blast-Radius.
- Tools classified by reversibility and impact (read free, write validated, destructive paused)
- Least-privilege tool scoping granted per task
- Graduated autonomy levels earned as reliability is proven
- Dry-run and plan-preview before irreversible actions
- Kill switch with state capture and quarantine
- Worst-case impact bounded before the agent acts, not after
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihr Agentensystem red-teamen
Die hier beschriebenen Schutzmaßnahmen halten nur, wenn jemand versucht, sie zu brechen. Lassen Sie Ihres so testen, wie es ein echter Angreifer täte: Prompt Injection, Jailbreaks, Tool-Missbrauch und Datenexfiltration, jeder Befund schriftlich samt Fix.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September