Loading...
Blast-Radius-Eindämmung und Autonomiegrenzen(BRC)
Begrenzt die Worst-Case-Auswirkung eines fehlgeleiteten Agenten, bevor er handelt, statt Missbrauch erst im Nachhinein zu erkennen. Tools werden nach Umkehrbarkeit und Auswirkung klassifiziert (Lesen ist frei, Schreiben wird validiert, Destruktives wird pausiert); Befugnisse werden pro Aufgabe nach dem Least-Privilege-Prinzip eingegrenzt; die Autonomie ist abgestuft (von Assistieren über Vorschlagen-und-Genehmigen und Handeln-und-Auditieren bis Beobachten) und wird verdient, sobald sich Zuverlässigkeit erwiesen hat; unumkehrbare Schritte lösen einen Probelauf oder eine Planvorschau aus, sodass ein Mensch den Plan prüft und nicht die Folgen; und ein Kill-Switch mit Zustandserfassung und Quarantäne kann den Agenten mitten im Lauf stoppen. Abzugrenzen von Human-in-the-Loop: Das ist eine Aufsichtshaltung, während dies die Fähigkeiten anhand der Umkehrbarkeit begrenzt. Abzugrenzen von Agent-Sandboxing: Das isoliert die Ausführungsumgebung, während dies die Umkehrbarkeit pro Tool staffelt und die Autonomie abstuft. Abzugrenzen von der Verhinderung von Tool-Missbrauch: Das verteidigt gegen injektionsgetriebenen Missbrauch, nicht gegen die Klassifizierung des Blast-Radius.
In 30 seconds
- What
- Klassifiziert Werkzeuge nach Umkehrbarkeit (Lesen, Schreiben, Zerstörend), vergibt pro Aufgabe minimale Rechte, weitet die Autonomie aus, sobald sich Zuverlässigkeit zeigt, und legt unumkehrbare Aktionen vor der Ausführung als Trockenlauf zur Prüfung vor.
- When to use
- Systeme mit hohem Einsatz, in denen Fehler eines Agenten echten Schaden anrichten (Datenbanken, Infrastruktur, Zahlungen) und Sie den schlimmstmöglichen Schaden begrenzen müssen, bevor der Agent handelt.
- Watch out
- Der Aufwand, jedes Werkzeug zu klassifizieren und gestufte Autonomiestufen zu verwalten, kann den Rollout bremsen; falsches Vertrauen in die Umkehrbarkeitseinstufung führt dazu, dass der Wirkungsradius unterschätzt wird.
Loading technique guide…