Loading...
Dual-LLM- und Capability-Sicherheit (CaMeL)
Teilt den Agenten in ein privilegiertes LLM, das nur vertrauenswürdige Nutzeranweisungen sieht und den Steuer- und Datenfluss plant, und ein isoliertes LLM, das nicht vertrauenswürdige Inhalte verarbeitet, den Steuerfluss aber niemals beeinflussen kann. Ein Interpreter mit Capability-Tracking setzt explizite Datenflussrichtlinien durch, sodass in Tool-Ausgaben eingeschleuste Anweisungen niemals unautorisierte Aktionen auslösen können. Das ist Verteidigung durch Design statt probabilistischer Filterung.
In 30 seconds
- What
- Trennt ein vertrauenswürdiges LLM, das den Kontrollfluss plant, von einem nicht vertrauenswürdigen LLM, das nur Daten extrahiert, wobei Capability-Tags durchsetzen, welche Daten welche Aktionen auslösen dürfen.
- When to use
- Agenten verarbeiten nicht vertrauenswürdige Nutzereingaben oder Tool-Ausgaben und müssen verhindern, dass Prompt Injection Ausführungspfade verändert oder auf geschützte Ressourcen zugreift.
- Watch out
- Hohe Implementierungskomplexität und Laufzeit-Overhead; das Capability-Tracking erhöht die Latenz und verlangt sorgfältig definierte Richtlinien, damit legitime Workflows nicht brechen.
Loading technique guide…