Muster werden geladen…
Dual-LLM- und Capability-Sicherheit (CaMeL)
Teilt den Agenten in ein privilegiertes LLM, das nur vertrauenswürdige Nutzeranweisungen sieht und den Steuer- und Datenfluss plant, und ein isoliertes LLM, das nicht vertrauenswürdige Inhalte verarbeitet, den Steuerfluss aber niemals beeinflussen kann. Ein Interpreter mit Capability-Tracking setzt explizite Datenflussrichtlinien durch, sodass in Tool-Ausgaben eingeschleuste Anweisungen niemals unautorisierte Aktionen auslösen können. Das ist Verteidigung durch Design statt probabilistischer Filterung.
In 30 Sekunden
- Was
- Trennt ein vertrauenswürdiges LLM, das den Kontrollfluss plant, von einem nicht vertrauenswürdigen LLM, das nur Daten extrahiert, wobei Capability-Tags durchsetzen, welche Daten welche Aktionen auslösen dürfen.
- Wann einsetzen
- Agenten verarbeiten nicht vertrauenswürdige Nutzereingaben oder Tool-Ausgaben und müssen verhindern, dass Prompt Injection Ausführungspfade verändert oder auf geschützte Ressourcen zugreift.
- Achtung
- Hohe Implementierungskomplexität und Laufzeit-Overhead; das Capability-Tracking erhöht die Latenz und verlangt sorgfältig definierte Richtlinien, damit legitime Workflows nicht brechen.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Dual-LLM- und Capability-Sicherheit (CaMeL): Überblick
Teilt den Agenten in ein privilegiertes LLM, das nur vertrauenswürdige Nutzeranweisungen sieht und den Steuer- und Datenfluss plant, und ein isoliertes LLM, das nicht vertrauenswürdige Inhalte verarbeitet, den Steuerfluss aber niemals beeinflussen kann. Ein Interpreter mit Capability-Tracking setzt explizite Datenflussrichtlinien durch, sodass in Tool-Ausgaben eingeschleuste Anweisungen niemals unautorisierte Aktionen auslösen können. Das ist Verteidigung durch Design statt probabilistischer Filterung.
- Privileged LLM plans control flow from trusted input only
- Quarantined LLM extracts data from untrusted content, never issues commands
- Capability tags track data provenance through every value
- Interpreter enforces data-flow policies before each tool call
- Injected instructions in tool outputs cannot reach the control path
- Formal security guarantees instead of best-effort prompt filtering
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihr Agentensystem red-teamen
Die hier beschriebenen Schutzmaßnahmen halten nur, wenn jemand versucht, sie zu brechen. Lassen Sie Ihres so testen, wie es ein echter Angreifer täte: Prompt Injection, Jailbreaks, Tool-Missbrauch und Datenexfiltration, jeder Befund schriftlich samt Fix.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September