Загружаем паттерны…
Безопасность на основе двух LLM и capability (CaMeL)
Разделяет агента на привилегированную LLM, которая видит только доверенные инструкции пользователя и планирует поток управления и данных, и изолированную LLM, которая обрабатывает недоверенный контент, но никогда не может повлиять на поток управления. Интерпретатор с отслеживанием capability применяет явные политики потоков данных, так что инструкции, внедрённые в выходные данные инструментов, никогда не смогут запустить несанкционированные действия. Это защита по замыслу, а не вероятностная фильтрация.
За 30 секунд
- Что это
- Разделяет доверенную LLM, планирующую поток управления, и недоверенную LLM, которая только извлекает данные, а теги возможностей задают, какие данные могут запускать какие действия.
- Когда применять
- Агенты обрабатывают недоверенный пользовательский ввод или выводы инструментов и должны не допустить, чтобы инъекция промпта изменила путь выполнения или открыла доступ к закрытым ресурсам.
- Осторожно
- Высокая сложность реализации и накладные расходы во время выполнения; отслеживание возможностей добавляет задержку и требует аккуратно заданных политик, чтобы не сломать легитимные сценарии.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Безопасность на основе двух LLM и capability (CaMeL): Обзор
Разделяет агента на привилегированную LLM, которая видит только доверенные инструкции пользователя и планирует поток управления и данных, и изолированную LLM, которая обрабатывает недоверенный контент, но никогда не может повлиять на поток управления. Интерпретатор с отслеживанием capability применяет явные политики потоков данных, так что инструкции, внедрённые в выходные данные инструментов, никогда не смогут запустить несанкционированные действия. Это защита по замыслу, а не вероятностная фильтрация.
- Privileged LLM plans control flow from trusted input only
- Quarantined LLM extracts data from untrusted content, never issues commands
- Capability tags track data provenance through every value
- Interpreter enforces data-flow policies before each tool call
- Injected instructions in tool outputs cannot reach the control path
- Formal security guarantees instead of best-effort prompt filtering
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
От инженера, создавшего этот каталог
Проведите red teaming вашей агентной системы
Описанные здесь меры защиты чего-то стоят, только если кто-то попробует их сломать. Мы протестируем вашу систему так, как это сделал бы настоящий атакующий: инъекции промптов, джейлбрейки, злоупотребление инструментами и эксфильтрация данных, каждая находка с готовым исправлением.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября