Loading...
Фреймворк оценки Constitutional AI(CAI-Eval)
Фреймворк Anthropic для оценки безопасности ИИ на основе конституционных принципов, включая тестирование устойчивости к джейлбрейкам и оценку безвредности.
In 30 seconds
- What
- Проверяет выходные данные ИИ по набору явных принципов, используя классификаторы и red team противников, чтобы измерить устойчивость к джейлбрейкам и уровень вредного поведения.
- When to use
- При создании систем, критичных с точки зрения безопасности, когда нужны количественные доказательства устойчивости к состязательным промптам и измеримые оценки безвредности.
- Watch out
- Тестирование силами red team стоит дорого и занимает много времени; результаты могут не переноситься на ваш конкретный контекст развёртывания или на новые векторы атак.
Loading technique guide…