Loading...
⚖️
Constitutional AI 评估框架(CAI-Eval)
Anthropic 通过章程原则评估 AI 安全性的框架,包括越狱抵抗测试和无害性评估。
复杂度: high评估与监控
In 30 seconds
- What
- 借助分类器和红队对手,依据一组明确的原则测试 AI 输出,用以衡量越狱抵抗力和有害行为。
- When to use
- 在构建安全攸关的系统时,若你需要对抗性提示抵抗力的量化证据和可度量的无害性评分。
- Watch out
- 红队测试成本高、耗时长;其结果未必能迁移到你的具体部署环境或全新的攻击方式上。
Loading technique guide…