Loading...
CybersecEval 3(CSE3)
Meta 推出的全面网络安全基准,用于评估 LLM 智能体在自主和多智能体环境中的安全风险。
In 30 seconds
- What
- 让 LLM 智能体通过覆盖代码、数据、访问控制、注入和社会工程等领域的结构化安全测试,量化其漏洞暴露程度。
- When to use
- 部署自主或多智能体系统时,需要在上线前衡量安全态势,且合规要求留有书面证据。
- Watch out
- 复杂度和成本高,意味着结果可能落后于真实威胁态势;若不配合红队演练,分数容易带来虚假的安全感。
Loading technique guide…