パターンを読み込んでいます…
AISI 評価フレームワーク(AISI-Eval)
フロンティア AI システムを対象とした AI Safety Institute の包括的な評価フレームワーク。政府標準のセーフティ評価のため、NIST の AI セーフティに関する取り組みと連携しています。
30秒でわかる概要
- 概要
- 最先端 AI システムを、能力、安全性、アラインメントの各観点から、導入前に政府機関と連携して多段階かつ標準化された形で評価します。
- 使いどころ
- 本番利用の前に規制順守、安全性の検証、あるいは政府の承認が求められる、影響の大きい AI のリリース。
- 注意点
- 評価結果が実際のシステム能力に追いつかないことがあります。評価に合格したからといって、これまでにない運用環境での安全が保証されるわけではありません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
AISI 評価フレームワーク: 概要
フロンティア AI システムを対象とした AI Safety Institute の包括的な評価フレームワーク。政府標準のセーフティ評価のため、NIST の AI セーフティに関する取り組みと連携しています。
- Frontier AI capability assessment
- Government-standard safety protocols
- Coordination with NIST AI safety programs
- Multi-stakeholder evaluation process
- Pre-deployment safety verification
- International coordination standards
- Risk-based evaluation tiers
エージェント評価フィールドガイドを受け取る
25のエージェント評価手法を1冊に凝縮:どのベンチマークが何を測るか、公開スコアが誤解を招くのはどんなときか、自分の失敗から評価を組み立てる方法。確認メールと一緒にリンクが届き、週刊The Agent Architectも購読できます。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- AI Safety Institute Evaluation Framework (2024)
- NIST-AISI Collaboration Guidelines (2024)
- International AI Safety Coordination (2025)
このカタログを作ったエンジニアが担当
評価が見落としているものを可視化
エージェントの評価は実装よりも難しく、多くのテストは緑のまま本番だけがずれていきます。評価の仕組みを端から端まで点検します。いま測れているもの、まだ見えていないもの、そして現状のテストが素通りさせる劣化を洗い出します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで