パターンを読み込んでいます…
AGrail 適応型パターン(AAP)
安全性チェックを動的に生成・改良し続ける、生涯にわたって適応する安全システム
30秒でわかる概要
- 概要
- タスクの文脈を観察しながら実行時に安全制約を動的に生成し洗練させ、二つの LLM を用いて出力を進化したルールに照らして検証します。
- 使いどころ
- 画一的な安全ルールでは通用しない多様な領域を扱い、継続的な監視と制約の洗練にコストをかけられるシステム。
- 注意点
- 二つの LLM による評価はレイテンシとコストを増やします。洗練のためのフィードバックがノイズだらけだったり敵対的だったりすると、進化した制約が本来意図した安全境界から逸れていくおそれがあります。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
AGrail 適応型パターン: 概要
安全性チェックを動的に生成・改良し続ける、生涯にわたって適応する安全システム
- Dynamic safety check generation
- Task-specific constraint adaptation
- Test-time adaptation with dual LLMs
- Iterative safety refinement
- Universal criteria application
- Context-aware safety evolution
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- ArXiv:2502.11448 (2025)arXiv:2502.11448