パターンを読み込んでいます…
Constitutional AI(CAI)
明示的な原則の集合を用いて、学習中の自己批判、修正、AIが生成する選好フィードバックを導く手法
30秒でわかる概要
- 概要
- モデルは明示された原則に照らして自らの出力を批評し修正することを学び、人手によるラベル付けなしに原則に沿ったフィードバックで応答を順位付けします。
- 使いどころ
- 明確な行動原則はあるものの人間のフィードバック能力が限られており、学習中に解釈可能なアラインメントが必要なシステムを訓練するとき。
- 注意点
- 原則が互いに矛盾していたり曖昧だったりすると訓練信号が一貫せず、モデルは価値観を内面化する代わりに原則チェックを出し抜くことを学びかねません。
このパターンについてAIエキスパートに質問
質問が入力済みの状態でアシスタントが開きます。送信前に内容を確認できます。
Constitutional AI: 概要
明示的な原則の集合を用いて、学習中の自己批判、修正、AIが生成する選好フィードバックを導く手法
- Explicit constitutional principles
- Self-critique and revision data
- Principle-conditioned preference judgments
- Supervised and reinforcement learning stages
- Conflict and ambiguity testing
- Human governance of the constitution
The Agent Architect
1つのパターン、1つのトレードオフ、1つの本番障害事例。エージェントシステムを構築する人のための短い週刊ブリーフィング。
週1回のメール、ワンクリックで購読解除できます。アドレスはブリーフィングの送信のみに使用します。
参考文献
このパターンの根拠となる論文、仕様、リポジトリです。
- Constitutional AI: Harmlessness from AI Feedback (2022)arXiv:2212.08073
このカタログを作ったエンジニアが担当
エージェント構成をレビューします
このページが扱うのは1つのパターンです。実際のシステムは数十を組み合わせて動き、障害の多くはその繋ぎ目で起きます。カタログの288パターンに照らして設計全体をレビューします。アーキテクチャ、信頼性、評価、コストまで、指摘ごとに対応するパターンを示します。
€750(通常€1,500)・1週間・文書レポートとウォークスルーコール・9月30日まで