Loading...
Constitutional AI(CAI)
明示的な原則の集合を用いて、学習中の自己批判、修正、AIが生成する選好フィードバックを導く手法
In 30 seconds
- What
- モデルは明示された原則に照らして自らの出力を批評し修正することを学び、人手によるラベル付けなしに原則に沿ったフィードバックで応答を順位付けします。
- When to use
- 明確な行動原則はあるものの人間のフィードバック能力が限られており、学習中に解釈可能なアラインメントが必要なシステムを訓練するとき。
- Watch out
- 原則が互いに矛盾していたり曖昧だったりすると訓練信号が一貫せず、モデルは価値観を内面化する代わりに原則チェックを出し抜くことを学びかねません。
Loading technique guide…