Loading...
AIフィードバックによる強化学習(RLAIF)
人間が定義した基準と監督のもとで、AI評価者が生成した選好判断からポリシーを訓練する手法
In 30 seconds
- What
- 人間が定めた基準に従って動作するAI評価器の選好判断を用いてポリシーを学習させ、評価器のドリフトを人間の監査で検出する。
- When to use
- 特定のタスクで人間の価値観との整合を保ちながら、人手の限界を超えて選好ラベル付けをスケールさせたいとき。
- Watch out
- AI評価器が気づかれないまま評価基準から逸脱したり、較正データに埋め込まれた人間のバイアスを増幅したりして、学習全体を汚染しかねない。
Loading technique guide…