Loading...
Apprentissage par renforcement à partir de retours de l'IA(RLAIF)
Entraînement d'une politique à partir de jugements de préférence produits par un évaluateur IA, selon des critères et une supervision définis par l'humain
In 30 seconds
- What
- Entraîne une politique à partir de jugements de préférence produits par un évaluateur IA opérant selon des critères définis par des humains, avec un audit humain pour détecter la dérive de l'évaluateur.
- When to use
- Vous devez étendre l'annotation de préférences au-delà des capacités humaines tout en restant aligné sur les valeurs humaines pour une tâche précise.
- Watch out
- L'évaluateur IA peut s'écarter silencieusement de la grille ou amplifier les biais humains inscrits dans le jeu de calibration, corrompant tout l'entraînement.
Loading technique guide…