Loading...
Apprentissage par renforcement à partir de retours humains(RLHF)
Ajustement fin d'une politique par apprentissage par renforcement contre un modèle de récompense appris à partir de jugements de préférence humains
In 30 seconds
- What
- Entraîne un modèle de récompense à partir de comparaisons de préférences humaines, puis optimise le comportement de l'agent selon ce modèle tout en limitant la dérive par rapport au comportement de départ.
- When to use
- Aligner les sorties d'un agent sur des valeurs humaines nuancées là où les métriques simples échouent, quand vous pouvez consacrer beaucoup d'annotation humaine et de calcul.
- Watch out
- Le modèle de récompense absorbe les biais des annotateurs et gère mal les cas limites ; l'agent exploite ses failles au lieu de s'améliorer réellement, ce qui impose une surveillance coûteuse.
Loading technique guide…