Loading...
Bestärkendes Lernen aus menschlichem Feedback(RLHF)
Feintuning einer Policy mittels bestärkendem Lernen gegen ein Belohnungsmodell, das aus menschlichen Präferenzurteilen gelernt wurde
In 30 seconds
- What
- Trainiert ein Reward-Modell aus menschlichen Präferenzvergleichen und optimiert dann das Agentenverhalten gegen dieses Modell, wobei die Abweichung von der Ausgangsbasis begrenzt wird.
- When to use
- Wenn Agentenausgaben auf feinsinnige menschliche Werte ausgerichtet werden sollen, einfache Metriken versagen und Sie sich umfangreiche menschliche Annotation und Rechenleistung leisten können.
- Watch out
- Das Reward-Modell übernimmt die Verzerrungen der Prüfer und deckt Randfälle schlecht ab; der Agent nutzt die Lücken des Modells aus, statt sich wirklich zu verbessern, was teure Überwachung erfordert.
Loading technique guide…