Loading...
Reinforcement Learning aus KI-Feedback(RLAIF)
Training einer Policy anhand von Präferenzurteilen, die von einem KI-Bewerter unter menschlich definierten Kriterien und Aufsicht erzeugt werden
In 30 seconds
- What
- Trainiert eine Policy mit Präferenzurteilen eines KI-Bewerters, der nach menschlich definierten Kriterien arbeitet, ergänzt um menschliche Audits, die eine Drift des Bewerters aufdecken.
- When to use
- Sie müssen Präferenz-Labeling über die menschliche Kapazität hinaus skalieren und dabei bei einer bestimmten Aufgabe an menschlichen Werten ausgerichtet bleiben.
- Watch out
- Der KI-Bewerter kann unbemerkt vom Bewertungsraster abweichen oder menschliche Verzerrungen aus dem Kalibrierungsdatensatz verstärken und so den gesamten Trainingslauf verderben.
Loading technique guide…