Loading...
Direkte Präferenzoptimierung(DPO)
Offline-Präferenzoptimierung mit einer Klassifikations-Verlustfunktion über ausgewählte und abgelehnte Antworten, ohne ein explizites Belohnungsmodell zu trainieren
In 30 seconds
- What
- Trainiert eine Policy direkt auf Präferenzpaaren, indem ein Klassifikationsverlust minimiert wird, der gewählte gegen abgelehnte Antworten relativ zu einer eingefrorenen Referenz-Policy vergleicht, ganz ohne explizites Reward-Modell.
- When to use
- Sie haben gepaarte Präferenzdaten (gewählte und abgelehnte Ausgaben) und wollen Verhalten ausrichten, ohne vorher ein separates Reward-Modell trainieren zu müssen.
- Watch out
- Die Policy kann weit von der Referenz abdriften, was die Leistung bei Aufgaben außerhalb des Präferenzdatensatzes verschlechtert oder bei zu engen Präferenzpaaren zum Mode Collapse führt.
Loading technique guide…