Loading...
Präferenzoptimierung mit Odds Ratio(ORPO)
Referenzfreie Präferenzausrichtung, die dem Sprachmodellierungsziel für die gewählte Antwort eine Odds-Ratio-Strafe für abgelehnte Antworten hinzufügt
In 30 seconds
- What
- Trainiert ein Modell auf den ausgewählten Antworten und bestraft zugleich die abgelehnten Antworten über einen Odds-Ratio-Verlust, ganz ohne Referenzmodell.
- When to use
- Sie haben gepaarte Präferenzdaten und wollen ein schnelleres, günstigeres Alignment, ohne ein separates Referenzmodell zu pflegen.
- Watch out
- Die Odds-Ratio-Strafe kann das Training destabilisieren, wenn Lambda falsch eingestellt ist; eine sorgfältige Hyperparametersuche ist nötig, um Fähigkeitsverluste zu vermeiden.
Loading technique guide…