Loading...
Einfache Präferenzoptimierung(SimPO)
Referenzfreie Präferenzoptimierung, die die längennormierte Sequenz-Log-Wahrscheinlichkeit als implizite Belohnung mit einer Ziel-Belohnungsmarge verwendet
In 30 seconds
- What
- Trainiert ein Modell darauf, ausgewählte Antworten gegenüber abgelehnten zu bevorzugen, indem längennormalisierte Log-Wahrscheinlichkeiten verglichen werden, ohne dass ein separates Referenzmodell nötig ist.
- When to use
- Sie haben gepaarte Präferenzdaten (ausgewählte und abgelehnte Antworten) und wollen das Modellverhalten optimieren, ohne die Rechenkosten für ein zusätzliches Referenzmodell zu tragen.
- Watch out
- Die Längennormalisierung kann Qualitätsunterschiede verdecken, wenn ausgewählte und abgelehnte Antworten deutlich unterschiedlich lang sind, was das Präferenzsignal schwächt.
Loading technique guide…