Überwachtes Fine-Tuning (SFT)
Daten: Beispiele aus Eingabe und gewünschter Ausgabe
Eine stabile Aufgabe, eine Antwortstruktur, einen Stil oder ein Muster für Tool-Aufrufe vermitteln.
Achten Sie auf: Das Modell kann Fehler und Verzerrungen der Demonstrationen übernehmen; unbeteiligtes Verhalten kann sich verschlechtern.
Präferenzoptimierung
Daten: Bevorzugte und nicht bevorzugte Antworten oder gleichwertiges Feedback
Entscheidungen dort verschieben, wo sich Qualität leichter vergleichen als in einer einzigen idealen Antwort festschreiben lässt.
Achten Sie auf: Labelrichtlinie, Übereinstimmung der Annotierenden und Holdout-Evaluierung zählen so viel wie der Algorithmus.
Reinforcement-Fine-Tuning
Daten: Prompts sowie ein verlässlicher Grader oder ein Belohnungssignal
Ergebnisse optimieren, die sich über generierte Trajektorien hinweg konsistent bewerten lassen.
Achten Sie auf: Reward Hacking, Verzerrung des Graders, Instabilität und höhere Betriebskomplexität erfordern zusätzliche Kontrollen.