Fine-tuning supervisé (SFT)
Données : Exemples d’entrée et de sortie attendue
Enseigner une tâche stable, une structure de réponse, un style ou un schéma d’appel d’outils.
À surveiller : Le modèle peut imiter les erreurs et les biais des démonstrations ; des comportements sans rapport peuvent régresser.
Optimisation de préférences
Données : Réponses préférées et non préférées, ou retour équivalent
Déplacer les choix lorsque la qualité est plus facile à comparer qu’à décrire comme une réponse idéale unique.
À surveiller : La politique d’annotation, l’accord entre annotateurs et l’évaluation sur jeu réservé comptent autant que l’algorithme.
Fine-tuning par renforcement
Données : Des prompts et un correcteur ou signal de récompense fiable
Optimiser des résultats que l’on peut noter de façon cohérente sur les trajectoires générées.
À surveiller : Détournement de la récompense, biais du correcteur, instabilité et complexité opérationnelle accrue imposent des contrôles supplémentaires.