Обучение с учителем (SFT)
Данные: Примеры входа и желаемого выхода
Обучить устойчивой задаче, структуре ответа, стилю или схеме вызова инструментов.
На что смотреть: Модель может перенять ошибки и смещения демонстраций; несвязанное поведение может ухудшиться.
Оптимизация предпочтений
Данные: Предпочтительные и непредпочтительные ответы или равнозначная обратная связь
Сместить выбор там, где качество проще сравнить, чем описать одним идеальным ответом.
На что смотреть: Политика разметки, согласие разметчиков и оценка на отложенной выборке важны не меньше алгоритма.
Дообучение с подкреплением
Данные: Промпты и надёжный оценщик или сигнал вознаграждения
Оптимизировать результаты, которые можно последовательно оценивать на сгенерированных траекториях.
На что смотреть: Взлом вознаграждения, смещение оценщика, нестабильность и более сложная эксплуатация требуют дополнительного контроля.