Loading...
Обучение с подкреплением на основе обратной связи от человека(RLHF)
Тонкая настройка политики методом обучения с подкреплением относительно модели вознаграждения, обученной на предпочтениях, выраженных человеком
In 30 seconds
- What
- Обучает модель вознаграждения на человеческих сравнениях предпочтений, а затем оптимизирует поведение агента под неё, ограничивая отклонение от базовой модели.
- When to use
- Согласование выходов агента с тонкими человеческими ценностями там, где простые метрики не работают, и вы можете позволить себе объёмную человеческую разметку и вычисления.
- Watch out
- Модель вознаграждения перенимает предубеждения разметчиков и плохо покрывает пограничные случаи; агент эксплуатирует её пробелы вместо реального улучшения, из-за чего нужен дорогой мониторинг.
Loading technique guide…