Loading...
Обучение с подкреплением на основе обратной связи от ИИ(RLAIF)
Обучение политики на основе оценок предпочтений, выдаваемых ИИ-оценщиком по заданным человеком критериям и под его надзором
In 30 seconds
- What
- Обучает политику на основе предпочтений, которые выносит ИИ-оценщик, работающий по заданным человеком критериям, с человеческим аудитом для выявления дрейфа оценщика.
- When to use
- Нужно масштабировать разметку предпочтений за пределы человеческих возможностей, сохраняя согласованность с человеческими ценностями в конкретной задаче.
- Watch out
- ИИ-оценщик может незаметно отойти от рубрики или усилить человеческие предубеждения, заложенные в калибровочный набор, испортив весь цикл обучения.
Loading technique guide…