Loading...
🎮
Исследование через обучение с подкреплением(RLE)
Обучение оптимальному поведению за счёт баланса исследования и эксплуатации на основе вознаграждения
Сложность: highИсследование и открытие
In 30 seconds
- What
- Агент осваивает оптимальное поведение, балансируя между исследованием новых действий и использованием уже известных выгодных, и постепенно улучшает свою стратегию по сигналам вознаграждения.
- When to use
- Системы, которым нужно методом проб и ошибок находить удачные стратегии в средах с отложенным или редким вознаграждением, например в рекомендациях или распределении ресурсов.
- Watch out
- Рассогласованная функция вознаграждения заставляет агента оптимизировать не ту цель, порождая вредное или бесполезное поведение в больших масштабах.
Loading technique guide…