Loading...
Исследование и открытие
Паттерны для поиска, экспериментирования, адаптации и обнаружения решений
In 30 seconds
- What
- Балансирует между пробой неопределённых альтернатив и повторением заведомо удачных вариантов, используя обратную связь для поиска эффективного поведения там, где лучшее действие изначально неизвестно.
- When to use
- Оптимальная стратегия неизвестна, а обратная связь поступает постепенно; пространство вариантов слишком велико для полного перебора; контролируемые эксперименты безопасны и измеримы.
- Watch out
- Оптимизация прокси-награды, расходящейся с реальной ценностью для пользователя, может увести систему от по-настоящему полезного поведения.
Обзор
Паттерны исследования и открытия балансируют между испытанием неопределённых альтернатив и использованием уже известных удачных вариантов. В коллекцию входят поиск на основе любопытства, стратегии многоруких бандитов, эволюционная оптимизация и обучение с подкреплением для сред, где полезное поведение приходится обнаруживать через обратную связь.
Практические применения и сценарии
Оптимизация экспериментов
распределять трафик между альтернативами, одновременно выясняя, какая из них работает лучше.
Поиск и проектирование
исследовать обширные пространства кандидатов, где градиенты или точные решатели недоступны.
Адаптивные системы принятия решений
улучшать стратегии на основе повторяющихся результатов, управляя при этом операционным риском.
Почему это важно
Системы, которые лишь повторяют известные стратегии, не способны адаптироваться к новым условиям, тогда как неограниченное исследование может оказаться дорогостоящим или небезопасным. Эти паттерны делают этот компромисс явным.
Руководство по внедрению
Когда использовать
Наилучшее действие изначально неопределённо, а обратная связь поступает со временем
Пространство кандидатов слишком велико для исчерпывающего поиска
Контролируемое экспериментирование допустимо и измеримо
Лучшие практики
Определить безопасные границы исследования и условия отката
Отделять офлайн-оценку от защищённых онлайн-экспериментов
Отслеживать сожаление (regret), охват и последующее влияние, а не только вознаграждение
Распространённые ошибки
Исследовать напрямую в производственных решениях с высоким риском
Оптимизировать прокси-вознаграждение, расходящееся с ценностью для пользователя
Игнорировать отложенные эффекты и меняющиеся среды