Loading...
🎰
Multi-Armed-Bandit-Optimierung(MAB)
Sequenzielle Entscheidungsfindung unter Unsicherheit mit optimalen Abwägungen zwischen Exploration und Exploitation
Komplexität: mediumExploration und Entdeckung
In 30 seconds
- What
- Wägt das Ausprobieren neuer Optionen gegen das Ausnutzen bekannt guter ab und entscheidet über Konfidenzgrenzen, welcher Arm in jeder Runde gezogen wird.
- When to use
- Wiederholte Entscheidungen mit unsicherem Ertrag, bei denen man aus jeder Wahl lernt und das Gesamtbedauern über die Zeit minimieren muss.
- Watch out
- Langsame Konvergenz oder schlechte Entscheidungen, wenn Belohnungssignale verrauscht oder verzögert sind oder sich die Umgebung schneller ändert, als der Algorithmus sich anpasst.
Loading technique guide…