Loading...
🎮
Exploration durch bestärkendes Lernen(RLE)
Erlernen optimalen Verhaltens durch belohnungsbasierte Balance zwischen Exploration und Exploitation
Komplexität: highExploration und Entdeckung
In 30 seconds
- What
- Der Agent erlernt optimales Verhalten, indem er das Erkunden neuer Aktionen gegen das Ausnutzen bekannter, belohnender Aktionen abwägt und seine Strategie mithilfe von Belohnungssignalen mit der Zeit verfeinert.
- When to use
- Systeme, die gute Strategien durch Versuch und Irrtum in Umgebungen finden müssen, in denen Belohnungen verzögert oder selten auftreten, etwa bei Empfehlungen oder Ressourcenzuteilung.
- Watch out
- Eine falsch ausgerichtete Belohnungsfunktion bringt den Agenten dazu, das falsche Ziel zu optimieren, was im großen Maßstab schädliches oder nutzloses Verhalten hervorbringt.
Loading technique guide…