Loading...
🎮
強化学習による探索(RLE)
報酬に基づく探索と活用のバランスを通じて最適な行動を学習する手法
複雑さ: high探索と発見
In 30 seconds
- What
- エージェントは、新しい行動の探索と、報酬が分かっている行動の活用とを釣り合わせながら最適な振る舞いを学び、報酬信号を手がかりに方策を少しずつ洗練させる。
- When to use
- 推薦やリソース配分のように、報酬が遅れて与えられたり乏しかったりする環境で、試行錯誤を通じて良い戦略を見つける必要があるシステム。
- Watch out
- 報酬関数のずれは、エージェントに誤った目的を最適化させ、規模が大きくなるほど有害または無意味な振る舞いを生む。
Loading technique guide…