Loading...
🎰
多腕バンディット最適化(MAB)
不確実性の下での逐次的な意思決定において、探索と活用の最適なトレードオフを実現する手法
複雑さ: medium探索と発見
In 30 seconds
- What
- 新しい選択肢を試すことと、良いと分かっている選択肢を活用することのバランスを取り、信頼区間の上限を用いて各ラウンドでどのアームを引くかを決めます。
- When to use
- 報酬が不確実な意思決定を繰り返し、各選択から学びながら、累積リグレットを最小化する必要がある場面。
- Watch out
- 報酬シグナルにノイズや遅延がある場合、あるいは環境がアルゴリズムの適応速度より速く変化する場合、収束が遅くなったり判断を誤ったりします。
Loading technique guide…