Loading...
🎰
多臂老虎机优化(MAB)
在不确定性下进行序贯决策,实现探索与利用之间的最优权衡
复杂度: medium探索与发现
In 30 seconds
- What
- 在尝试新选项与利用已知优质选项之间取得平衡,用置信上界决定每一轮拉动哪个臂。
- When to use
- 回报不确定的重复决策:每次选择都能带来学习,且需要将长期的累计遗憾降到最低。
- Watch out
- 如果奖励信号有噪声、有延迟,或环境变化快于算法的适应速度,就会收敛缓慢或做出糟糕的决策。
Loading technique guide…