Loading...
🎮
强化学习探索(RLE)
通过基于奖励的探索与利用平衡来学习最优行为
复杂度: high探索与发现
In 30 seconds
- What
- 智能体在探索新动作与利用已知有回报的动作之间取得平衡,从而学习最优行为,并借助奖励信号逐步优化其策略。
- When to use
- 需要在奖励延迟或稀疏的环境中通过试错发现良好策略的系统,例如推荐或资源分配。
- Watch out
- 奖励函数错位会让智能体优化错误的目标,在规模化后产生有害或无用的行为。
Loading technique guide…