Loading...
🎮
Exploration par apprentissage par renforcement(RLE)
Apprentissage d'un comportement optimal grâce à l'équilibre entre exploration et exploitation fondé sur les récompenses
Complexité: highExploration et découverte
In 30 seconds
- What
- L'agent apprend le comportement optimal en équilibrant l'exploration de nouvelles actions et l'exploitation de celles dont la récompense est connue, en affinant peu à peu sa politique grâce aux signaux de récompense.
- When to use
- Des systèmes qui doivent découvrir de bonnes stratégies par essais et erreurs dans des environnements où les récompenses sont différées ou rares, comme la recommandation ou l'allocation de ressources.
- Watch out
- Une fonction de récompense mal alignée pousse l'agent à optimiser le mauvais objectif, ce qui produit à grande échelle des comportements nuisibles ou inutiles.
Loading technique guide…