Loading...
Planification par simulation avec modèle du monde(WMSP)
L'agent maintient un modèle du monde (ou utilise le LLM lui-même comme tel) qui prédit l'état suivant et la conséquence de chaque action envisagée, puis exécute des déroulés d'anticipation (« imaginer avant d'agir ») pour évaluer et sélectionner une action avant d'exécuter quoi que ce soit dans l'environnement réel. Cela étend l'apprentissage par renforcement basé sur un modèle aux agents linguistiques et s'avère particulièrement crucial lorsque les actions sont irréversibles et qu'il est impossible de revenir en arrière sur un site web ou une interface graphique en production. À distinguer de scenario-planning, qui raisonne sur plusieurs futurs stratégiques sans simulateur d'action-conséquence, et de reflective-mcts, qui explore des traces de raisonnement plutôt que des états d'environnement simulés.
In 30 seconds
- What
- L'agent simule les résultats des actions candidates à l'aide d'un LLM ou d'un modèle appris, les note, puis exécute la meilleure dans l'environnement réel.
- When to use
- Actions irréversibles sur des sites web ou des interfaces en production, où revenir en arrière est impossible ou coûteux et où les erreurs ont de lourdes conséquences.
- Watch out
- Les erreurs de simulation s'accumulent : une prédiction erronée au début du déroulé se propage et dégrade le choix des actions, même si la logique de notation est correcte.
Loading technique guide…