Chargement des modèles…
Planification par simulation avec modèle du monde(WMSP)
L'agent maintient un modèle du monde (ou utilise le LLM lui-même comme tel) qui prédit l'état suivant et la conséquence de chaque action envisagée, puis exécute des déroulés d'anticipation (« imaginer avant d'agir ») pour évaluer et sélectionner une action avant d'exécuter quoi que ce soit dans l'environnement réel. Cela étend l'apprentissage par renforcement basé sur un modèle aux agents linguistiques et s'avère particulièrement crucial lorsque les actions sont irréversibles et qu'il est impossible de revenir en arrière sur un site web ou une interface graphique en production. À distinguer de scenario-planning, qui raisonne sur plusieurs futurs stratégiques sans simulateur d'action-conséquence, et de reflective-mcts, qui explore des traces de raisonnement plutôt que des états d'environnement simulés.
Aperçu en 30 secondes
- Quoi
- L'agent simule les résultats des actions candidates à l'aide d'un LLM ou d'un modèle appris, les note, puis exécute la meilleure dans l'environnement réel.
- Quand l'utiliser
- Actions irréversibles sur des sites web ou des interfaces en production, où revenir en arrière est impossible ou coûteux et où les erreurs ont de lourdes conséquences.
- Vigilance
- Les erreurs de simulation s'accumulent : une prédiction erronée au début du déroulé se propage et dégrade le choix des actions, même si la logique de notation est correcte.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Planification par simulation avec modèle du monde: Vue d’ensemble
L'agent maintient un modèle du monde (ou utilise le LLM lui-même comme tel) qui prédit l'état suivant et la conséquence de chaque action envisagée, puis exécute des déroulés d'anticipation (« imaginer avant d'agir ») pour évaluer et sélectionner une action avant d'exécuter quoi que ce soit dans l'environnement réel. Cela étend l'apprentissage par renforcement basé sur un modèle aux agents linguistiques et s'avère particulièrement crucial lorsque les actions sont irréversibles et qu'il est impossible de revenir en arrière sur un site web ou une interface graphique en production. À distinguer de scenario-planning, qui raisonne sur plusieurs futurs stratégiques sans simulateur d'action-conséquence, et de reflective-mcts, qui explore des traces de raisonnement plutôt que des états d'environnement simulés.
- LLM or learned model simulates the outcome of each candidate action
- Look-ahead rollouts score actions before any real execution
- Avoids irreversible mistakes on live web and GUI environments
- Value function or scorer ranks the simulated end states
- More efficient than tree search that cannot backtrack a live action
- Self-evolving variants update the world model from prediction errors
The Agent Architect
Un pattern, un compromis, une panne de production racontée. Un brief hebdomadaire court pour ceux qui construisent des systèmes agentiques.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents - Gu et al. (ArXiv 2024)arXiv:2411.06559
- Self-Evolving World Models for LLM Agent Planning - Zhang et al. (ArXiv 2026)arXiv:2606.30639
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (ArXiv 2026)arXiv:2606.27483
Par l’ingénieur derrière ce catalogue
Faites auditer l’architecture de vos agents
Cette page documente un pattern. Votre système en fait tourner des dizaines, et l’essentiel des pannes se loge dans la façon dont ils s’articulent. Faites relire toute la conception à l’aune des 288 patterns de ce catalogue : architecture, fiabilité, évaluation et coûts, chaque constat relié au pattern qui le corrige.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre