Muster werden geladen…
Planung durch Weltmodell-Simulation(WMSP)
Der Agent unterhält ein Weltmodell (oder nutzt das LLM selbst als solches), das den nächsten Zustand und die Konsequenz jeder in Betracht gezogenen Aktion vorhersagt, und führt dann vorausschauende Rollouts („erst vorstellen, dann handeln“) aus, um eine Aktion zu bewerten und auszuwählen, bevor irgendetwas in der realen Umgebung ausgeführt wird. Dies überträgt modellbasiertes Reinforcement Learning auf Sprachagenten und ist vor allem dort von Bedeutung, wo Aktionen irreversibel sind und ein Zurückgehen auf einer live betriebenen Website oder GUI unmöglich ist. Abzugrenzen von scenario-planning, das über mehrere strategische Zukünfte ohne Aktions-Konsequenz-Simulator nachdenkt, und von reflective-mcts, das über Reasoning-Spuren statt über simulierte Umgebungszustände sucht.
In 30 Sekunden
- Was
- Der Agent simuliert die Ergebnisse möglicher Aktionen mit einem LLM oder einem gelernten Modell, bewertet sie und führt dann die beste in der realen Umgebung aus.
- Wann einsetzen
- Unumkehrbare Aktionen auf Live-Websites oder in Benutzeroberflächen, bei denen ein Zurückgehen unmöglich oder teuer ist und Fehler schwer wiegen.
- Achtung
- Simulationsfehler summieren sich: Eine falsche Vorhersage früh im Rollout pflanzt sich fort und führt trotz korrekter Bewertungslogik zu schlechter Aktionswahl.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Planung durch Weltmodell-Simulation: Überblick
Der Agent unterhält ein Weltmodell (oder nutzt das LLM selbst als solches), das den nächsten Zustand und die Konsequenz jeder in Betracht gezogenen Aktion vorhersagt, und führt dann vorausschauende Rollouts („erst vorstellen, dann handeln“) aus, um eine Aktion zu bewerten und auszuwählen, bevor irgendetwas in der realen Umgebung ausgeführt wird. Dies überträgt modellbasiertes Reinforcement Learning auf Sprachagenten und ist vor allem dort von Bedeutung, wo Aktionen irreversibel sind und ein Zurückgehen auf einer live betriebenen Website oder GUI unmöglich ist. Abzugrenzen von scenario-planning, das über mehrere strategische Zukünfte ohne Aktions-Konsequenz-Simulator nachdenkt, und von reflective-mcts, das über Reasoning-Spuren statt über simulierte Umgebungszustände sucht.
- LLM or learned model simulates the outcome of each candidate action
- Look-ahead rollouts score actions before any real execution
- Avoids irreversible mistakes on live web and GUI environments
- Value function or scorer ranks the simulated end states
- More efficient than tree search that cannot backtrack a live action
- Self-evolving variants update the world model from prediction errors
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
- Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents - Gu et al. (ArXiv 2024)arXiv:2411.06559
- Self-Evolving World Models for LLM Agent Planning - Zhang et al. (ArXiv 2026)arXiv:2606.30639
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (ArXiv 2026)arXiv:2606.27483
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September