Loading...
Planung durch Weltmodell-Simulation(WMSP)
Der Agent unterhält ein Weltmodell (oder nutzt das LLM selbst als solches), das den nächsten Zustand und die Konsequenz jeder in Betracht gezogenen Aktion vorhersagt, und führt dann vorausschauende Rollouts („erst vorstellen, dann handeln“) aus, um eine Aktion zu bewerten und auszuwählen, bevor irgendetwas in der realen Umgebung ausgeführt wird. Dies überträgt modellbasiertes Reinforcement Learning auf Sprachagenten und ist vor allem dort von Bedeutung, wo Aktionen irreversibel sind und ein Zurückgehen auf einer live betriebenen Website oder GUI unmöglich ist. Abzugrenzen von scenario-planning, das über mehrere strategische Zukünfte ohne Aktions-Konsequenz-Simulator nachdenkt, und von reflective-mcts, das über Reasoning-Spuren statt über simulierte Umgebungszustände sucht.
In 30 seconds
- What
- Der Agent simuliert die Ergebnisse möglicher Aktionen mit einem LLM oder einem gelernten Modell, bewertet sie und führt dann die beste in der realen Umgebung aus.
- When to use
- Unumkehrbare Aktionen auf Live-Websites oder in Benutzeroberflächen, bei denen ein Zurückgehen unmöglich oder teuer ist und Fehler schwer wiegen.
- Watch out
- Simulationsfehler summieren sich: Eine falsche Vorhersage früh im Rollout pflanzt sich fort und führt trotz korrekter Bewertungslogik zu schlechter Aktionswahl.
Loading technique guide…