Loading...
Планирование через симуляцию модели мира(WMSP)
Агент поддерживает модель мира (или использует в этом качестве сам LLM), которая предсказывает следующее состояние и последствие каждого возможного действия, а затем прогоняет упреждающие развёртывания («представить, прежде чем действовать»), чтобы оценить и выбрать действие до того, как что-либо будет выполнено в реальной среде. Это распространяет обучение с подкреплением на основе модели на языковых агентов и особенно важно там, где действия необратимы, а откат на работающем сайте или в GUI невозможен. В отличие от scenario-planning, который рассуждает о нескольких стратегических вариантах будущего без симулятора «действие-последствие», и от reflective-mcts, который ведёт поиск по трассам рассуждений, а не по симулированным состояниям среды.
In 30 seconds
- What
- Агент моделирует исходы возможных действий с помощью LLM или обученной модели, оценивает их, а затем выполняет лучшее из них в реальной среде.
- When to use
- Необратимые действия на работающих сайтах или в графических интерфейсах, где откат невозможен или дорог, а ошибки обходятся дорого.
- Watch out
- Ошибки моделирования накапливаются: неверный прогноз в начале развёртки каскадом ухудшает выбор действий даже при корректной логике оценки.
Loading technique guide…