Загружаем паттерны…
Планирование через симуляцию модели мира(WMSP)
Агент поддерживает модель мира (или использует в этом качестве сам LLM), которая предсказывает следующее состояние и последствие каждого возможного действия, а затем прогоняет упреждающие развёртывания («представить, прежде чем действовать»), чтобы оценить и выбрать действие до того, как что-либо будет выполнено в реальной среде. Это распространяет обучение с подкреплением на основе модели на языковых агентов и особенно важно там, где действия необратимы, а откат на работающем сайте или в GUI невозможен. В отличие от scenario-planning, который рассуждает о нескольких стратегических вариантах будущего без симулятора «действие-последствие», и от reflective-mcts, который ведёт поиск по трассам рассуждений, а не по симулированным состояниям среды.
За 30 секунд
- Что это
- Агент моделирует исходы возможных действий с помощью LLM или обученной модели, оценивает их, а затем выполняет лучшее из них в реальной среде.
- Когда применять
- Необратимые действия на работающих сайтах или в графических интерфейсах, где откат невозможен или дорог, а ошибки обходятся дорого.
- Осторожно
- Ошибки моделирования накапливаются: неверный прогноз в начале развёртки каскадом ухудшает выбор действий даже при корректной логике оценки.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Планирование через симуляцию модели мира: Обзор
Агент поддерживает модель мира (или использует в этом качестве сам LLM), которая предсказывает следующее состояние и последствие каждого возможного действия, а затем прогоняет упреждающие развёртывания («представить, прежде чем действовать»), чтобы оценить и выбрать действие до того, как что-либо будет выполнено в реальной среде. Это распространяет обучение с подкреплением на основе модели на языковых агентов и особенно важно там, где действия необратимы, а откат на работающем сайте или в GUI невозможен. В отличие от scenario-planning, который рассуждает о нескольких стратегических вариантах будущего без симулятора «действие-последствие», и от reflective-mcts, который ведёт поиск по трассам рассуждений, а не по симулированным состояниям среды.
- LLM or learned model simulates the outcome of each candidate action
- Look-ahead rollouts score actions before any real execution
- Avoids irreversible mistakes on live web and GUI environments
- Value function or scorer ranks the simulated end states
- More efficient than tree search that cannot backtrack a live action
- Self-evolving variants update the world model from prediction errors
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
- Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents - Gu et al. (ArXiv 2024)arXiv:2411.06559
- Self-Evolving World Models for LLM Agent Planning - Zhang et al. (ArXiv 2026)arXiv:2606.30639
- Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning (ArXiv 2026)arXiv:2606.27483
От инженера, создавшего этот каталог
Проведите ревью архитектуры ваших агентов
На этой странице описан один паттерн. Ваша система использует десятки, и большинство сбоев возникает на стыках. Мы разберём весь дизайн по 288 паттернам каталога: архитектура, надёжность, оценка и стоимость, каждая находка связана с паттерном, который её устраняет.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября