Загружаем паттерны…
Спекулятивное и параллельное выполнение инструментов(STE)
Предсказывает наиболее вероятный следующий вызов инструмента по повторяющимся траекториям агента и выполняет его спекулятивно, пока LLM ещё генерирует ответ, изолируя спекулятивный результат до тех пор, пока модель не подтвердит вызов, и отбрасывая его при ошибочном предсказании. Сюда же входит запуск извлечения данных в середине потокового пользовательского хода и возврат частичных или потоковых результатов работы инструментов. В отличие от async-await, fork-join, scatter-gather и map-reduce, которые распределяют уже принятые и заведомо независимые вызовы, новизна здесь в том, чтобы действовать по неподтверждённому предсказанному вызову, благодаря чему задержка инструмента перекрывается с генерацией, а не следует за ней.
За 30 секунд
- Что это
- Предсказывает следующий вызов инструмента по прошлым паттернам агента и выполняет его спекулятивно, пока LLM ещё генерирует ответ, удерживая результат в изоляции до подтверждения вызова моделью.
- Когда применять
- Чувствительные к задержке сценарии, где одна и та же последовательность инструментов предсказуемо повторяется, а время их выполнения определяет основную часть задержки ответа.
- Осторожно
- Ошибочные предсказания тратят вычисления и могут вызвать неочевидные несогласованности состояния, если спекулятивные побочные эффекты просачиваются в подтверждённый путь выполнения.
Спросите ИИ-эксперта об этом паттерне
Откроет ассистента с готовым вопросом. Вы проверите его перед отправкой.
Спекулятивное и параллельное выполнение инструментов: Обзор
Предсказывает наиболее вероятный следующий вызов инструмента по повторяющимся траекториям агента и выполняет его спекулятивно, пока LLM ещё генерирует ответ, изолируя спекулятивный результат до тех пор, пока модель не подтвердит вызов, и отбрасывая его при ошибочном предсказании. Сюда же входит запуск извлечения данных в середине потокового пользовательского хода и возврат частичных или потоковых результатов работы инструментов. В отличие от async-await, fork-join, scatter-gather и map-reduce, которые распределяют уже принятые и заведомо независимые вызовы, новизна здесь в том, чтобы действовать по неподтверждённому предсказанному вызову, благодаря чему задержка инструмента перекрывается с генерацией, а не следует за ней.
- Predicts the next tool call from recurring agent trajectories
- Launches the predicted call while the LLM is still decoding
- Speculative result kept isolated until the model confirms the call
- Mispredicted calls discarded with no effect on real state
- Mid-stream retrieval plus partial or streamed tool results
- Overlaps tool latency with generation instead of serial round-trips
The Agent Architect
Один паттерн, один компромисс, одна история сбоя в продакшене. Короткий еженедельный брифинг для тех, кто строит агентные системы.
Одно письмо в неделю, отписка в один клик. Адрес используется только для рассылки брифинга.
Источники
Статьи, спецификации и репозитории, на которых основан этот паттерн.
- Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving (PASTE) - Sui et al. (ArXiv 2026)arXiv:2603.18897
- Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling - Hooper et al. (ArXiv 2026)arXiv:2605.13360
- ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding - Xia et al. (ArXiv 2026)arXiv:2604.13519
От инженера, создавшего этот каталог
Проведите ревью архитектуры ваших агентов
На этой странице описан один паттерн. Ваша система использует десятки, и большинство сбоев возникает на стыках. Мы разберём весь дизайн по 288 паттернам каталога: архитектура, надёжность, оценка и стоимость, каждая находка связана с паттерном, который её устраняет.
€750 вместо €1 500, одна неделя, письменный отчёт и разбор в звонке, до 30 сентября