Muster werden geladen…
Spekulative und parallele Werkzeugausführung(STE)
Sagt aus wiederkehrenden Agenten-Trajektorien den wahrscheinlich nächsten Werkzeugaufruf voraus und führt ihn spekulativ aus, während der LLM noch generiert, wobei das spekulative Ergebnis isoliert bleibt, bis das Modell den Aufruf bestätigt, und bei einer Fehlvorhersage verworfen wird. Ebenso abgedeckt ist das Starten eines Abrufs mitten in einem gestreamten Nutzer-Turn sowie das Zurückgeben partieller oder gestreamter Werkzeugergebnisse. Unterscheidet sich von async-await, fork-join, scatter-gather und map-reduce, die allesamt bereits entschiedene, als unabhängig bekannte Aufrufe verteilen; das Neue hier ist, auf einen unbestätigten, vorhergesagten Aufruf zu reagieren, sodass die Werkzeug-Latenz die Generierung überlappt, statt ihr zu folgen.
In 30 Sekunden
- Was
- Sagt den nächsten Tool-Aufruf aus früheren Agentenmustern voraus und führt ihn spekulativ aus, während das LLM noch generiert, wobei die Ergebnisse isoliert bleiben, bis das Modell den Aufruf bestätigt.
- Wann einsetzen
- Latenzkritische Abläufe, in denen sich dieselbe Tool-Sequenz vorhersehbar wiederholt und die Ausführungszeit der Tools die Antwortverzögerung dominiert.
- Achtung
- Fehlvorhersagen verschwenden Rechenzeit und können subtile Zustandsinkonsistenzen verursachen, wenn spekulative Seiteneffekte in den bestätigten Ausführungspfad durchsickern.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Spekulative und parallele Werkzeugausführung: Überblick
Sagt aus wiederkehrenden Agenten-Trajektorien den wahrscheinlich nächsten Werkzeugaufruf voraus und führt ihn spekulativ aus, während der LLM noch generiert, wobei das spekulative Ergebnis isoliert bleibt, bis das Modell den Aufruf bestätigt, und bei einer Fehlvorhersage verworfen wird. Ebenso abgedeckt ist das Starten eines Abrufs mitten in einem gestreamten Nutzer-Turn sowie das Zurückgeben partieller oder gestreamter Werkzeugergebnisse. Unterscheidet sich von async-await, fork-join, scatter-gather und map-reduce, die allesamt bereits entschiedene, als unabhängig bekannte Aufrufe verteilen; das Neue hier ist, auf einen unbestätigten, vorhergesagten Aufruf zu reagieren, sodass die Werkzeug-Latenz die Generierung überlappt, statt ihr zu folgen.
- Predicts the next tool call from recurring agent trajectories
- Launches the predicted call while the LLM is still decoding
- Speculative result kept isolated until the model confirms the call
- Mispredicted calls discarded with no effect on real state
- Mid-stream retrieval plus partial or streamed tool results
- Overlaps tool latency with generation instead of serial round-trips
The Agent Architect
Ein Pattern, ein Tradeoff, eine Produktionspanne. Ein kurzes wöchentliches Briefing für alle, die agentische Systeme bauen.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
- Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving (PASTE) - Sui et al. (ArXiv 2026)arXiv:2603.18897
- Speculative Interaction Agents: Building Real-Time Agents with Asynchronous I/O and Speculative Tool Calling - Hooper et al. (ArXiv 2026)arXiv:2605.13360
- ToolSpec: Accelerating Tool Calling via Schema-Aware and Retrieval-Augmented Speculative Decoding - Xia et al. (ArXiv 2026)arXiv:2604.13519
Vom Ingenieur hinter diesem Katalog
Lassen Sie Ihre Agenten-Architektur prüfen
Diese Seite dokumentiert ein Pattern. Ihr System betreibt Dutzende, und die meisten Ausfälle entstehen im Zusammenspiel. Lassen Sie den gesamten Entwurf an den 288 Patterns dieses Katalogs messen: Architektur, Zuverlässigkeit, Evaluation und Kosten, jeder Befund verknüpft mit dem Pattern, das ihn behebt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September