Loading...
Spekulative und parallele Werkzeugausführung(STE)
Sagt aus wiederkehrenden Agenten-Trajektorien den wahrscheinlich nächsten Werkzeugaufruf voraus und führt ihn spekulativ aus, während der LLM noch generiert, wobei das spekulative Ergebnis isoliert bleibt, bis das Modell den Aufruf bestätigt, und bei einer Fehlvorhersage verworfen wird. Ebenso abgedeckt ist das Starten eines Abrufs mitten in einem gestreamten Nutzer-Turn sowie das Zurückgeben partieller oder gestreamter Werkzeugergebnisse. Unterscheidet sich von async-await, fork-join, scatter-gather und map-reduce, die allesamt bereits entschiedene, als unabhängig bekannte Aufrufe verteilen; das Neue hier ist, auf einen unbestätigten, vorhergesagten Aufruf zu reagieren, sodass die Werkzeug-Latenz die Generierung überlappt, statt ihr zu folgen.
In 30 seconds
- What
- Sagt den nächsten Tool-Aufruf aus früheren Agentenmustern voraus und führt ihn spekulativ aus, während das LLM noch generiert, wobei die Ergebnisse isoliert bleiben, bis das Modell den Aufruf bestätigt.
- When to use
- Latenzkritische Abläufe, in denen sich dieselbe Tool-Sequenz vorhersehbar wiederholt und die Ausführungszeit der Tools die Antwortverzögerung dominiert.
- Watch out
- Fehlvorhersagen verschwenden Rechenzeit und können subtile Zustandsinkonsistenzen verursachen, wenn spekulative Seiteneffekte in den bestätigten Ausführungspfad durchsickern.
Loading technique guide…