Loading...
Exécution spéculative et parallèle des outils(STE)
Prédit l'appel d'outil suivant le plus probable à partir des trajectoires récurrentes de l'agent et l'exécute de manière spéculative pendant que le LLM génère encore, en isolant le résultat spéculatif jusqu'à ce que le modèle confirme l'appel et en l'écartant en cas de prédiction erronée. Cela couvre aussi le lancement d'une recherche en cours de tour utilisateur diffusé en flux et le renvoi de résultats d'outils partiels ou diffusés en continu. À distinguer d'async-await, de fork-join, de scatter-gather et de map-reduce, qui répartissent tous des appels déjà décidés et connus pour être indépendants ; la nouveauté ici consiste à agir sur un appel prédit non confirmé, de sorte que la latence de l'outil chevauche la génération au lieu de la suivre.
In 30 seconds
- What
- Prédit le prochain appel d'outil à partir des schémas passés de l'agent et l'exécute de façon spéculative pendant que le LLM génère encore, en isolant les résultats jusqu'à ce que le modèle confirme l'appel.
- When to use
- Flux sensibles à la latence où la même séquence d'outils se répète de façon prévisible et où le temps d'exécution des outils domine le délai de réponse.
- Watch out
- Les erreurs de prédiction gaspillent du calcul et peuvent créer des incohérences d'état subtiles si les effets de bord spéculatifs fuient vers le chemin d'exécution confirmé.
Loading technique guide…