Santé du service
Débit de requêtes, temps d’attente en file, temps jusqu’au premier jeton, latence totale, erreurs, réessais et saturation.
Surveillez ensemble la santé du service, le comportement du modèle, la qualité des sorties et la dépense, pour qu’une API en bonne santé ne puisse pas masquer une expérience produit dégradée.
Débit de requêtes, temps d’attente en file, temps jusqu’au premier jeton, latence totale, erreurs, réessais et saturation.
Version du modèle et du prompt, nombre de jetons, raison d’arrêt, appels d’outils, replis et troncature du contexte.
Réussite de la tâche, ancrage dans les sources, contrôles de sûreté, retours utilisateurs et échantillons de production relus.
Requêtes et jetons par fonctionnalité, facturation du fournisseur, efficacité du cache, consommation de quota et coût par tâche réussie.