Chargement des modèles…
Observabilité et traçage des agents(AOT)
Traçage en production au niveau de chaque étape qui enregistre chaque appel de modèle, appel d'outil, étape de workflow et sous-agent sous forme de span dans un arbre d'exécution unique, annoté de métriques de tokens, de latence et de coût. Standardisé via les conventions sémantiques OpenTelemetry GenAI (attributs gen_ai.*) et exposé dans des plateformes comme LangSmith, Braintrust et Datadog, c'est le signal en temps réel pour déboguer les défaillances non déterministes en production, à distinguer des benchmarks hors ligne qui notent le comportement avant le déploiement.
Aperçu en 30 secondes
- Quoi
- Enregistre chaque appel de modèle, chaque appel d'outil et chaque étape du workflow sous forme de spans horodatés, avec le nombre de tokens, la latence et le coût, organisés en un arbre d'exécution unique pour le débogage en production.
- Quand l'utiliser
- Systèmes en production où les défaillances d'agents multi-étapes sont non déterministes, difficiles à reproduire hors ligne, ou exigent une analyse de cause racine à travers les frontières entre modèle et outils.
- Vigilance
- La surcharge et les coûts de stockage grimpent vite avec une journalisation verbeuse, et la capture négligente de données sensibles (données personnelles, secrets) dans les prompts et les réponses crée un risque de conformité et de sécurité.
Interrogez l'expert IA sur ce pattern
Ouvre l'assistant avec votre question préremplie. Vous la relisez avant l'envoi.
Observabilité et traçage des agents: Vue d’ensemble
Traçage en production au niveau de chaque étape qui enregistre chaque appel de modèle, appel d'outil, étape de workflow et sous-agent sous forme de span dans un arbre d'exécution unique, annoté de métriques de tokens, de latence et de coût. Standardisé via les conventions sémantiques OpenTelemetry GenAI (attributs gen_ai.*) et exposé dans des plateformes comme LangSmith, Braintrust et Datadog, c'est le signal en temps réel pour déboguer les défaillances non déterministes en production, à distinguer des benchmarks hors ligne qui notent le comportement avant le déploiement.
- Hierarchical spans for model calls, tool calls, workflow steps, and sub-agents
- Per-span token counts, latency, and cost roll-ups across the run tree
- OpenTelemetry GenAI semantic conventions (gen_ai.* attributes) for vendor-neutral traces
- Full input/output and prompt/response capture for replay and root-cause analysis
- Root-cause debugging of non-deterministic multi-step failures in production
- Live dashboards, alerting, and drill-down surfaced by LangSmith, Braintrust, and Datadog
Recevez le guide de terrain Agent Evals
Les 25 méthodes d’évaluation d’agents condensées en un guide : quel benchmark mesure quoi, quand un score public vous induit en erreur, et comment construire vos évaluations à partir de vos propres échecs. Le lien arrive avec votre confirmation, avec l’hebdo The Agent Architect.
Un email par semaine, désinscription en un clic. Votre adresse ne sert qu'à envoyer le brief.
Références
Les articles, spécifications et dépôts sur lesquels repose ce modèle.
- OpenTelemetry GenAI Semantic Conventions
- LangSmith Observability Documentation
- Braintrust: Tracing and Evaluation for AI Applications
- Datadog LLM Observability
Par l’ingénieur derrière ce catalogue
Voyez ce que vos évaluations laissent passer
Mesurer un agent est plus dur que le livrer, et la plupart des suites restent au vert pendant que la production dérive. Faites relire tout votre dispositif d’évaluation : ce que vous mesurez aujourd’hui, ce que vous ne voyez pas encore, et les régressions que votre suite actuelle laisserait passer.
750 € au lieu de 1 500 €, une semaine, rapport écrit et appel de restitution, jusqu’au 30 septembre