Muster werden geladen…
Agenten-Observability und -Tracing(AOT)
Tracing auf Schritt-Ebene im Produktivbetrieb, das jeden Modellaufruf, Tool-Aufruf, Workflow-Schritt und Sub-Agenten als Span in einem einzigen Run-Tree erfasst, angereichert mit Kennzahlen zu Tokens, Latenz und Kosten. Standardisiert über die semantischen Konventionen von OpenTelemetry GenAI (gen_ai.*-Attribute) und in Plattformen wie LangSmith, Braintrust und Datadog sichtbar gemacht, ist es das Live-Signal zum Debuggen nicht-deterministischer Fehler in Produktion, im Unterschied zu Offline-Benchmarks, die das Verhalten vor dem Deployment bewerten.
In 30 Sekunden
- Was
- Zeichnet jeden Modellaufruf, Tool-Aufruf und Workflow-Schritt als zeitgestempelten Span mit Token-Zahlen, Latenz und Kosten auf, gebündelt in einem einzigen Run-Tree für das Debugging in Produktion.
- Wann einsetzen
- Produktivsysteme, in denen mehrstufige Agentenfehler nicht deterministisch sind, sich offline kaum reproduzieren lassen oder eine Ursachenanalyse über Modell- und Tool-Grenzen hinweg erfordern.
- Achtung
- Overhead und Speicherkosten steigen bei ausführlichem Logging schnell; das unbedachte Mitschreiben sensibler Daten (personenbezogene Daten, Secrets) in Prompts und Antworten schafft Compliance- und Sicherheitsrisiken.
Fragen Sie den KI-Experten zu diesem Pattern
Öffnet den Assistenten mit vorbereiteter Frage. Sie prüfen sie vor dem Senden.
Agenten-Observability und -Tracing: Überblick
Tracing auf Schritt-Ebene im Produktivbetrieb, das jeden Modellaufruf, Tool-Aufruf, Workflow-Schritt und Sub-Agenten als Span in einem einzigen Run-Tree erfasst, angereichert mit Kennzahlen zu Tokens, Latenz und Kosten. Standardisiert über die semantischen Konventionen von OpenTelemetry GenAI (gen_ai.*-Attribute) und in Plattformen wie LangSmith, Braintrust und Datadog sichtbar gemacht, ist es das Live-Signal zum Debuggen nicht-deterministischer Fehler in Produktion, im Unterschied zu Offline-Benchmarks, die das Verhalten vor dem Deployment bewerten.
- Hierarchical spans for model calls, tool calls, workflow steps, and sub-agents
- Per-span token counts, latency, and cost roll-ups across the run tree
- OpenTelemetry GenAI semantic conventions (gen_ai.* attributes) for vendor-neutral traces
- Full input/output and prompt/response capture for replay and root-cause analysis
- Root-cause debugging of non-deterministic multi-step failures in production
- Live dashboards, alerting, and drill-down surfaced by LangSmith, Braintrust, and Datadog
Den Agent-Evals-Field-Guide erhalten
Alle 25 Methoden zur Agentenbewertung in einem Leitfaden: welcher Benchmark was misst, wann ein öffentlicher Score in die Irre führt und wie Sie Evals aus Ihren eigenen Fehlern bauen. Der Link kommt mit Ihrer Bestätigung, zusammen mit dem wöchentlichen Agent Architect.
Wöchentliche E-Mail, Abmeldung mit einem Klick. Ihre Adresse wird nur für das Briefing verwendet.
Quellen
Die Veröffentlichungen, Spezifikationen und Repositories, auf denen dieses Muster beruht.
- OpenTelemetry GenAI Semantic Conventions
- LangSmith Observability Documentation
- Braintrust: Tracing and Evaluation for AI Applications
- Datadog LLM Observability
Vom Ingenieur hinter diesem Katalog
Finden Sie heraus, was Ihre Evals übersehen
Einen Agenten zu messen ist schwerer, als ihn auszuliefern, und die meisten Suiten bleiben grün, während die Produktion abdriftet. Lassen Sie Ihr Evaluations-Setup durchgehend prüfen: was Sie heute messen, was Sie noch nicht sehen, und welche Regressionen Ihre Suite derzeit durchlässt.
750 € statt 1.500 €, eine Woche, schriftlicher Bericht und Walkthrough-Call, bis 30. September