正在加载模式…
智能体可观测性与追踪(AOT)
生产环境中的步骤级追踪,将每一次模型调用、工具调用、工作流步骤和子智能体记录为单一运行树中的一个 span,并标注 token、延迟和成本指标。它通过 OpenTelemetry GenAI 语义约定(gen_ai.* 属性)实现标准化,并在 LangSmith、Braintrust 和 Datadog 等平台上呈现,是在生产环境中调试非确定性故障的实时信号,区别于在部署前对行为进行评分的离线基准测试。
30秒速览
- 是什么
- 把每一次模型调用、工具调用和工作流步骤都记录为带时间戳的 span,附上 token 数、延迟和成本,并汇总到单一的运行树中,供生产环境排查问题。
- 何时使用
- 适用于多步骤智能体故障具有非确定性、难以离线复现,或需要跨模型与工具边界做根因分析的生产系统。
- 注意
- 日志越详细,开销和存储成本增长得越快;不加甄别地把提示词和响应中的敏感数据(个人信息、密钥)记录下来,会带来合规与安全风险。
向AI专家咨询此模式
打开助手并预填您的问题,发送前可先确认。
智能体可观测性与追踪: 概览
生产环境中的步骤级追踪,将每一次模型调用、工具调用、工作流步骤和子智能体记录为单一运行树中的一个 span,并标注 token、延迟和成本指标。它通过 OpenTelemetry GenAI 语义约定(gen_ai.* 属性)实现标准化,并在 LangSmith、Braintrust 和 Datadog 等平台上呈现,是在生产环境中调试非确定性故障的实时信号,区别于在部署前对行为进行评分的离线基准测试。
- Hierarchical spans for model calls, tool calls, workflow steps, and sub-agents
- Per-span token counts, latency, and cost roll-ups across the run tree
- OpenTelemetry GenAI semantic conventions (gen_ai.* attributes) for vendor-neutral traces
- Full input/output and prompt/response capture for replay and root-cause analysis
- Root-cause debugging of non-deterministic multi-step failures in production
- Live dashboards, alerting, and drill-down surfaced by LangSmith, Braintrust, and Datadog
获取智能体评估实战指南
25 种智能体评估方法浓缩成一份指南:每个基准测量什么、公开分数何时具有误导性、如何用自己的失败构建评估。链接随确认邮件送达,并附每周的 The Agent Architect。
每周一封邮件,一键退订。您的地址仅用于发送简报。
参考资料
该模式所依据的论文、规范和代码仓库。
- OpenTelemetry GenAI Semantic Conventions
- LangSmith Observability Documentation
- Braintrust: Tracing and Evaluation for AI Applications
- Datadog LLM Observability
由本目录背后的工程师执行
看看你的评测漏掉了什么
评测智能体比做出来更难,多数测试套件一路全绿,线上却在悄悄漂移。我们从头到尾检查你的评测体系:现在测到了什么、还有什么看不见,以及当前套件会放过哪些回归。
€750(原价 €1,500),一周交付,书面报告加讲解通话,9月30日前