Agent可观测性与评估
问题:传统 APM 失效——"请求返回 200,但 Agent 循环了两次、调错工具、幻觉了一份策略"。Agent 是会说自然语言的分布式系统,故障模式是静默的(漂移、死循环、幻觉工具调用、无声数据损坏)。
核心数据(2025-2026)
67% 的生产 Agent 故障由用户发现,而非监控系统
有完善可观测性的团队排查快 10 倍(12 分钟 vs 2 小时)
分布式追踪使 MTTR 降 73%;Gartner:40% Agent 项目 2027 前被取消
合理的成本监控每月每个 Agent 平均避免 $8,000 意外支出
四大支柱:Monitoring(指标)→ Tracing(链路)→ Evaluation(评估)→ Governance(治理)。
五大关键指标:成功率(>99%,注意 200≠成功)、延迟(p95<3s)、Token 用量、分类型错误率、业务完成率。
评估范式转移:单轮 benchmark 分数 → 轨迹级评估(trajectory eval)——不只问答案对不对,还要看 Agent 步骤是否合理、工具用得对不对、出错能否恢复。评估必须持续(模型更新/工具变化/prompt 演进都会漂移),不能 episodic。
工具栈:OpenTelemetry GenAI 语义约定(厂商中立标准)→ LangSmith(UX 最佳)/ Langfuse(自托管/已被 ClickHouse 收购)/ AgentOps(异构多框架)。分层:Prometheus+Grafana 管指标、Jaeger 管链路、LangSmith 管行为分析。
实践清单:100% 记错误、成功采样(≤10%);每个工具调用/模型生成/子 Agent 都建 span;LLM-as-judge + 规则校验混合(小模型 judge 实现 100% 覆盖);HITL 从"门禁"变"护栏"——默认自治、高风险/超阈值才升级人工,异步恢复(checkpoint + 队列 + TTL)。
生产底线:先做 tracing——看不见就没法调试。无追踪系统不生产。
