AIGC

行业资讯

AIGC模式解析(6)

  • 发布时间
  • 点击次数

Agent可观测性与评估

问题:传统 APM 失效——"请求返回 200,但 Agent 循环了两次、调错工具、幻觉了一份策略"。Agent 是会说自然语言的分布式系统,故障模式是静默的(漂移、死循环、幻觉工具调用、无声数据损坏)。

核心数据(2025-2026)

  • 67% 的生产 Agent 故障由用户发现,而非监控系统

  • 有完善可观测性的团队排查快 10 倍(12 分钟 vs 2 小时)

  • 分布式追踪使 MTTR 降 73%;Gartner:40% Agent 项目 2027 前被取消

  • 合理的成本监控每月每个 Agent 平均避免 $8,000 意外支出

四大支柱:Monitoring(指标)→ Tracing(链路)→ Evaluation(评估)→ Governance(治理)。

五大关键指标:成功率(>99%,注意 200≠成功)、延迟(p95<3s)、Token 用量、分类型错误率、业务完成率。

评估范式转移:单轮 benchmark 分数 → 轨迹级评估(trajectory eval)——不只问答案对不对,还要看 Agent 步骤是否合理、工具用得对不对、出错能否恢复。评估必须持续(模型更新/工具变化/prompt 演进都会漂移),不能 episodic。

工具栈:OpenTelemetry GenAI 语义约定(厂商中立标准)→ LangSmith(UX 最佳)/ Langfuse(自托管/已被 ClickHouse 收购)/ AgentOps(异构多框架)。分层:Prometheus+Grafana 管指标、Jaeger 管链路、LangSmith 管行为分析。

实践清单:100% 记错误、成功采样(≤10%);每个工具调用/模型生成/子 Agent 都建 span;LLM-as-judge + 规则校验混合(小模型 judge 实现 100% 覆盖);HITL 从"门禁"变"护栏"——默认自治、高风险/超阈值才升级人工,异步恢复(checkpoint + 队列 + TTL)。

生产底线:先做 tracing——看不见就没法调试。无追踪系统不生产。


JK小助手
转人工 ×