跳到主要内容

LLM 可观测性

LLM 可观测性(observability)是对生产环境中 LLM 推理系统的行为进行监控和理解的做法。它将基础设施、应用和模型层级的指标、日志与事件结合起来,提供端到端的可见性。目标是尽早发现问题、解释问题发生的原因,并确保模型响应可靠、高效且高质量。

如果没有适当的可观测性,诊断延迟问题、扩展问题或 GPU 利用率不足就会变成瞎猜。更糟糕的是,未被注意的问题可能会在毫无征兆的情况下降低性能或破坏你的服务。

衡量什么

生产级的 LLM 推理可观测性技术栈跨越多个层级。以下是一个示例分解:

类别指标它告诉你什么
容器与部署Pod 状态在 Pod 影响可用性之前检测出失败、卡住或重启中的 Pod
副本数验证自动扩缩容行为,帮助排查扩展延迟或限制
应用性能每秒请求数(RPS)衡量传入流量与系统负载
请求延迟帮助识别响应延迟与瓶颈
进行中的请求指示并发压力;揭示应用是否能跟上需求
错误率追踪失败或无效的响应;对 SLA 监控很有用
队列等待时间揭示因等待可用副本而产生的延迟
集群资源资源配额与限制追踪使用边界;帮助调整请求/限制并避免过度或不足配置
LLM 专用指标每秒 token 数反映模型吞吐量与性能效率
首 token 时间影响用户感知的延迟;对流式或聊天式体验至关重要
总生成时间衡量完整补全的端到端性能
GPU 指标GPU 利用率显示 GPU 的繁忙程度;低值可能意味着利用不足或批处理不佳
GPU 内存使用量有助于容量规划并避免 OOM 错误

指标告诉你正在发生什么,而事件和日志告诉你为什么。

  • 事件(events): 有助于追踪集群活动,如 Pod 重启、扩缩容事件或调度延迟。
  • 日志聚合(log aggregation): 集中式日志让你可以在容器和时间窗口之间进行搜索。这对于调试请求失败、识别崩溃以及跨服务追踪性能问题至关重要。