LLM 可观测性
LLM 可观测性(observability)是对生产环境中 LLM 推理系统的行为进行监控和理解的做法。它将基础设施、应用和模型层级的指标、日志与事件结合起来,提供端到端的可见性。目标是尽早发现问题、解释问题发生的原因,并确保模型响应可靠、高效且高质量。
如果没有适当的可观测性,诊断延迟问题、扩展问题或 GPU 利用率不足就会变成瞎猜。更糟糕的是,未被注意的问题可能会在毫无征兆的情况下降低性能或破坏你的服务。
衡量什么
生产级的 LLM 推理可观测性技术栈跨越多个层级。以下是一个示例分解:
| 类别 | 指标 | 它告诉你什么 |
|---|---|---|
| 容器与部署 | Pod 状态 | 在 Pod 影响可用性之前检测出失败、卡住或重启中的 Pod |
| 副本数 | 验证自动扩缩容行为,帮助排查扩展延迟或限制 | |
| 应用性能 | 每秒请求数(RPS) | 衡量传入流量与系统负载 |
| 请求延迟 | 帮助识别响应延迟与瓶颈 | |
| 进行中的请求 | 指示并发压力;揭示应用是否能跟上需求 | |
| 错误率 | 追踪失败或无效的响应;对 SLA 监控很有用 | |
| 队列等待时间 | 揭示因等待可用副本而产生的延迟 | |
| 集群资源 | 资源配额与限制 | 追踪使用边界;帮助调整请求/限制并避免过度或不足配置 |
| LLM 专用指标 | 每秒 token 数 | 反映模型吞吐量与性能效率 |
| 首 token 时间 | 影响用户感知的延迟;对流式或聊天式体验至关重要 | |
| 总生成时间 | 衡量完整补全的端到端性能 | |
| GPU 指标 | GPU 利用率 | 显示 GPU 的繁忙程度;低值可能意味着利用不足或批处理不佳 |
| GPU 内存使用量 | 有助于容量规划并避免 OOM 错误 |
指标告诉你正在发生什么,而事件和日志告诉你为什么。
- 事件(events): 有助于追踪集群活动,如 Pod 重启、扩缩容事件或调度延迟。
- 日志聚合(log aggregation): 集中式日志让你可以在容器和时间窗口之间进行搜索。这对于调试请求失败、识别崩溃以及跨服务追踪性能问题至关重要。