跳到主要内容

什么是 LLM 推理基础设施?

LLM 推理基础设施(inference infrastructure)涵盖了在生产环境中可靠、经济地运行 LLM 推理所需的系统与工作流程。它包括从硬件资源调配到软件协调以及运维监控的一切内容。

LLM 推理基础设施的关键组成部分包括:

  • 硬件资源调配(hardware provisioning): 获得高性能计算资源,如 GPU 和 TPU。
  • 模型部署(model deployment): 打包模型权重、运行时配置、适配器与推理服务代码,使模型能够安全地发布、回滚和更新。
  • 推理运行时(serving runtime): 加载模型、接收请求、执行推理并通过 API 或应用工作流返回结果的软件。示例包括推理服务器、模型网关以及框架特定的运行时。
  • 编排(orchestration): 管理资源分配、动态扩展工作负载,并在多个环境中管理模型版本的工具。
  • 可观测性系统(observability systems): 用于记录日志、监控和追踪的工具,帮助洞察 GPU 利用率、延迟、吞吐量和故障率等性能指标。
  • 安全与访问控制(security and access control): 保护敏感提示词、输出、模型工件和内部数据的控制措施,同时限制谁可以调用或修改已部署的模型。
  • 服务成本管理(cost-to-serve management): 追踪每个工作负载的成本,并调整模型选择、硬件、批处理、路由与扩缩容策略,以保持服务在经济上可持续。
  • 运维流程(operational procedures): 标准化的流程与自动化,使团队能够部署更新、管理版本、处理故障并确保高可用性。随着推理需求增长,拥有可重复、高效的运维对于管理不断增长的工作负载至关重要。