规划你的部署
在将 LLM 部署到生产环境之前,你首先需要做出几个关键决策。这些早期选择将决定你的基础设施需求、成本,以及模型在你的用例中的表现。
- 无服务器(Serverless)与自托管 LLM 推理 — 了解无服务器 LLM API 与自托管 LLM 部署之间的区别。
- 选择合适的模型 — 为你的用例选择正确的模型。
- 选择合适的 GPU — 为 LLM 推理选择合适的 NVIDIA 或 AMD GPU。
- 计算服务 LLM 所需的 GPU 显存 — 了解如何计算服务 LLM 所需的 GPU 显存。
- 选择合适的推理框架 — 了解 LLM 推理框架的作用,以及如何为你的用例选择合适的推理框架。
- Bring Your Own Cloud(BYOC) — 供应商在你的云环境中运行软件的部署模型,兼顾托管编排与完整的数据控制。
- 本地部署(on-prem)LLM — 在组织自有基础设施(如私有数据中心或物理断网环境)中部署大语言模型。