跳到主要内容

LLM 推理在哪里运行?

在生产环境中部署 LLM 时,选择合适的硬件至关重要。不同类型的硬件提供不同水平的性能和成本效益。三种主要的选择是 CPU、GPU 和 TPU。了解它们的优缺点有助于你有效地优化推理工作负载。

CPU

中央处理器(CPU)是所有计算机和服务器中使用的通用处理器。CPU 随处可得,适合运行小型模型或服务频率较低的请求。然而,它们缺乏高效运行 LLM 所需的并行处理能力。对于生产级 LLM 推理,尤其是使用较大模型或高请求量时,CPU 通常在延迟和吞吐量方面都不够用。

GPU

图形处理器(GPU)最初是为图形渲染和数字可视化任务而设计的。由于它们能够执行高度并行的操作,结果也证明它们非常适合 ML 和 AI 工作负载。如今,GPU 是 LLM 等生成式 AI 训练和推理的默认选择。

GPU 的架构针对矩阵乘法和张量运算进行了优化,而这些正是基于 Transformer 模型的核心组成部分。现代推理框架和运行时(例如 vLLM、SGLang、MAX、LMDeploy、TensorRT-LLM 和 Hugging Face TGI)都旨在充分利用 GPU 加速。

TPU

张量处理单元(TPU)由 Google 定制打造,用于加速训练和推理等 AI 工作负载。与 GPU 相比,TPU 从零开始就是为张量运算——神经网络背后的基本数学——而设计的。这种专门化使 TPU 在 LLM 推理等许多基于 AI 的计算任务上比 GPU 更快、更高效。

TPU 支撑着当今一些最先进的 AI 应用:智能体、推荐系统和个性化、图像、视频与音频合成等等。Google 在搜索(Search)、照片(Photos)、地图(Maps)中使用 TPU,并为 Gemini 和 DeepMind 模型提供动力。


以下是并排对比:

项目CPUGPUTPU
设计目的通用计算面向图形和深度学习的并行计算针对密集张量运算优化
核心优势灵活性,可处理多种类型的任务大规模并行,非常适合训练和推理张量运算的极致效率
并行度非常高
最适用于分支逻辑、小型工作负载、经典应用训练和服务 LLM、图像模型、视频任务大规模训练和高吞吐量推理
内存类型DRAMGDDR / HBMHBM
内存带宽非常高
延迟每核心延迟低延迟较高,但被并行度摊薄矩阵运算延迟低
能效中等中等到高对 ML 工作负载非常高
软件生态成熟、通用CUDA、ROCm、PyTorch、TensorFlowXLA、JAX、TensorFlow
成本中等到高高,主要通过云服务获得
可扩展性对深度学习有限在多 GPU 设置中扩展良好;LLM 面临冷启动问题在 TPU Pod 中扩展能力强
示例用例数据预处理、后端服务、运行小型本地模型LLM 训练和推理大批量训练、Google 的生产推理

为你的 LLM 推理选择合适的硬件

选择合适的硬件需要你了解自己的模型大小、推理量、延迟要求、成本约束和可用基础设施。GPU 由于其通用性和广泛的生态支持,仍然是最受欢迎的选择;而 TPU 在特定专业场景中具有令人瞩目的优势;CPU 在轻量级、预算敏感的工作负载中仍有一席之地。

了解更多关于针对不同开源 LLM 的 GPU 选择

选择合适的部署模式

部署模式影响着从延迟、可扩展性到隐私和成本的方方面面。每种模式都适合企业不同的运营需求。

  • 云(Cloud): 云是当今最流行的 LLM 推理环境。它提供对高性能 GPU 和 TPU 的按需访问,以及丰富的托管服务、自动扩缩容和监控工具生态。
  • 多云与跨区域(Multi-cloud and cross-region): 这种灵活的部署策略 将 LLM 工作负载分布到多个云服务商或地理区域。它有助于降低全球用户的延迟、提高 GPU 可用性、优化计算成本、降低供应商锁定风险,并支持满足数据驻留合规性要求。
  • 自带云(BYOC,Bring Your Own Cloud): BYOC 部署让你能够在自己的云账户内直接运行供应商软件,例如 LLM 推理平台。这种模式将托管编排与对数据、网络和成本的完全控制结合起来。它非常适合那些需要合规性、成本效益和可扩展性,但又不想完全自托管的企业。
  • 本地部署(On-prem): 本地部署意味着在你自己的基础设施上运行 LLM 推理,通常是在私有数据中心内。这种模式提供对数据、性能和合规性的完全控制,但需要更多的基础设施运维开销。
  • 边缘(Edge): 在边缘部署中,模型直接在用户设备或本地边缘节点上运行,更靠近数据产生的地方。这降低了网络延迟并提高了数据隐私,尤其适用于对时间敏感或离线的场景。由于计算资源有限,边缘推理通常使用更小、更优化的模型。