跳到主要内容

多云与跨区域推理

当团队扩展 LLM 推理时,他们很少把所有东西都放在一个地方。相反,他们把工作负载分散到多个云或多个同一云内的不同区域。这样一来,系统就可以从最合适的位置服务请求。

例如,你可以同时在 AWS 和 GCP 上运行推理,或者将其分布到 Azure 的三个区域以覆盖北美、欧洲和亚洲。这种设置为你提供了灵活性:工作负载可以转移到 GPU 可用且成本划算的地方,性能最高的地方,或者合规规则要求数据保留的地方。

结果是更强的韧性、对全球用户更快的响应,以及对单一供应商更少的依赖。

多云推理

多云(multi-cloud)推理是指同时在多个云服务商之间运行 LLM 工作负载。这种模式并不是把一切从一个提供商迁移到另一个;而是同时在两个(或更多)环境中运营。例如,同一个模型可能在 AWS 上为一组用户运行,在 GCP 上为另一组用户运行,而在 Azure 上作为后备。

跨区域推理

跨区域(cross-region)推理是指在同一个云服务商内的多个地理区域运行 LLM 工作负载。请注意,这并不意味着在每个区域运行不同的模型。相反,同一个应用被复制到多个站点,以便请求可以从最近或最可用的位置得到服务。例如,一个部署可能在 AWS us-east-1 上为北美运行,在 eu-west-1 上为欧洲运行,在 ap-southeast-1 上为亚洲运行。

备注

另一种模式是混合云推理,它结合了本地(on-premises)基础设施与公有云和私有云部署。企业不是在两者之间二选一,而是将部分 LLM 工作负载运行在私有数据中心,并在需要时扩展到云端。详情请参阅本地(on-prem)LLM 部署

为什么多云与跨区域推理很重要

LLM 推理有独特的需求,单一云或区域往往无法满足。多云与跨区域策略通过让部署更灵活、更有韧性来弥合这些差距。

不可预测的需求

与训练不同,LLM 推理由实时使用驱动,通常是突发性的且难以预测。一次产品发布、一个爆红的功能或季节性流量都可能引发请求的突然飙升。需求可能在几分钟内从闲置转向饱和,而你的计算容量可能在最糟糕的时刻耗尽。这增加了运维压力、潜在故障和服务中断。

多云与跨区域部署提供了吸收这些突发的缓冲空间。如果一个区域的算力耗尽,流量可以转移到其他地方。如果一个云服务商出现短缺,工作负载可以溢出到另一个。

对 LLM 来说,这种灵活性尤其重要,因为推理不只是 CPU 密集型或存储密集型。它高度依赖GPU的可用性。像 DeepSeek-V3.1 和 gpt-oss-120b 这样的前沿模型需要 NVIDIA H100 和 AMD MI300X 等硬件,而这些硬件既昂贵又稀缺。

通过多云或跨区域设置,你增加了在需要时找到 GPU 的机会。因此,团队可以平滑流量尖峰、避免请求被丢弃,并在扩展时保持一致的体验。

合规与数据驻留

LLM 经常驱动诸如 AI 智能体和 RAG 系统之类的应用,这些应用需要频繁访问客户记录等敏感信息。因此,企业必须遵守法律法规要求。许多地区强制执行数据驻留(data residency)规则,要求企业在特定的地理边界内处理和存储用户数据。例如,欧盟的 GDPR 限制了个人或敏感数据的跨境自由流动。

多云与跨区域部署使企业能够在不牺牲可用性的情况下满足这些规则。团队可以在数据来源的同一区域部署模型。对于全球应用,这通常意味着在不同区域运行同一模型的多个副本,每个副本只服务本地用户。

GPU 定价

LLM 推理的成本与 GPU 的可用性和定价密切相关。GPU 价格在不同提供商、不同区域,甚至同一云内的不同可用区之间都可能差异很大。下面是 GCP 上按需 NVIDIA H100 a3-highgpu-1g 实例(1 块 GPU)的定价示例。

区域月度成本(美元)
us-central1$8,074.71
europe-west1$8,885.00
us-west2$9,706.48
asia-southeast1$10,427.89
southamerica-east1$12,816.56

最便宜的区域(us-central1)与最贵的区域(southamerica-east1)之间差距接近 60%。对于单区域或单云部署来说,这意味着你会错过其他区域和云中更具成本效益的 GPU 选项。

多云与跨区域部署给团队留出了围绕这些差异进行优化的空间。通过将工作负载路由到 GPU 更便宜或更易获得的区域,团队可以在不牺牲性能的情况下降低成本。这种灵活性在运行前沿模型时极其重要,因为持续的推理可能将计算成本推高到数百万美元。

供应商锁定

一旦企业围绕某个平台的 API 和 GPU SKU 构建起其 LLM 推理技术栈,迁移出去就会变得昂贵而复杂。这种依赖限制了灵活性,并让你暴露于突发的价格变动、区域性中断或供应短缺之中。它还削弱了你未来议价的筹码。

多云推理有助于缓解这种风险。通过跨不同提供商运行工作负载,你避免了将基础设施捆绑在单一生态系统上。如果某个提供商涨价、退役某种 GPU 类型或发生故障,你可以转移推理流量。

是否应该采用多云或跨区域推理策略?

并非每个团队都需要跨多个云或区域运行 LLM。当这种策略的权衡与你的业务目标和工作负载需求相符时,它才有意义。

如果满足以下条件,你应该考虑多云或跨区域推理:

  • 你的 LLM 应用依赖供应紧张的 GPU,需要分散来源。
  • 你必须满足合规或数据驻留要求。
  • 你希望在供应商锁定和价格变动面前拥有筹码。
  • 单一云内(或跨提供商)的可用性和故障切换对你很重要。
  • 跨区域或跨提供商的成本优化是你的优先事项。

自建 vs. 采购

一旦你决定采用多云或跨区域方案,就需要考虑下一步。你应该自己构建吗?还是使用一个为你处理复杂性的平台更好?

自建多云与跨区域推理

工程团队可以使用 vLLM、Kubernetes、Terraform 和全局负载均衡器等工具拼出自己的解决方案。这提供了最大的灵活性和控制力,但也带来了挑战:

  • 模型分发: 你需要跨区域或跨提供商一致地复制 LLM。
  • 路由逻辑: 请求需要路由到 GPU 最可用且最经济划算的区域或云。这可能需要实时容量检查,并在某个区域饱和时重新路由。
  • 监控与可观测性: 团队必须能够以统一的方式跨所有区域和提供商追踪性能、延迟和成本。
  • 运维开销: 管理故障切换、扩展、合规和网络是一项持续的负担。

对于拥有深厚基础设施专业知识且需要严格定制的团队来说,这条路是合理的。

第三方推理平台

推理平台和托管服务可以抽象掉大部分这种复杂性。它们提供:

  • 开箱即用的全局负载均衡
  • 跨区域的自动化模型复制
  • 带按区域指标的统一可观测性
  • 内置故障切换的简化扩展

这条路缩短了上市时间并降低了运维开销,但你应该仔细评估:

  • 路由与传输成本: token 定价是否在各区域间一致,以及适用哪些数据传输费用。
  • 额外延迟: 跨区域重新路由期间会引入多少延迟。
  • 区域与提供商灵活性: 选择最符合你需求的区域或提供商的能力。
  • 故障切换成本: 与跨区域故障切换相关的额外成本,如管理、数据传输和网络使用。