跳到主要内容

Bring Your Own Cloud(BYOC)

企业 AI 团队面临一个挑战:如何在不失去对数据、基础设施或成本的控制的情况下快速扩展 LLM 工作负载。

大多数组织从 SaaS 推理平台开始,因为它们设置快速且完全托管。然而,随着工作负载的增长,这些平台可能变得昂贵且受限。

  • 你的数据会离开你的虚拟私有云(VPC)
  • 你永远不会真正知道你在为 GPU 时间支付什么
  • 合规检查更难通过

这就是 Bring Your Own Cloud(BYOC)发挥作用的地方。

什么是 Bring Your Own Cloud(BYOC)?

Bring Your Own Cloud(BYOC)是一种部署模型,让你在自己的云账户内直接运行供应商的软件,如 LLM 推理平台。你获得托管编排的便利,同时让计算、数据和网络完全由你掌控。

这种模式对现代 AI 基础设施来说变得尤为重要。一方面,AI 模型和工具演化如此之快,以至于在内部构建和维护推理栈的每个部分会拖慢创新和上市时间。另一方面,你仍然希望掌控工作负载在何处以及如何运行,尤其是当它们处理敏感数据时。

BYOC 弥合了这一差距。它让组织在享受供应商管理的编排的同时,保持对数据、安全和运营的控制。换句话说,你可以快速前进,而不必放弃合规性或主权。

一个简单的理解方式:

  • SaaS:供应商运行一切。
  • 本地部署(On-prem):你运行一切。
  • BYOC:供应商在你的云中、在你的规则下运行软件。

BYOC 最初是对数据敏感的企业的利基选项。现在,它成为大规模 LLM 和 AI 工作负载的主流部署模式。

BYOC 是如何工作的?

在 BYOC 部署中,你和供应商分担责任。供应商管理控制平面,而数据平面组件完全留在你的云环境中。作为客户,你负责管理自己的云资源(尽管某些任务可能会交给供应商)、IAM 权限和网络配置,以确保安全性和可靠性。理想情况下,供应商永远无法直接访问你的原始数据或私有网络。

以下是它的典型工作方式:

  1. 控制平面(供应商管理):处理部署协调、扩展策略、调度、更新等。它通过安全 API 与你的环境通信。
  2. 数据平面(客户管理):这是推理发生的地方。你的模型、GPU、计算实例和数据都位于你自己的 VPC 内,确保合规性、隐私和完全隔离。
  3. 网络和 IAM 边界:BYOC 依赖严格的权限范围。供应商可以以编程方式管理部署(例如,通过 IAM 角色或跨账户访问),但无法查看或窃取数据。日志(供应商可能为了调试目的而有权访问)、指标和模型输出都留在你的环境内。
Bring-your-own-cloud:供应商管理的控制平面与客户 VPC 数据平面

这种混合设计提供了两全其美的方案:

  • 托管平台处理编排和更新的便利性。
  • 你的 LLM 工作负载、数据和 GPU 始终处于你控制之下的保障。
备注

BYOC 的实现方式可能因组织需求而异。例如,在国防或医疗等行业,团队可能要求对控制平面和数据平面都拥有完全控制。这通常可以在完全隔离或物理断网(air-gapped)的环境中确保最大的安全性和合规保证。

现代推理系统,如基于 vLLM、SGLang 或 MAX 构建的系统,天然契合这种模式。它们在你现有的云基础设施上运行,同时无缝连接到集中的控制平面。

BYOC 对 LLM 工作负载的好处

BYOC 的吸引力远不止合规性。以下是关键好处:

数据主权与合规性

LLM 被广泛采用于 RAG 或 AI 代理等企业系统。这些应用通常需要访问不能离开私有网络的敏感信息(如客户记录)。

使用 BYOC,所有模型输入、输出和日志都留在你自己的 VPC 和云区域内。除非你选择共享,否则你的环境内不会流失任何东西。这使得满足 GDPR 等监管要求以及通过内部安全审查变得容易得多。

对于金融、医疗或公共部门组织来说,这种级别的控制是必须的。

GPU 灵活性与可用性

LLM 推理严重依赖 GPU,而供应量通常在不同区域和提供商之间波动。许多供应商支持 BYOC 的多云架构。它们让你选择在何处运行工作负载,无论是在 AWS、GCP、Azure,还是三者的组合。

这意味着你可以:

  • 选择对你的工作负载而言 GPU 可用性和定价最佳的云提供商。
  • 利用特定区域的定价或促销。
  • 组合不同的 GPU 类型(如 NVIDIA A100、H100 或 AMD MI300X),以匹配成本和性能需求。

这种灵活性确保你永远不会被困在等待容量,或为算力支付过高的费用。

成本优化与效率

使用 BYOC,你在与数据相同的环境中运行推理,减少了跨云数据传输产生的昂贵出口费用。对于处理大型数据集的团队来说,仅此一项就能带来巨大的成本节省。

它还能帮助你充分利用现有的云投资:

  • 直接在账户中使用云积分或初创计划。
  • 将承诺使用折扣、节省计划或竞价定价应用于推理工作负载。
  • 跨工作负载汇总支出,从你的提供商那里解锁企业级折扣。

例如,Modular Cloud BYOC 直接在你的账户中提供计算资源,因此你可以使用已有的积分、折扣和计费关系来部署模型。

无供应商锁定

BYOC 让你的基础设施保持云中立。你不再被绑定到单一云提供商的技术栈或硬件。这意味着你的 LLM 部署策略可以面向未来。随着需求的变化,你可以自由地在云、GPU 或编排工具之间移动工作负载。

SaaS 与 BYOC 与本地部署

选择如何部署 LLM 本质上就是选择你的模型驻留在哪里,以及谁来运行基础设施。每种部署模式——SaaS、BYOC 或本地部署——都在控制、成本和复杂性之间提供不同的权衡。

以下是一个快速对比:

模式运行位置谁管理基础设施数据控制最适合
SaaS供应商的云供应商低:数据驻留在供应商的多租户环境中快速设置、运维开销最小、快速原型开发、非敏感数据
BYOC客户的云账户(如 AWS、GCP、Azure)供应商与客户分担高:数据留在客户的 VPC 中有安全/合规需求的企业、GPU 成本优化、灵活扩展
本地部署客户的私有数据中心客户完全:数据和计算完全留在客户基础设施上物理断网或高度受监管的行业(如国防、医疗)

对于大多数企业 LLM 工作负载,BYOC 提供了最佳的中庸之道。它部署快速、设计上安全,并且在大规模下成本高效。


我们提供功能完备的 AI 推理平台,可以部署到你自己的云账户中,以获得最大的控制权、安全性和定制化。

通过我们的 BYOC 部署,你可以:

  • 在 AWS、GCP 或 Azure 等提供商的自己的 VPC 内运行模型,并利用你现有的积分和承诺
  • 将数据和工作负载完全保留在你的环境中
  • 在同一个 BYOC 部署中,跨 NVIDIA、AMD、CPU 等运行和扩展推理
  • 在你的私有云中应用最新的分布式推理技术,如预填充-解码分离

常见问题

BYOC 可以与多云部署配合使用吗?

可以。BYOC 天然契合多云架构。根据你的安全和合规政策,敏感工作负载可以留在一个云中,而全球推理流量则扩展到其他云。

BYOC 与 SaaS 有何不同?

在 SaaS 中,供应商在自己的环境中托管和管理一切。在 BYOC 中,供应商管理控制平面,而数据平面在你的云中运行。你保留对计算、存储和网络资源的所有权。

BYOC 有哪些权衡?

你获得更多的主权和灵活性,但也承担了部分运维负担,即管理你自己的云环境、IAM 角色和监控。许多团队通过使用托管的 BYOC 解决方案来抵消这一点。