AI Hypercomputer 的使用选项

AI Hypercomputer 提供了多种使用选项,用于获取计算资源。这些选项可满足工作负载时长、容错能力和基础设施模型等需求。了解这些选项,并选择最适合您应用场景的选项。

除了手动评估之外,您还可以在Google Cloud 控制台中提示 Gemini 比较工作负载和预算的消费选项。如需了解详情,请参阅使用 Gemini 设计 AI 基础架构

使用选项概览

如需比较各种消费选项的主要特征,请使用下表:

使用选项 预配模型 适用场景 容量保证 生命周期 抢占式 配额 折扣 分配模型
灵活启动 灵活启动 持续时间不超过 7 天且可以等待容量的短时工作负载。 尽力而为 最长 7 天 抢占式配额 支持的系列可享受折扣(最高 53%) 对于 MIG 调整大小请求,为密集型;对于独立虚拟机,为尽力型。
Spot 虚拟机 Spot 容错性强、持续时间较短的一般 GPU 工作负载。 尽力而为 抢占式 抢占式配额 可享受大幅折扣(最高可达 91%) 标准
标准预订型广告 标准 需要极高容量保证的关键通用 GPU 工作负载。 很高 很高 用户定义 未消耗配额 承诺使用折扣 (CUD) 的折扣价
容量块的未来预留 受预留约束 在集群 GPU 上进行大规模、长时间运行的训练。 很高 在预留期内不限次数。 自动增加 可享受折扣(最高 53%),但需购买 CUD 密集
日历模式下的未来预留 受预留约束 需要预留容量的集群 GPU 工作负载,最长可达 90 天。 很高 最长 90 天 未消耗配额 可享受折扣(最高 53%) 密集
按需虚拟机 标准 没有特定时长的常规 GPU 工作负载。 尽力而为 无限制 按需配额 无(随用随付) 标准

您用于部署基础架构的消费选项取决于您使用的是通用 GPU 还是集群 GPU。

  • 通用 GPU:专为小规模推理、开发和较小规模的训练工作负载而设计。这类 GPU 通过异步维护提供操作灵活性。如需查看可用选项,请参阅通用 GPU 的使用选项

  • 集群 GPU:专为大规模、紧密耦合的训练工作负载以及大规模推理、强化学习和推理模型工作负载而设计,这些工作负载需要高容量保证和密集资源分配,以最大限度减少网络延迟。如需查看可用选项,请参阅集群 GPU 的使用选项

常规 GPU 的使用选项

使用以下消费选项获取通用 GPU 的容量。

使用灵活启动

如需运行需要密集分配资源的短时工作负载,您可以使用灵活启动请求最多七天的计算资源。只要资源可用,Compute Engine 就会创建您请求数量的虚拟机。您可以停止独立的灵活启动虚拟机,但无法停止托管式实例组 (MIG) 通过规模调整请求创建的灵活启动虚拟机。灵活启动虚拟机会一直存在,直到您将其删除,或者直到 Compute Engine 在虚拟机的运行时长结束时将其删除。

理想工作负载

  • 小型模型预训练
  • 模型微调
  • 高性能计算 (HPC) 模拟
  • 批量推理

主要特征:

  • 预配模型:灵活启动。
  • 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
  • 延迟时间优化:将紧凑布置政策应用于独立虚拟机,以尽可能缩短网络延迟时间。
  • 经济实惠:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和本地 SSD 磁盘可享受高达 53% 的折扣。其他受支持的系列需按标准的按需费率付费。如需了解详情,请参阅灵活启动价格

使用 Spot

如需运行容错工作负载,您可以根据可用性立即获取计算资源。您可以尽可能以最低的价格获取资源。不过,Compute Engine 可能会随时抢占虚拟机来回收容量。

理想工作负载

  • 批处理和数据分析
  • 高性能计算 (HPC) 和媒体编码

主要特征:

  • 配置模型:Spot。
  • 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
  • 延迟时间优化:将紧凑布置政策应用于独立虚拟机,以尽可能缩短网络延迟时间。
  • 经济高效:vCPU、内存、GPU 和本地 SSD 磁盘均可享受高达 91% 的折扣。

按需使用

提示:如需提高获得通用 GPU 容量的几率,请使用灵活启动或 Spot。与按需价格相比,这些消费选项以折扣价提供 GPU,旨在帮助您提高获得 GPU 等高需求资源的几率。

如需运行没有特定时长的作业,您可以根据可用性立即获取计算资源。虚拟机会一直运行,直到您停止或删除它们。

理想工作负载

  • 推理和模型部署
  • 原型设计和实验

主要特征:

  • 配置模型:标准。
  • 立即可用:立即创建虚拟机实例,无需等待容量调度或审批。
  • 标准价格:按标准按需费率支付资源费用,无需签订长期合同。
  • 广泛的硬件支持:在常规 GPU 路径中,可与任何受支持的 GPU 机器系列搭配使用。

使用标准预留

如需运行关键的一般 GPU 工作负载,并且需要非常高的容量保证级别,您可以使用标准预留。

理想工作负载

  • 关键生产工作负载
  • 需要保证容量的工作负载

主要特征:

  • 配置模型:标准。
  • 容量保障:可确保资源可用性。
  • 价格:按标准费率收费,但您可以附加 CUD 以节省费用。

集群 GPU 的使用选项

您可以使用以下使用选项来获取集群 GPU 的容量。

使用容量块的未来预留

如需运行需要密集分配资源的长时间运行的大规模分布式工作负载,您可以申请未来特定时间的计算资源。在该时间段内,您对预留的资源拥有独占访问权限,并且可以使用这些资源来创建虚拟机或集群。在预留期结束时,Compute Engine 会执行以下操作:

  • Compute Engine 会删除预留。
  • 根据您为虚拟机指定的终止操作,Compute Engine 会停止或删除任何使用该预留的虚拟机。

理想工作负载

  • 预训练基础模型
  • 跨多个主机对基础模型进行推理

主要特征:

  • 配置模型:受预留约束。
  • 高级机器支持:预留 A4X Max、A4X、A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
  • 承诺要求:对于一年或更长时间的预留,请附加基于资源的承诺。
  • 动态修改:在周期开始后,为 Vertex AI 作业使用情况启用硬件紧急维护通知。

在日历模式下使用未来预留

如需运行需要密集分配资源的短时分布式工作负载,您可以请求最长 90 天的计算资源。在该时间段内,您对预留的资源拥有独占访问权限,并且可以使用这些资源来创建虚拟机或集群。在预留期结束时,Compute Engine 会执行以下操作:

  • Compute Engine 会删除预留。
  • 根据您为虚拟机指定的终止操作,Compute Engine 会停止或删除任何使用该预留的虚拟机。

理想工作负载

  • 预训练和微调
  • 大规模模拟和推理

主要特征:

  • 配置模型:受预留约束。
  • 支持的机器系列:预留 A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
  • 可伸缩性限制:最多可预留 80 个虚拟机,预留时长最长为 90 天。
  • 优化配置:使用与预留绑定的模型来提高您获得 GPU 的几率。

使用灵活启动

如果您需要密集分配的资源,且使用时间不超过 7 天,请针对集群式代管式实例组 (MIG) 规模调整请求使用灵活启动。

理想工作负载

灵活启动虚拟机非常适合运行可以随时启动的工作负载,例如:

  • 小型模型预训练
  • 模型微调
  • 高性能计算 (HPC) 模拟
  • 批量推理

主要特征:

  • 预配模型:灵活启动。
  • 资源分配:针对 MIG 规模调整请求进行密集分配。
  • 经济实惠:对于 A4、A3、A2 和 G4 机器系列,您可以获得高达 53% 的 vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘折扣。其他受支持的机器系列需按标准的按需费率付费。

使用 Spot

您可以将 Spot 虚拟机用于密集分配的容错型工作负载,以获得大幅折扣,但需要了解 Compute Engine 可以抢占虚拟机来收回容量。

理想工作负载

  • 容错分布式训练
  • 批处理

主要特征:

  • 配置模型:Spot。
  • 抢占:Compute Engine 可以随时抢占实例。
  • 经济高效:vCPU、内存、GPU 和任何连接的本地 SSD 磁盘均可享受最高 91% 的折扣

后续步骤