AI Hypercomputer 的使用选项

AI Hypercomputer 提供了多种使用选项来获取计算资源。这些选项可满足工作负载时长、容错能力和基础架构模型等需求。了解这些选项,然后选择最适合您的使用场景的选项。

使用选项概览

如需按主要特征比较使用选项,请使用下表:

使用选项 预配模型 适用场景 容量保证 生命周期 抢占式 Quota 折扣 分配模型
灵活启动 灵活启动 持续时间不超过 7 天且可以等待容量的短期工作负载。 尽力而为 最长 7 天 抢占式配额 支持的系列可享受折扣(最高 53%) 对于 MIG 规模调整请求,为密集型;对于独立虚拟机,为尽力而为型。
Spot 虚拟机 Spot 容错型、短期通用 GPU 工作负载。 尽力而为 抢占式 抢占式配额 可享受大幅折扣(最高 91%) 标准版
标准预留 标准版 需要非常高的容量保证的关键通用 GPU 工作负载。 很高 很高 用户定义 不消耗配额 承诺使用折扣 (CUD) 提供的折扣价
容量块的未来预留 受预留约束 在集群 GPU 上进行大规模、长时间运行的训练。 很高 在预留期内无限制。 自动增加 使用 CUD 可享受折扣(最高 53%) 密集
日历模式下的未来预留 受预留约束 需要预留容量的集群 GPU 工作负载,最长 90 天。 很高 最长 90 天 不消耗配额 可享受折扣(最高 53%) 密集
按需虚拟机 标准版 没有特定时长的通用 GPU 工作负载。 尽力而为 无限制 按需配额 无(随用随付) 标准版

您用于部署基础架构的使用选项取决于您使用的是通用 GPU 还是集群 GPU。

  • 通用 GPU:专为小规模 推理、开发和小规模训练工作负载而设计。此类 GPU 通过异步维护提供运营灵活性。如需查看可用选项,请参阅通用 GPU 的使用选项

  • 集群 GPU:专为大规模、 紧密耦合的训练工作负载以及大规模推理、强化学习和 推理模型工作负载而设计,这些工作负载需要高容量保证和密集 资源分配,以最大限度地减少网络延迟。如需查看可用 选项,请参阅集群 GPU 的 使用选项

通用 GPU 的使用选项

使用以下使用选项获取通用 GPU 的容量。

使用灵活启动

如需运行需要密集分配资源的短期工作负载,您可以使用灵活启动请求最长 7 天的计算资源 。只要有可用资源, Compute Engine 就会创建您请求数量的虚拟机。您可以停止独立的 灵活启动虚拟机,但无法停止托管式实例 组 (MIG) 通过规模调整请求创建的灵活启动虚拟机。灵活启动虚拟机会一直存在,直到您 将其删除,或者直到 Compute Engine 在虚拟机的运行时长结束时将其删除。

理想工作负载

  • 小型模型预训练
  • 模型微调
  • 高性能计算 (HPC) 模拟
  • 批量推理

主要特征:

  • 预配模型:灵活启动。
  • 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
  • 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度地减少网络延迟。
  • 经济高效:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的系列需按标准按需费率付费。 如需了解详情,请参阅灵活启动价格

使用 Spot

如需运行容错型工作负载,您可以根据 可用性立即获取计算资源。您可以以尽可能低的价格获取资源。但是,Compute Engine 可能会随时抢占虚拟机来收回容量。

理想工作负载

  • 批处理和数据分析
  • 高性能计算 (HPC) 和媒体编码

主要特征:

  • 预配模型:Spot。
  • 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
  • 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度地减少网络延迟。
  • 经济高效:vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 91% 的折扣。

按需使用

提示:如需提高获得通用 GPU 容量的几率,请使用灵活启动或 Spot。与按需价格相比,这些 使用选项提供的 GPU 价格更低,旨在帮助您提高获得 GPU 等高需求资源的几率。

如需运行没有特定时长的通用 GPU 工作负载,您可以根据可用性立即获取计算资源。虚拟机会一直运行,直到被您停止或删除。

理想工作负载

  • 推理和模型部署
  • 原型设计和实验

主要特征:

  • 预配模型:标准。
  • 立即可用:立即创建虚拟机实例,无需等待 容量调度或审批。
  • 标准价格:按标准按需费率支付资源费用,无需 长期承诺。
  • 广泛的硬件支持:与 通用 GPU 路径中的任何受支持的 GPU 机器系列搭配使用。

使用标准预留

如需运行需要非常高的 容量保证的关键通用 GPU 工作负载,您可以使用标准预留。

理想工作负载

  • 关键生产工作负载
  • 需要保证容量的工作负载

主要特征:

  • 预配模型:标准。
  • 容量保证:提供非常高的资源可用性保证。
  • 价格:按标准费率付费,但您可以附加 CUD 以节省费用。

集群 GPU 的使用选项

使用以下使用选项获取集群 GPU 的容量。

使用容量块的未来预留

如需运行需要密集分配资源的长时间运行的大规模分布式工作负载, 您可以申请在未来特定时间使用计算资源。在该时间段内,您可以独占使用 预留的资源,并且可以使用这些资源创建虚拟机或 集群。在预留期结束时,Compute Engine 会执行以下操作:

  • Compute Engine 会删除预留。
  • 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。

理想工作负载

  • 预训练基础模型
  • 跨多个主机的基础模型推理

主要特征:

  • 预配模型:受预留约束。
  • 高级机器支持:预留 A4X Max、A4X、A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
  • 承诺要求:对于预留期为一年或更长时间的预留,附加基于资源的承诺。
  • 动态修改:在预留期开始后,为 Vertex AI 作业启用硬件紧急维护通知 。

在日历模式下使用未来预留

如需运行需要密集分配资源的短期分布式工作负载,您可以 申请最长 90 天的计算资源。在该时间段内,您可以独占使用预留的资源 ,并且可以使用这些资源创建虚拟机或集群。在 预留期结束时,Compute Engine 会执行以下操作:

  • Compute Engine 会删除预留。
  • 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。

理想工作负载

  • 预训练和微调
  • 大规模模拟和推理

主要特征:

  • 预配模型:受预留约束。
  • 机器系列支持:预留 A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU) 机器类型。
  • 扩缩限制:最多预留 80 个虚拟机,最长 90 天。
  • 优化预配:使用受预留约束的模型来提高获得 GPU 的 几率。

使用灵活启动

当您需要 最长 7 天的密集分配资源时,请对集群代管式实例组 (MIG) 规模调整请求使用灵活启动。

理想工作负载

灵活启动虚拟机非常适合运行可以随时启动的工作负载,例如:

  • 小型模型预训练
  • 模型微调
  • 高性能计算 (HPC) 模拟
  • 批量推理

主要特征:

  • 预配模型:灵活启动。
  • 资源分配:对于 MIG 规模调整请求,为密集分配。
  • 经济高效:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的系列需按标准按需费率付费。

使用 Spot

您可以将 Spot 虚拟机用于密集分配的容错型工作负载,以享受大幅折扣, 但需要了解 Compute Engine 可能会抢占虚拟机来收回容量。

理想工作负载

  • 容错型分布式训练
  • 批处理

主要特征:

  • 预配模型:Spot。
  • 抢占:Compute Engine 可能会随时抢占实例。
  • 经济高效:vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 91% 的折扣

后续步骤