AI Hypercomputer 提供了多种使用选项,用于获取计算资源。这些选项可满足工作负载时长、容错能力和基础设施模型等需求。了解这些选项,并选择最适合您应用场景的选项。
除了手动评估之外,您还可以在Google Cloud 控制台中提示 Gemini 比较工作负载和预算的消费选项。如需了解详情,请参阅使用 Gemini 设计 AI 基础架构。
使用选项概览
如需比较各种消费选项的主要特征,请使用下表:
| 使用选项 | 预配模型 | 适用场景 | 容量保证 | 生命周期 | 抢占式 | 配额 | 折扣 | 分配模型 |
|---|---|---|---|---|---|---|---|---|
| 灵活启动 | 灵活启动 | 持续时间不超过 7 天且可以等待容量的短时工作负载。 | 尽力而为 | 最长 7 天 | 否 | 抢占式配额 | 支持的系列可享受折扣(最高 53%) | 对于 MIG 调整大小请求,为密集型;对于独立虚拟机,为尽力型。 |
| Spot 虚拟机 | Spot | 容错性强、持续时间较短的一般 GPU 工作负载。 | 尽力而为 | 抢占式 | 是 | 抢占式配额 | 可享受大幅折扣(最高可达 91%) | 标准 |
| 标准预订型广告 | 标准 | 需要极高容量保证的关键通用 GPU 工作负载。 | 很高 | 很高 | 用户定义 | 否 | 未消耗配额 | 承诺使用折扣 (CUD) 的折扣价 |
| 容量块的未来预留 | 受预留约束 | 在集群 GPU 上进行大规模、长时间运行的训练。 | 很高 | 在预留期内不限次数。 | 否 | 自动增加 | 可享受折扣(最高 53%),但需购买 CUD | 密集 |
| 日历模式下的未来预留 | 受预留约束 | 需要预留容量的集群 GPU 工作负载,最长可达 90 天。 | 很高 | 最长 90 天 | 否 | 未消耗配额 | 可享受折扣(最高 53%) | 密集 |
| 按需虚拟机 | 标准 | 没有特定时长的常规 GPU 工作负载。 | 尽力而为 | 无限制 | 否 | 按需配额 | 无(随用随付) | 标准 |
您用于部署基础架构的消费选项取决于您使用的是通用 GPU 还是集群 GPU。
通用 GPU:专为小规模推理、开发和较小规模的训练工作负载而设计。这类 GPU 通过异步维护提供操作灵活性。如需查看可用选项,请参阅通用 GPU 的使用选项。
集群 GPU:专为大规模、紧密耦合的训练工作负载以及大规模推理、强化学习和推理模型工作负载而设计,这些工作负载需要高容量保证和密集资源分配,以最大限度减少网络延迟。如需查看可用选项,请参阅集群 GPU 的使用选项。
常规 GPU 的使用选项
使用以下消费选项获取通用 GPU 的容量。
使用灵活启动
如需运行需要密集分配资源的短时工作负载,您可以使用灵活启动请求最多七天的计算资源。只要资源可用,Compute Engine 就会创建您请求数量的虚拟机。您可以停止独立的灵活启动虚拟机,但无法停止托管式实例组 (MIG) 通过规模调整请求创建的灵活启动虚拟机。灵活启动虚拟机会一直存在,直到您将其删除,或者直到 Compute Engine 在虚拟机的运行时长结束时将其删除。
理想工作负载
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 预配模型:灵活启动。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟时间优化:将紧凑布置政策应用于独立虚拟机,以尽可能缩短网络延迟时间。
- 经济实惠:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和本地 SSD 磁盘可享受高达 53% 的折扣。其他受支持的系列需按标准的按需费率付费。如需了解详情,请参阅灵活启动价格。
使用 Spot
如需运行容错工作负载,您可以根据可用性立即获取计算资源。您可以尽可能以最低的价格获取资源。不过,Compute Engine 可能会随时抢占虚拟机来回收容量。
理想工作负载
- 批处理和数据分析
- 高性能计算 (HPC) 和媒体编码
主要特征:
- 配置模型:Spot。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟时间优化:将紧凑布置政策应用于独立虚拟机,以尽可能缩短网络延迟时间。
- 经济高效:vCPU、内存、GPU 和本地 SSD 磁盘均可享受高达 91% 的折扣。
按需使用
提示:如需提高获得通用 GPU 容量的几率,请使用灵活启动或 Spot。与按需价格相比,这些消费选项以折扣价提供 GPU,旨在帮助您提高获得 GPU 等高需求资源的几率。
如需运行没有特定时长的作业,您可以根据可用性立即获取计算资源。虚拟机会一直运行,直到您停止或删除它们。
理想工作负载
- 推理和模型部署
- 原型设计和实验
主要特征:
- 配置模型:标准。
- 立即可用:立即创建虚拟机实例,无需等待容量调度或审批。
- 标准价格:按标准按需费率支付资源费用,无需签订长期合同。
- 广泛的硬件支持:在常规 GPU 路径中,可与任何受支持的 GPU 机器系列搭配使用。
使用标准预留
如需运行关键的一般 GPU 工作负载,并且需要非常高的容量保证级别,您可以使用标准预留。
理想工作负载
- 关键生产工作负载
- 需要保证容量的工作负载
主要特征:
- 配置模型:标准。
- 容量保障:可确保资源可用性。
- 价格:按标准费率收费,但您可以附加 CUD 以节省费用。
集群 GPU 的使用选项
您可以使用以下使用选项来获取集群 GPU 的容量。使用容量块的未来预留
如需运行需要密集分配资源的长时间运行的大规模分布式工作负载,您可以申请未来特定时间的计算资源。在该时间段内,您对预留的资源拥有独占访问权限,并且可以使用这些资源来创建虚拟机或集群。在预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的终止操作,Compute Engine 会停止或删除任何使用该预留的虚拟机。
理想工作负载
- 预训练基础模型
- 跨多个主机对基础模型进行推理
主要特征:
- 配置模型:受预留约束。
- 高级机器支持:预留 A4X Max、A4X、A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
- 承诺要求:对于一年或更长时间的预留,请附加基于资源的承诺。
- 动态修改:在周期开始后,为 Vertex AI 作业使用情况启用硬件紧急维护通知。
在日历模式下使用未来预留
如需运行需要密集分配资源的短时分布式工作负载,您可以请求最长 90 天的计算资源。在该时间段内,您对预留的资源拥有独占访问权限,并且可以使用这些资源来创建虚拟机或集群。在预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的终止操作,Compute Engine 会停止或删除任何使用该预留的虚拟机。
理想工作负载
- 预训练和微调
- 大规模模拟和推理
主要特征:
- 配置模型:受预留约束。
- 支持的机器系列:预留 A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
- 可伸缩性限制:最多可预留 80 个虚拟机,预留时长最长为 90 天。
- 优化配置:使用与预留绑定的模型来提高您获得 GPU 的几率。
使用灵活启动
如果您需要密集分配的资源,且使用时间不超过 7 天,请针对集群式代管式实例组 (MIG) 规模调整请求使用灵活启动。
理想工作负载
灵活启动虚拟机非常适合运行可以随时启动的工作负载,例如:
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 预配模型:灵活启动。
- 资源分配:针对 MIG 规模调整请求进行密集分配。
- 经济实惠:对于 A4、A3、A2 和 G4 机器系列,您可以获得高达 53% 的 vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘折扣。其他受支持的机器系列需按标准的按需费率付费。
使用 Spot
您可以将 Spot 虚拟机用于密集分配的容错型工作负载,以获得大幅折扣,但需要了解 Compute Engine 可以抢占虚拟机来收回容量。
理想工作负载
- 容错分布式训练
- 批处理
主要特征:
- 配置模型:Spot。
- 抢占:Compute Engine 可以随时抢占实例。
- 经济高效:vCPU、内存、GPU 和任何连接的本地 SSD 磁盘均可享受最高 91% 的折扣
后续步骤
- 如需确定工作负载需求,请参阅确定工作负载需求。
- 如需创建和使用预留,请参阅创建和使用预留。
- 如需详细了解 Spot 虚拟机,请参阅详细了解 Spot 虚拟机。
- 如需创建按需虚拟机实例,请参阅创建按需虚拟机实例。