AI Hypercomputer 提供了多种使用选项来获取计算资源。这些选项可满足工作负载时长、容错能力和基础架构模型等需求。了解这些选项,然后选择最适合您的使用场景的选项。
除了手动评估之外,您还可以在 Google Cloud 控制台中提示 Gemini,以比较工作负载和预算的使用选项。 如需了解详情,请参阅 使用 Compute Advisor 设计 AI 基础架构。
使用选项概览
如需比较关键特征的使用选项,请使用下表:
| 使用选项 | 配置模型 | 适用场景 | 容量保证 | 生命周期 | 抢占式 | Quota | 折扣 | 分配模型 |
|---|---|---|---|---|---|---|---|---|
| 灵活启动 | 灵活启动 | 持续时间不超过 7 天且可以等待容量的短期工作负载。 | 尽力而为 | 最长 7 天 | 否 | 抢占式配额 | 支持的系列可享受折扣(最高 53%) | 对于 MIG 规模调整请求,采用密集分配;对于独立虚拟机,采用尽力而为分配。 |
| Spot 虚拟机 | Spot | 容错型、短期通用 GPU 工作负载。 | 尽力而为 | 抢占式 | 是 | 抢占式配额 | 可享受大幅折扣(最高 91%) | 标准版 |
| 标准预留 | 标准版 | 需要非常高的容量保证的关键通用 GPU 工作负载。 | 很高 | 很高 | 用户定义 | 否 | 不消耗配额 | 承诺使用折扣 (CUD) 的折扣价 |
| 容量块的未来预留 | 受预留约束 | 在集群 GPU 上进行大规模、长时间运行的训练。 | 很高 | 在预留期内无限制。 | 否 | 自动增加 | 使用 CUD 可享受折扣(最高 53%) | 密集 |
| 日历模式下的未来预留 | 受预留约束 | 需要预留容量的集群 GPU 工作负载,最长 90 天。 | 很高 | 最长 90 天 | 否 | 不消耗配额 | 可享受折扣(最高 53%) | 密集 |
| 按需虚拟机 | 标准版 | 没有特定时长的通用 GPU 工作负载。 | 尽力而为 | 无限制 | 否 | 按需配额 | 无(随用随付) | 标准版 |
用于部署基础架构的使用选项取决于您使用的是通用 GPU 还是集群 GPU。
通用 GPU:专为小规模 推理、开发和较小规模的训练工作负载而设计。此类 GPU 通过异步维护提供运营灵活性。如需查看可用选项,请参阅通用 GPU 的使用选项。
集群 GPU:专为大规模、 紧密耦合的训练工作负载以及需要高容量保证和密集 资源分配以最大限度减少网络延迟的大规模推理、强化学习和 推理模型工作负载而设计。如需查看可用 选项,请参阅集群 GPU 的 使用选项。
通用 GPU 的使用选项
使用以下使用选项获取通用 GPU 的容量。
使用灵活启动
如需运行需要密集分配资源的短期工作负载,您可以使用灵活启动请求最长 7 天的计算资源 。只要有可用资源, Compute Engine 就会创建您请求数量的虚拟机。您可以停止独立的 灵活启动虚拟机,但无法停止托管式实例 组 (MIG) 通过规模调整请求创建的灵活启动虚拟机。灵活启动虚拟机会一直存在,直到您 将其删除,或者直到 Compute Engine 在虚拟机的运行时长结束时将其删除。
理想工作负载
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 配置模型:灵活启动。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度减少网络延迟。
- 成本效益:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的系列需按标准按需费率付费。 如需了解详情,请参阅灵活启动价格。
使用 Spot
如需运行容错型工作负载,您可以根据 可用性立即获取计算资源。您可以以尽可能低的价格获取资源。但是,Compute Engine 可能会随时抢占虚拟机来收回容量。
理想工作负载
- 批处理和数据分析
- 高性能计算 (HPC) 和媒体编码
主要特征:
- 配置模型:Spot。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度减少网络延迟。
- 成本效益:vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 91% 的折扣。
按需使用
提示:如需提高获得通用 GPU 容量的几率,请使用灵活启动或 Spot。与按需价格相比,这些 使用选项以折扣价提供 GPU,旨在帮助您提高获得 GPU 等高需求资源的几率。
如需运行没有特定时长的通用 GPU 工作负载,您可以根据可用性立即获取计算资源。虚拟机将一直运行,直到被您停止或删除。
理想工作负载
- 推理和模型部署
- 原型设计和实验
主要特征:
- 配置模型:标准。
- 立即可用:立即创建虚拟机实例,无需等待 容量调度或审批。
- 标准价格:按标准按需费率支付资源费用,无需 长期承诺。
- 广泛的硬件支持:与 通用 GPU 路径中的任何受支持的 GPU 机器系列搭配使用。
使用标准预留
如需运行需要非常高的 容量保证的关键通用 GPU 工作负载,您可以使用标准预留。
理想工作负载
- 关键生产工作负载
- 需要保证容量的工作负载
主要特征:
- 配置模型:标准。
- 容量保证:提供非常高的资源可用性保证。
- 价格:按标准费率付费,但您可以附加 CUD 以节省费用。
集群 GPU 的使用选项
使用以下使用选项获取集群 GPU 的容量。容量块的未来预留
如需运行需要密集分配资源的长时间运行的大规模分布式工作负载, 您可以请求在未来的特定时间使用计算资源。在该时间段内,您可以独占访问 预留的资源,并且可以使用这些资源创建虚拟机或 集群。在预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。
理想工作负载
- 预训练基础模型
- 跨多个主机的基础模型推理
主要特征:
- 配置模型:受预留约束。
- 高级机器支持:预留 A4X Max、A4X、A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
- 承诺要求:对于预留期为一年或更长时间的预留,附加基于资源的承诺。
- 动态修改:为 Vertex AI 作业使用情况启用硬件紧急维护通知 ,在预留期开始后。
日历模式下的未来预留
如需运行需要密集分配资源的短期分布式工作负载,您可以 请求最长 90 天的计算资源。在该时间段内,您可以独占访问预留的资源 ,并且可以使用这些资源创建虚拟机或集群。在 预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。
理想工作负载
- 预训练和微调
- 大规模模拟和推理
主要特征:
- 配置模型:受预留约束。
- 机器系列支持:预留 A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU) 机器类型。
- 可伸缩性限制:最多预留 80 个虚拟机,最长 90 天。
- 优化配置:使用受预留约束的模型来提高获得 GPU 的几率。
使用灵活启动
当您需要 最长 7 天的密集分配资源时,请对集群代管式实例组 (MIG) 规模调整请求使用灵活启动。
理想工作负载
灵活启动虚拟机非常适合运行可以随时启动的工作负载,例如:
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 配置模型:灵活启动。
- 资源分配:对于 MIG 规模调整请求,采用密集分配。
- 成本效益:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的机器系列需按标准按需费率付费。
使用 Spot
您可以对密集分配的容错型工作负载使用 Spot 虚拟机,以享受大幅折扣, 但需要了解 Compute Engine 可能会抢占虚拟机来收回容量。
理想工作负载
- 容错型分布式训练
- 批处理
主要特征:
- 配置模型:Spot。
- 抢占:Compute Engine 可能会随时抢占实例。
- 成本效益:vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 91% 的折扣
后续步骤
- 如需查看启动集群时的流程和选择,请参阅 规划和创建 AI 基础架构。
- 如需创建和使用预留,请参阅创建和使用 预留。
- 如需详细了解 Spot 虚拟机,请参阅 详细了解 Spot 虚拟机。
- 如需创建按需虚拟机实例,请参阅创建按需虚拟机 实例。