AI Hypercomputer 提供了多种使用选项来获取计算资源。这些选项可满足工作负载时长、容错能力和基础架构模型等需求。了解这些选项,然后选择最适合您的使用场景的选项。
使用选项概览
如需按主要特征比较使用选项,请使用下表:
| 使用选项 | 预配模型 | 适用场景 | 容量保证 | 生命周期 | 抢占式 | Quota | 折扣 | 分配模型 |
|---|---|---|---|---|---|---|---|---|
| 灵活启动 | 灵活启动 | 持续时间不超过 7 天且可以等待容量的短期工作负载。 | 尽力而为 | 最长 7 天 | 否 | 抢占式配额 | 支持的系列可享受折扣(最高 53%) | 对于 MIG 规模调整请求,为密集型;对于独立虚拟机,为尽力而为型。 |
| Spot 虚拟机 | Spot | 容错型、短期通用 GPU 工作负载。 | 尽力而为 | 抢占式 | 是 | 抢占式配额 | 可享受大幅折扣(最高 91%) | 标准版 |
| 标准预留 | 标准版 | 需要非常高的容量保证的关键通用 GPU 工作负载。 | 很高 | 很高 | 用户定义 | 否 | 不消耗配额 | 承诺使用折扣 (CUD) 提供的折扣价 |
| 容量块的未来预留 | 受预留约束 | 在集群 GPU 上进行大规模、长时间运行的训练。 | 很高 | 在预留期内无限制。 | 否 | 自动增加 | 使用 CUD 可享受折扣(最高 53%) | 密集 |
| 日历模式下的未来预留 | 受预留约束 | 需要预留容量的集群 GPU 工作负载,最长 90 天。 | 很高 | 最长 90 天 | 否 | 不消耗配额 | 可享受折扣(最高 53%) | 密集 |
| 按需虚拟机 | 标准版 | 没有特定时长的通用 GPU 工作负载。 | 尽力而为 | 无限制 | 否 | 按需配额 | 无(随用随付) | 标准版 |
您用于部署基础架构的使用选项取决于您使用的是通用 GPU 还是集群 GPU。
通用 GPU:专为小规模 推理、开发和小规模训练工作负载而设计。此类 GPU 通过异步维护提供运营灵活性。如需查看可用选项,请参阅通用 GPU 的使用选项。
集群 GPU:专为大规模、 紧密耦合的训练工作负载以及大规模推理、强化学习和 推理模型工作负载而设计,这些工作负载需要高容量保证和密集 资源分配,以最大限度地减少网络延迟。如需查看可用 选项,请参阅集群 GPU 的 使用选项。
通用 GPU 的使用选项
使用以下使用选项获取通用 GPU 的容量。
使用灵活启动
如需运行需要密集分配资源的短期工作负载,您可以使用灵活启动请求最长 7 天的计算资源 。只要有可用资源, Compute Engine 就会创建您请求数量的虚拟机。您可以停止独立的 灵活启动虚拟机,但无法停止托管式实例 组 (MIG) 通过规模调整请求创建的灵活启动虚拟机。灵活启动虚拟机会一直存在,直到您 将其删除,或者直到 Compute Engine 在虚拟机的运行时长结束时将其删除。
理想工作负载
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 预配模型:灵活启动。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度地减少网络延迟。
- 经济高效:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的系列需按标准按需费率付费。 如需了解详情,请参阅灵活启动价格。
使用 Spot
如需运行容错型工作负载,您可以根据 可用性立即获取计算资源。您可以以尽可能低的价格获取资源。但是,Compute Engine 可能会随时抢占虚拟机来收回容量。
理想工作负载
- 批处理和数据分析
- 高性能计算 (HPC) 和媒体编码
主要特征:
- 预配模型:Spot。
- 广泛的硬件支持:请求任何集群 GPU 机器类型,但 A4X Max 和 A4X 除外。
- 延迟优化:将紧凑布置政策应用于独立虚拟机,以 最大限度地减少网络延迟。
- 经济高效:vCPU、内存、GPU 和本地 SSD 磁盘可享受最高 91% 的折扣。
按需使用
提示:如需提高获得通用 GPU 容量的几率,请使用灵活启动或 Spot。与按需价格相比,这些 使用选项提供的 GPU 价格更低,旨在帮助您提高获得 GPU 等高需求资源的几率。
如需运行没有特定时长的通用 GPU 工作负载,您可以根据可用性立即获取计算资源。虚拟机会一直运行,直到被您停止或删除。
理想工作负载
- 推理和模型部署
- 原型设计和实验
主要特征:
- 预配模型:标准。
- 立即可用:立即创建虚拟机实例,无需等待 容量调度或审批。
- 标准价格:按标准按需费率支付资源费用,无需 长期承诺。
- 广泛的硬件支持:与 通用 GPU 路径中的任何受支持的 GPU 机器系列搭配使用。
使用标准预留
如需运行需要非常高的 容量保证的关键通用 GPU 工作负载,您可以使用标准预留。
理想工作负载
- 关键生产工作负载
- 需要保证容量的工作负载
主要特征:
- 预配模型:标准。
- 容量保证:提供非常高的资源可用性保证。
- 价格:按标准费率付费,但您可以附加 CUD 以节省费用。
集群 GPU 的使用选项
使用以下使用选项获取集群 GPU 的容量。使用容量块的未来预留
如需运行需要密集分配资源的长时间运行的大规模分布式工作负载, 您可以申请在未来特定时间使用计算资源。在该时间段内,您可以独占使用 预留的资源,并且可以使用这些资源创建虚拟机或 集群。在预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。
理想工作负载
- 预训练基础模型
- 跨多个主机的基础模型推理
主要特征:
- 预配模型:受预留约束。
- 高级机器支持:预留 A4X Max、A4X、A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU)机器类型。
- 承诺要求:对于预留期为一年或更长时间的预留,附加基于资源的承诺。
- 动态修改:在预留期开始后,为 Vertex AI 作业启用硬件紧急维护通知 。
在日历模式下使用未来预留
如需运行需要密集分配资源的短期分布式工作负载,您可以 申请最长 90 天的计算资源。在该时间段内,您可以独占使用预留的资源 ,并且可以使用这些资源创建虚拟机或集群。在 预留期结束时,Compute Engine 会执行以下操作:
- Compute Engine 会删除预留。
- 根据您为虚拟机指定的 终止操作 ,Compute Engine 会停止或删除使用该 预留的所有虚拟机。
理想工作负载
- 预训练和微调
- 大规模模拟和推理
主要特征:
- 预配模型:受预留约束。
- 机器系列支持:预留 A4、A3 Ultra、A3 Mega 或 A3 High(8 个 GPU) 机器类型。
- 扩缩限制:最多预留 80 个虚拟机,最长 90 天。
- 优化预配:使用受预留约束的模型来提高获得 GPU 的 几率。
使用灵活启动
当您需要 最长 7 天的密集分配资源时,请对集群代管式实例组 (MIG) 规模调整请求使用灵活启动。
理想工作负载
灵活启动虚拟机非常适合运行可以随时启动的工作负载,例如:
- 小型模型预训练
- 模型微调
- 高性能计算 (HPC) 模拟
- 批量推理
主要特征:
- 预配模型:灵活启动。
- 资源分配:对于 MIG 规模调整请求,为密集分配。
- 经济高效:对于 A4、A3、A2 和 G4 机器系列,vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 53% 的折扣。其他受支持的系列需按标准按需费率付费。
使用 Spot
您可以将 Spot 虚拟机用于密集分配的容错型工作负载,以享受大幅折扣, 但需要了解 Compute Engine 可能会抢占虚拟机来收回容量。
理想工作负载
- 容错型分布式训练
- 批处理
主要特征:
- 预配模型:Spot。
- 抢占:Compute Engine 可能会随时抢占实例。
- 经济高效:vCPU、内存、GPU 和任何挂接的本地 SSD 磁盘可享受最高 91% 的折扣
后续步骤
- 如需确定工作负载需求,请参阅确定工作负载 需求。
- 如需创建和使用预留,请参阅创建和使用 预留。
- 如需详细了解 Spot 虚拟机,请参阅 详细了解 Spot 虚拟机。
- 如需创建按需虚拟机实例,请参阅创建按需虚拟机 实例。