计算资源

如果您对 Gemini Enterprise Agent Platform 训练集群感兴趣,请与您的销售代表联系以获取访问权限。

Gemini Enterprise Agent Platform 训练集群支持多种机器类型,以适应不同的工作负载。配置集群节点池时,您可以从以下选项中进行选择:

  • a4-highgpu-8g
  • a4x-highgpu-4g
  • a3-ultragpu-8g
  • a3-megagpu-8g
  • n2 CPU 系列

A4X 机器类型

Gemini Enterprise Agent Platform 训练集群支持 A4X 加速器优化型机器类型 (a4x-highgpu-4g),这是一种基于 NVIDIA GB200 NVL72 机架级架构的艾级平台。

架构比较

下表概述了 A4X 系列与其他加速器优化型系列之间的基本硬件差异。

功能 A4X (a4x-highgpu-4g) A3 / A4H
CPU 架构 ARM X86
GPU 数量 每个节点 4 个 GPU 每个节点 8 个 GPU
预留类型 全容量模式 管理模式
布置政策 严格(紧凑) 灵活

A4X 具体指南

  • A4X 节点池虚拟机数量必须是 18 的倍数(例如 18、36、54)。这是必需的,因为 A4X 容量以固定的、不可共享的 18 节点块(称为 NVLink 网域)进行预配。 这些网域受严格的紧凑布置政策约束,任何部分分配的块都无法供其他集群使用。
  • 由于 A4X 节点采用基于 ARM 的架构,因此您必须对训练工作负载进行两项关键更改:
    • 使用与 ARM 兼容的映像:所有训练作业都必须使用为 ARM 架构构建的容器映像。
    • 适应 4 个 GPU:您必须更新分布式训练逻辑,以正确识别和使用每个 A4X 节点上可用的 4 个 GPU。
  • 主机故障报告流程和停机时间:当您报告主机出现故障时,请注意以下恢复流程:
    • 无备用容量:系统不会使用备用池进行即时节点替换。
    • 基于修复的恢复:在修复底层物理主机之前,节点将保持不可用状态。
    • 停机时间延长:此修复过程通常需要 3 到 14 天。

容量预配

选择合适的预配模型对于平衡成本、速度和资源可用性至关重要。请参阅以下预配选项:

  • RESERVATION:从您预先创建的特定 Compute Engine 预留中分配节点。此模型可确保容量,是高需求资源的推荐选择。

  • FLEX_START:利用动态工作负载调度器将作业排队。一旦请求的计算资源可用,作业就会自动开始,从而提供灵活的开始时间,而无需预留。

  • SPOT:使用 Spot 虚拟机预配节点池。这是最具成本效益的选项,但仅适用于能够承受中断的容错工作负载,因为虚拟机可能会随时被抢占。

  • ON_DEMAND:这是仅限 CPU 的节点池的默认选项,最适合不稀缺的机器类型。它提供标准的虚拟机实例,并采用可预测的随用随付价格模式。

请按照以下指南进行选择:

  • 对于高需求 GPU 资源(如 A3 和 A4):强烈建议使用 RESERVATION 模型。它可确保您拥有关键训练作业所需的容量的专用访问权限。

  • 对于突发或灵活的工作负载:请考虑 FLEX_STARTSPOTFLEX_START 会将作业排队,直到资源可用为止,而 SPOT 则为能够承受抢占的容错作业提供显著的成本节省。

  • 对于资源充足的机器类型:建议选择 ON_DEMAND 模型。 对于不稀缺且无需立即使用的机器类型,请使用此模型。

使用共享预留(可选)

如果您想使用共享预留而不是本地预留,则需要执行一些额外的步骤,然后才能创建集群。

在将共享预留与 Gemini Enterprise Agent Platform 训练集群搭配使用之前,请手动创建一个使用共享预留的虚拟机,以确保共享预留正常运行。 如果此虚拟机创建成功,请继续执行下一步。 在集群创建配置中,请使用以下 格式: projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME

后续步骤

为训练集群选择计算和预配选项后,您就可以创建集群并在其上运行工作负载了。