计算资源

如果您对 Gemini Enterprise Agent Platform 训练集群感兴趣,请与您的销售代表联系以获取访问权限。

Gemini Enterprise Agent Platform 训练集群支持多种机器类型,以适应不同的工作负载。配置集群节点池时,您可以从以下选项中进行选择。

加速器优化机器类型

机器类型 GPU 每个节点的 GPU 数
a4x-highgpu-4g NVIDIA GB200 4
a4-highgpu-8g NVIDIA B200 8
a3-ultragpu-8g NVIDIA H200 8
a3-megagpu-8g NVIDIA H100 8
g4-standard-48 NVIDIA RTX PRO 6000 Blackwell 1
g4-standard-96 NVIDIA RTX PRO 6000 Blackwell 2
g4-standard-192 NVIDIA RTX PRO 6000 Blackwell 4
g4-standard-384 NVIDIA RTX PRO 6000 Blackwell 8

CPU 和 HPC 机器类型

机器类型 说明
N2 系列:n2-standard-*n2-highmem-*n2-highcpu-* 用于数据预处理、作业编排和其他不需要加速器的工作的通用节点。N2 也是用于 Slurm 登录节点的机器系列。
H4D 系列:h4d-standard-*h4d-highmem-* HPC 优化节点,具有 RDMA 网络,适用于紧密耦合的模拟和预处理工作负载。

A4X 机器类型

Gemini Enterprise Agent Platform 训练集群支持 A4X 加速器优化机器类型 (a4x-highgpu-4g),这是一个基于 NVIDIA GB200 NVL72 机架级架构的艾级平台。

架构比较

下表概述了 A4X 系列与其他加速器优化系列之间的基本硬件差异。

功能 A4X (a4x-highgpu-4g) A3 / A4H
CPU 架构 ARM X86
GPU 数量 每个节点 4 个 GPU 每个节点 8 个 GPU
预留类型 全容量模式 管理模式
布置政策 严格(紧凑) 灵活

A4X 具体指南

  • A4X 节点池虚拟机数量必须是 18 的倍数(例如 18、36、54)。这是必需的,因为 A4X 容量以固定的、不可共享的 18 节点块(称为 NVLink 网域)进行预配。 这些网域受严格的紧凑布置政策约束,任何部分分配的块都无法供其他集群使用。
  • 由于 A4X 节点采用基于 ARM 的架构,因此您必须对训练工作负载进行两项关键更改:
    • 使用与 ARM 兼容的映像:所有训练作业都必须使用为 ARM 架构构建的容器映像。
    • 适应 4 个 GPU:您必须更新分布式训练逻辑,以正确识别和使用每个 A4X 节点上可用的 4 个 GPU。
  • 主机故障报告流程和停机时间:当您报告主机出现故障时,请注意以下恢复流程:
    • 无备用容量:系统不会使用备用池进行即时节点替换。
    • 基于修复的恢复:在修复底层物理主机之前,节点将保持不可用状态。
    • 停机时间延长:此修复过程通常需要 3 到 14 天。

容量预配

选择合适的预配模型对于平衡成本、速度和资源可用性至关重要。请参阅以下预配选项:

  • RESERVATION:从您预先创建的特定 Compute Engine 预留中分配节点。此模型可确保容量,是高需求资源的推荐选择。

  • FLEX_START:利用动态工作负载调度器将作业排入队列。请求的计算资源可用后,作业会自动开始,从而提供灵活的开始时间,而无需预留。

  • SPOT:使用 Spot 虚拟机预配节点池。这是最具成本效益的选项,但仅适用于能够承受中断的容错工作负载,因为虚拟机可能会随时被抢占。

  • ON_DEMAND:这是仅限 CPU 的节点池的默认选项,最适合不稀缺的机器类型。它提供标准的虚拟机实例,具有可预测的随用随付价格。

请按照以下指南进行选择:

  • 对于高需求 GPU 资源(如 A3 和 A4):强烈建议使用 RESERVATION 模型。它可确保您拥有完成关键训练作业所需的容量的专用访问权限。

  • 对于突发或灵活的工作负载:请考虑 FLEX_STARTSPOTFLEX_START 会将作业排入队列,直到资源可用为止,而 SPOT 则为能够处理抢占的容错作业提供显著的成本节省。

  • 对于资源充足的机器类型:建议选择 ON_DEMAND 模型。 将其用于不稀缺且无需立即提供的机器类型。

使用共享预留(可选)

如果您想使用共享预留而不是本地预留,则需要执行一些额外的步骤,然后才能创建集群。

在将共享预留与 Gemini Enterprise Agent Platform 训练集群搭配使用之前,请手动创建一个使用共享预留的虚拟机,以确保共享预留正常运行。 如果此虚拟机创建成功,请继续执行下一步。 在集群创建配置中,请使用以下 格式: projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME

后续步骤

为训练集群选择计算和预配选项后,您就可以创建集群并在其上运行工作负载了。