Gemini Enterprise Agent Platform 训练集群支持多种机器类型,以适应不同的工作负载。配置集群节点池时,您可以从以下选项中进行选择。
加速器优化机器类型
| 机器类型 | GPU | 每个节点的 GPU 数 |
|---|---|---|
a4x-highgpu-4g |
NVIDIA GB200 | 4 |
a4-highgpu-8g |
NVIDIA B200 | 8 |
a3-ultragpu-8g |
NVIDIA H200 | 8 |
a3-megagpu-8g |
NVIDIA H100 | 8 |
g4-standard-48 |
NVIDIA RTX PRO 6000 Blackwell | 1 |
g4-standard-96 |
NVIDIA RTX PRO 6000 Blackwell | 2 |
g4-standard-192 |
NVIDIA RTX PRO 6000 Blackwell | 4 |
g4-standard-384 |
NVIDIA RTX PRO 6000 Blackwell | 8 |
CPU 和 HPC 机器类型
| 机器类型 | 说明 |
|---|---|
N2 系列:n2-standard-*、n2-highmem-*、n2-highcpu-* |
用于数据预处理、作业编排和其他不需要加速器的工作的通用节点。N2 也是用于 Slurm 登录节点的机器系列。 |
H4D 系列:h4d-standard-*、h4d-highmem-* |
HPC 优化节点,具有 RDMA 网络,适用于紧密耦合的模拟和预处理工作负载。 |
A4X 机器类型
Gemini Enterprise Agent Platform 训练集群支持 A4X 加速器优化机器类型 (a4x-highgpu-4g),这是一个基于 NVIDIA GB200 NVL72 机架级架构的艾级平台。
架构比较
下表概述了 A4X 系列与其他加速器优化系列之间的基本硬件差异。
| 功能 | A4X (a4x-highgpu-4g) | A3 / A4H |
|---|---|---|
| CPU 架构 | ARM | X86 |
| GPU 数量 | 每个节点 4 个 GPU | 每个节点 8 个 GPU |
| 预留类型 | 全容量模式 | 管理模式 |
| 布置政策 | 严格(紧凑) | 灵活 |
A4X 具体指南
- A4X 节点池虚拟机数量必须是 18 的倍数(例如 18、36、54)。这是必需的,因为 A4X 容量以固定的、不可共享的 18 节点块(称为 NVLink 网域)进行预配。 这些网域受严格的紧凑布置政策约束,任何部分分配的块都无法供其他集群使用。
- 由于 A4X 节点采用基于 ARM 的架构,因此您必须对训练工作负载进行两项关键更改:
- 使用与 ARM 兼容的映像:所有训练作业都必须使用为 ARM 架构构建的容器映像。
- 适应 4 个 GPU:您必须更新分布式训练逻辑,以正确识别和使用每个 A4X 节点上可用的 4 个 GPU。
- 主机故障报告流程和停机时间:当您报告主机出现故障时,请注意以下恢复流程:
- 无备用容量:系统不会使用备用池进行即时节点替换。
- 基于修复的恢复:在修复底层物理主机之前,节点将保持不可用状态。
- 停机时间延长:此修复过程通常需要 3 到 14 天。
容量预配
选择合适的预配模型对于平衡成本、速度和资源可用性至关重要。请参阅以下预配选项:
RESERVATION:从您预先创建的特定 Compute Engine 预留中分配节点。此模型可确保容量,是高需求资源的推荐选择。FLEX_START:利用动态工作负载调度器将作业排入队列。请求的计算资源可用后,作业会自动开始,从而提供灵活的开始时间,而无需预留。SPOT:使用 Spot 虚拟机预配节点池。这是最具成本效益的选项,但仅适用于能够承受中断的容错工作负载,因为虚拟机可能会随时被抢占。ON_DEMAND:这是仅限 CPU 的节点池的默认选项,最适合不稀缺的机器类型。它提供标准的虚拟机实例,具有可预测的随用随付价格。
请按照以下指南进行选择:
对于高需求 GPU 资源(如 A3 和 A4):强烈建议使用
RESERVATION模型。它可确保您拥有完成关键训练作业所需的容量的专用访问权限。对于突发或灵活的工作负载:请考虑
FLEX_START或SPOT。FLEX_START会将作业排入队列,直到资源可用为止,而SPOT则为能够处理抢占的容错作业提供显著的成本节省。对于资源充足的机器类型:建议选择
ON_DEMAND模型。 将其用于不稀缺且无需立即提供的机器类型。
使用共享预留(可选)
如果您想使用共享预留而不是本地预留,则需要执行一些额外的步骤,然后才能创建集群。
在将共享预留与 Gemini Enterprise Agent Platform 训练集群搭配使用之前,请手动创建一个使用共享预留的虚拟机,以确保共享预留正常运行。
如果此虚拟机创建成功,请继续执行下一步。
在集群创建配置中,请使用以下
格式:
projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME。
后续步骤
为训练集群选择计算和预配选项后,您就可以创建集群并在其上运行工作负载了。
- 创建 Compute Engine 预留:
RESERVATION模型用于分配高需求资源(如 GPU)。了解如何在 Compute Engine 中创建新预留,以获得所需资源的专用访问权限。 - 创建训练集群:按照分步指南应用您了解的配置,使用 Agent Platform API 或
gcloud创建第一个永久性训练集群。 - 向集群提交训练作业:集群处于活跃状态后,下一步是运行工作负载。提交以永久性集群为目标的
CustomJob以供执行。 - 调整代码以进行分布式训练:为了充分利用多节点集群,请调整训练代码以适应分布式环境。