Gemini Enterprise Agent Platform 训练集群支持多种机器类型,以适应不同的工作负载。配置集群节点池时,您可以从以下选项中进行选择:
- a4-highgpu-8g
- a4x-highgpu-4g
- a3-ultragpu-8g
- a3-megagpu-8g
- n2 CPU 系列
A4X 机器类型
Gemini Enterprise Agent Platform 训练集群支持 A4X 加速器优化型机器类型 (a4x-highgpu-4g),这是一种基于 NVIDIA GB200 NVL72 机架级架构的艾级平台。
架构比较
下表概述了 A4X 系列与其他加速器优化型系列之间的基本硬件差异。
| 功能 | A4X (a4x-highgpu-4g) | A3 / A4H |
|---|---|---|
| CPU 架构 | ARM | X86 |
| GPU 数量 | 每个节点 4 个 GPU | 每个节点 8 个 GPU |
| 预留类型 | 全容量模式 | 管理模式 |
| 布置政策 | 严格(紧凑) | 灵活 |
A4X 具体指南
- A4X 节点池虚拟机数量必须是 18 的倍数(例如 18、36、54)。这是必需的,因为 A4X 容量以固定的、不可共享的 18 节点块(称为 NVLink 网域)进行预配。 这些网域受严格的紧凑布置政策约束,任何部分分配的块都无法供其他集群使用。
- 由于 A4X 节点采用基于 ARM 的架构,因此您必须对训练工作负载进行两项关键更改:
- 使用与 ARM 兼容的映像:所有训练作业都必须使用为 ARM 架构构建的容器映像。
- 适应 4 个 GPU:您必须更新分布式训练逻辑,以正确识别和使用每个 A4X 节点上可用的 4 个 GPU。
- 主机故障报告流程和停机时间:当您报告主机出现故障时,请注意以下恢复流程:
- 无备用容量:系统不会使用备用池进行即时节点替换。
- 基于修复的恢复:在修复底层物理主机之前,节点将保持不可用状态。
- 停机时间延长:此修复过程通常需要 3 到 14 天。
容量预配
选择合适的预配模型对于平衡成本、速度和资源可用性至关重要。请参阅以下预配选项:
RESERVATION:从您预先创建的特定 Compute Engine 预留中分配节点。此模型可确保容量,是高需求资源的推荐选择。FLEX_START:利用动态工作负载调度器将作业排队。一旦请求的计算资源可用,作业就会自动开始,从而提供灵活的开始时间,而无需预留。SPOT:使用 Spot 虚拟机预配节点池。这是最具成本效益的选项,但仅适用于能够承受中断的容错工作负载,因为虚拟机可能会随时被抢占。ON_DEMAND:这是仅限 CPU 的节点池的默认选项,最适合不稀缺的机器类型。它提供标准的虚拟机实例,并采用可预测的随用随付价格模式。
请按照以下指南进行选择:
对于高需求 GPU 资源(如 A3 和 A4):强烈建议使用
RESERVATION模型。它可确保您拥有关键训练作业所需的容量的专用访问权限。对于突发或灵活的工作负载:请考虑
FLEX_START或SPOT。FLEX_START会将作业排队,直到资源可用为止,而SPOT则为能够承受抢占的容错作业提供显著的成本节省。对于资源充足的机器类型:建议选择
ON_DEMAND模型。 对于不稀缺且无需立即使用的机器类型,请使用此模型。
使用共享预留(可选)
如果您想使用共享预留而不是本地预留,则需要执行一些额外的步骤,然后才能创建集群。
在将共享预留与 Gemini Enterprise Agent Platform 训练集群搭配使用之前,请手动创建一个使用共享预留的虚拟机,以确保共享预留正常运行。
如果此虚拟机创建成功,请继续执行下一步。
在集群创建配置中,请使用以下
格式:
projects/RESERVATION_HOST_PROJECT_ID/zones/RESERVATION_ZONE/reservations/RESERVATION_NAME。
后续步骤
为训练集群选择计算和预配选项后,您就可以创建集群并在其上运行工作负载了。
- 创建 Compute Engine 预留:
RESERVATION模型用于分配高需求资源(如 GPU)。了解如何在 Compute Engine 中创建新预留,以获得所需资源的专用访问权限。 - 创建训练集群:按照分步指南应用您已了解的配置,使用 Agent Platform API 或
gcloud创建第一个永久性训练集群。 - 向集群提交训练作业:集群处于活跃状态后,下一步是运行工作负载。提交以永久性集群为目标的
CustomJob以供执行。 - 调整代码以进行分布式训练:为了充分利用多节点集群,请调整训练代码以适应分布式环境。