集群式 GPU(例如 A4X MaxA4XA4A3 UltraA3 MegaA3 High(8 个 GPU)机器系列)旨在让您能够运行大规模人工智能 (AI) 和机器学习 (ML) 集群,并提供以下集群管理功能:

大多数集群管理功能仅支持 与预留绑定的容量(即使用 与预留绑定的预配模型的基础设施, 该模型仅支持集群式 GPU 机器类型)。 对于使用任何其他预配模型的容量,仅提供以下集群管理功能:

AI 基础设施资源托管

当您使用集群式 GPU(例如 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High(8 个 GPU))时,可以请求 主机,让 Compute Engine 将其布置得尽可能靠近。这些机器具有以下功能:

这种资源安排可最大限度地减少网络跃点,并针对最短网络延迟时间进行优化。如需部署 Compute Engine 密集分配的加速器优化机器块,您可以使用以下选项:

集群拓扑感知布置

创建集群式 GPU 后,您可以获取节点级和集群级拓扑信息。这些信息可帮助您执行以下操作:

  • 调整应用或工作负载设计,以进一步缩短网络延迟时间。

  • 了解并排查经常相互通信的实例的网络延迟和性能问题。如果实例意外地相距很远,则可能会出现这些问题。

具体来说,拓扑信息支持如下:

  • 拓扑信息最适合与预留绑定的容量,这是 查看预留拓扑所必需的。

  • 对于 Spot 虚拟机,仅当机器使用紧凑布置政策或工作负载政策时,才会显示拓扑信息。

如需了解详情,请参阅以下内容:

集群运行模式

当您预留与预留绑定的容量以创建计算实例或集群时,您预留的机器类型决定了实例的集群 运行模式 。此模式 指定了实例在 主机错误或 主机故障报告后的行为。实例的可用运行模式包括 托管模式,即 Compute Engine 会自动替换任何有故障的 机器,但会保留部分预留容量,以确保您的 实例拥有必要的资源来重启。或者 全容量模式,即您 可以使用预留的全部容量,但需要负责管理 故障和计划内维护。

如需了解详情,请参阅 预留运行模式

集群维护调度和控制

您可以在资源块中使用感知拓扑的调度来控制集群式 GPU 的维护。此功能有助于同步升级,从而使工作负载更能应对主机事件,并最大限度地减少中断。这种方法有助于提高工作负载的 有效吞吐量

为了便于您完全控制维护事件,您可以使用以下功能:

维护调度类型

当您预留与预留绑定的容量以创建计算实例或集群式 GPU 集群时,您可以定义 Compute Engine 如何维护实例运行的基础设施。 您可以根据要用于实例的机器类型,选择跨实例同步维护( 分组 )或不同的维护时间表( 独立 )。

如需了解详情,请参阅 维护调度类型

管理主机活动

创建集群式 GPU 并启动工作负载后,您可以设置提醒,以便在实例或预留块的维护安排、开始或完成时收到通知。您还可以查看实例或预留块的维护时间,并在预定时间之前手动启动维护(如果需要)。 这些选项可帮助您主动控制工作负载的停机时间并将其降至最低。

如需了解详情,请参阅以下内容:

集群监控和诊断工具

为了便于监控和问题排查,集群式 GPU 机器类型包含以下与预留绑定的容量服务:

接下来怎么做?