本文档介绍了如何使用 Cluster Director 和 A4X、A4、A3 Ultra 或 A3 Mega 机器类型来配置和部署全代管式式 Slurm 集群。如需详细了解这些加速器优化机器类型,请参阅关于 GPU 加速器。
Cluster Director 是一款可自动设置和配置 Slurm 集群的 Google Cloud产品。此产品专为希望避免管理集群的开销并专注于运行工作负载的 IT 管理员和 AI 研究人员而设计。如果您希望更好地控制集群部署,请使用 Cluster Toolkit 创建集群。
限制
根据集群中 Compute Engine 实例使用的机器类型,适用以下限制:
A4X
- 使用此机器类型的实例不会获得持续使用折扣或灵活承诺使用折扣。
- 您只能在特定区域和可用区中创建实例。
- 您不能使用 Persistent Disk(区域级或可用区级)。您只能使用 Google Cloud Hyperdisk。
- 此机器类型仅在 NVIDIA Grace 平台上提供。
- A4X 不支持更改机器类型。如需切换到或切换自此机器类型,您必须创建新的实例。
- 您无法在此机器类型上运行 Windows 操作系统。如需查看受支持的 Linux 操作系统的列表,请参阅 GPU 实例支持的操作系统。
- 对于 A4X 实例,当您使用
ethtool -S监控 GPU 网络时,以_phy结尾的物理端口计数器不会更新。对于使用 MRDMA 虚拟功能 (VF) 架构的实例,这是预期行为。如需了解详情,请参阅 MRDMA 函数和网络监控工具。 - A4X 实例不支持以下各项:
- 您无法将 2026 年 2 月 4 日之前创建的 Hyperdisk ML 磁盘挂接到 A4X 机器类型。
A4
- 使用 A4 机器类型的实例不会获得持续使用折扣和灵活承诺使用折扣。
- 只能在某些区域和可用区中使用 A4 机器类型。
- 您不能使用 Persistent Disk(区域级或可用区级)。您只能使用 Google Cloud Hyperdisk。
- A4 机器类型仅在 Emerald Rapids CPU 平台上提供。
- 您不能将实例的机器类型更改为 A4 机器类型或从 A4 机器类型更改为其他类型。您必须使用此机器类型创建新实例。
- A4 机器类型不支持单租户。
- 不能在 A4 机器类型上运行 Windows 操作系统。
- 对于 A4 实例,当您使用
ethtool -S监控 GPU 网络时,以_phy结尾的物理端口计数器不会更新。对于使用 MRDMA 虚拟功能 (VF) 架构的实例,这是预期行为。 如需了解详情,请参阅 MRDMA 函数和网络监控工具。 - 您无法将 2026 年 2 月 4 日之前创建的 Hyperdisk ML 磁盘挂接到 A4 机器类型。
A3 Ultra
- 使用 A3 Ultra 机器类型的实例不会获得持续使用折扣和灵活承诺使用折扣。
- 只能在某些区域和可用区中使用 A3 Ultra 机器类型。
- 您不能使用 Persistent Disk(区域级或可用区级)。您只能使用 Google Cloud Hyperdisk。
- A3 Ultra 机器类型仅在 Emerald Rapids CPU 平台上提供。
- A3 Ultra 机器类型不支持更改机器类型。如需切换到或切换出此机器类型,您必须创建新的实例。
- 不能在 A3 Ultra 机器类型上运行 Windows 操作系统。
- A3 Ultra 机器类型不支持单租户。
- 对于 A3 Ultra 实例,当您使用
ethtool -S监控 GPU 网络时,以_phy结尾的物理端口计数器不会更新。对于使用 MRDMA 虚拟功能 (VF) 架构的实例,这是预期行为。如需了解详情,请参阅 MRDMA 函数和网络监控工具。
A3 Mega
- 使用 A3 Mega 机器类型的实例不会获得持续使用折扣和灵活承诺使用折扣。
- 只能在某些区域和可用区中使用 A3 Mega 机器类型。
- 不能在使用 A3 Mega 机器类型的实例上使用区域级永久性磁盘。
- A3 Mega 机器类型仅在 Sapphire Rapids CPU 平台上提供。
- A3 Mega 机器类型不支持更改机器类型。如需切换到或切换出此机器类型,您必须创建新的实例。
- 不能在 A3 Mega 机器类型上运行 Windows 操作系统。
准备工作
在创建 Slurm 集群之前,请完成以下步骤(如果您尚未完成):
- 选择使用选项:您选择的使用选项决定了您如何获取和使用 GPU 资源。如需了解详情,请参阅选择消费选项。
- 获取容量:每种使用选项的容量获取流程各不相同。如需了解所选使用选项的容量获取流程,请参阅容量概览。
- 验证您是否有足够的 Filestore 容量配额:在部署之前,您需要在目标区域中拥有足够的 Filestore 配额。
对于 A4X、A4、A3 Ultra 和 A3 Mega 机器类型,您需要至少 10 TiB (10,240 GiB) 的 HIGH_SCALE_SSD(可用区级)容量。
如需查看配额或申请增加配额,请参阅以下内容:
- 如需查看项目中的配额,请参阅查看 API 特定的配额。
- 如果配额不足,请申请增加配额。
- 验证可信映像政策:如果您的项目所在的组织具有可信映像政策 (
constraints/compute.trustedImageProjects),请验证clusterdirector-public-images项目是否包含在允许的项目列表中。如需了解详情,请参阅设置可信映像政策。
所需的角色
如需创建 Slurm 集群,您需要拥有以下 IAM 角色和权限:
-
如需获得完成本教程所需的权限,请让您的管理员为您授予以下 IAM 角色:
-
创建和管理集群:项目的 Cluster Director Editor (
roles/hypercomputecluster.editor) -
如需在集群中创建和管理虚拟机,请在项目中拥有 Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) 角色 -
如需使用单项目预留:
您项目中的 Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) -
如需使用共享预留,您需要在所有者项目和您希望使用预留的任何使用者项目中拥有 Compute Instance Admin (v1) (
roles/compute.instanceAdmin.v1) 角色 -
如需连接到集群中的登录节点,请执行以下操作:
- 项目的 Compute OS Login (
roles/compute.osLogin) - IAP-Secured Tunnel User (
roles/iap.tunnelResourceAccessor) 针对您的项目
- 项目的 Compute OS Login (
如需详细了解如何授予角色,请参阅管理对项目、文件夹和组织的访问权限。
-
创建和管理集群:项目的 Cluster Director Editor (
-
如需获得完成本快速入门所需的权限,请让您的管理员为您授予 Compute Engine 默认服务账号的以下 IAM 角色:
-
创建集群:Service Account User (
roles/iam.serviceAccountUser) -
如需管理集群中的资源,请执行以下操作:
- Logs Writer (
roles/logging.logWriter) - Monitoring Metric Writer (
roles/monitoring.metricWriter) - Storage Object Viewer (
roles/storage.objectViewer)
- Logs Writer (
-
创建集群:Service Account User (
创建 Slurm 集群
如需使用 Cluster Director 创建 AI 优化型集群,请完成以下步骤:
配置计算资源配置
如需在创建集群时配置计算资源配置,请完成以下步骤:
在 Google Cloud 控制台中,前往 Cluster Director 页面。
点击 创建集群。
在显示的对话框中,点击参考架构。系统会打开创建集群页面。
点击一个可用的模板。您可以选择修改模板,使其适应工作负载的需求。
点击自定义。
在计算部分的集群名称字段中,输入集群的名称。名称最多可包含 10 个字符,并且只能使用数字或小写字母 (
a-z)。如需向预配置的计算资源配置添加信息,或修改配置指定的计算实例数量和类型,请执行以下操作:
在计算部分中,点击 修改资源配置。系统随即会显示添加资源配置窗格。
可选:如需更改计算资源配置名称,请在名称字段中输入新名称。
可选:如需更改集群使用的计算实例的数量和类型,请在机器配置部分中按照提示更新计算资源。
在使用选项部分中,指定要用于获取资源的使用选项:
如需使用预留创建计算实例,请执行以下操作:
如需创建灵活启动虚拟机,请执行以下操作:
点击弹性开始标签页。
在虚拟机的时间限制部分中,指定计算实例的运行时长。该值必须介于 10 分钟到 7 天之间。
在位置部分,选择要创建灵活启动虚拟机的区域。Google Cloud 控制台会自动过滤可用的区域,仅显示支持所选机器类型的灵活启动虚拟机的区域。
如需创建 Spot 虚拟机,请执行以下操作:
点击使用热点标签页。
在虚拟机终止时列表中,选择以下选项之一:
如需在抢占时删除 Spot 虚拟机,请选择删除。
如需在抢占时停止 Spot 虚拟机,请选择停止。
在位置部分,选择要在其中创建竞价型虚拟机的区域和可用区。Google Cloud 控制台会自动过滤可用的区域,仅显示支持所选机器类型的 Spot 虚拟机的区域。
点击完成。
可选:如需为分区创建其他计算资源配置,请点击 添加资源配置,然后按照提示指定计算资源。
点击继续。
配置网络
如需配置集群使用的网络,请完成以下步骤:
在选择虚拟私有云 (VPC) 网络部分中,执行以下操作之一:
建议:如需让 AI Hypercomputer 自动为您的集群创建预配置的 VPC 网络,请执行以下操作:
选择创建新的 VPC 网络。
在网络名称字段中,输入 VPC 网络的名称。
如需使用现有的 VPC 或共享 VPC 网络,请执行以下操作:
选择使用当前项目中的 VPC 网络或使用托管在其他项目中的共享 VPC 网络。
在选择 VPC 网络或共享 VPC 网络列表中,选择符合所需配置的 VPC 或共享 VPC 网络。
在选择子网列表中,选择现有子网。
点击继续。
配置存储资源
当您根据 Cluster Director 模板创建集群时,Cluster Director 会自动将 Filestore 或 Managed Lustre 实例配置为集群的存储资源。
如需选择性地添加或修改集群使用的存储资源,请在存储部分完成以下步骤。如需详细了解可配置的存储服务,请参阅 Cluster Director 支持的存储服务。
可选:如需修改存储资源,请点击 修改存储空间方案,然后按照提示更新存储资源的配置。
可选:如需向集群添加存储资源,请点击 添加存储配置,然后按照提示指定存储资源的配置。
如需查看可配置的可用存储服务,请参阅 Cluster Director 支持的存储服务。
点击继续。
配置 Slurm 环境
如需在集群中配置 Slurm 环境,请完成以下步骤:
可选:如需修改登录节点使用的计算实例的数量和类型,请展开登录节点部分,然后按照提示更新计算资源。
可选:如需修改集群的分区以整理计算资源,请展开分区部分,然后执行以下操作之一:
如需添加分区,请点击添加分区,然后执行以下操作:
在分区名称字段中,输入分区的名称。
如需修改节点集,请点击切换节点集。否则,如需添加节点集,请点击添加节点集。
在节点集名称字段中,输入节点集的名称。
在资源配置字段中,选择您在之前的步骤中创建的计算资源配置。
在来源映像列表中,选择一个适用于 AI Hypercomputer 的受支持操作系统映像。
在静态节点数字段中,输入集群中必须始终运行的计算实例的最小数量。
在动态节点数字段中,输入 AI Hypercomputer 在流量增加期间可将集群增加到的计算实例数上限。
在启动磁盘类型列表和启动磁盘大小字段中,输入计算实例要使用的启动磁盘的类型和大小。
点击完成。
如需移除分区,请点击 删除分区。
可选:如需向 Slurm 环境添加序言或后记脚本,请执行以下操作:
展开高级编排设置部分。
在脚本部分中,按照提示添加脚本。
点击创建。系统会显示集群页面。创建集群可能需要一些时间才能完成。完成时间取决于您请求的计算实例数量以及计算实例所在可用区中的资源可用性。如果请求的资源不可用,AI Hypercomputer 会保留创建请求,直到资源变得可用。如需查看集群创建操作的状态,请查看集群的详细信息。
连接到 Slurm 集群
当 AI Hypercomputer 创建登录节点时,集群状态会变为 Ready。然后,您可以连接到集群;不过,只有在 AI Hypercomputer 在集群中创建计算节点后,您才能运行工作负载。
如需使用Google Cloud 控制台通过 SSH 连接到集群的登录节点,请完成以下步骤:
在 Google Cloud 控制台中,前往集群页面。
在集群表格的名称列中,点击您在上一部分中创建的集群的名称。系统会显示一个包含集群详细信息的页面,并且详细信息标签页处于选中状态。
点击节点标签页。
在登录节点部分的连接列中,找到集群的登录节点,其名称为
CLUSTER_NAME-login-001。在登录节点的连接列中,点击 SSH 按钮。 系统会打开 SSH-in-browser 窗口。
如果出现提示,请点击授权。连接到节点最多可能需要一分钟才能完成。
验证 Slurm 集群健康状况
在计算节点上运行作业之前,Slurm 会自动对该节点运行快速 GPU 健康检查。如果节点未能通过检查,则 Slurm 会排空该节点,并防止在其上调度新作业。
如需更全面地测试集群分区中各个计算节点的 GPU 健康状况和网络带宽,您可以手动运行 NVIDIA Collective Communications Library (NCCL) 测试。如果 NCCL 测试发现任何运行状况不佳的节点,您可以修复这些节点或修改集群。NCCL 测试可帮助您在运行关键工作负载之前验证集群的健康状况。如需了解详情,请参阅验证集群健康状况。
删除 Slurm 集群
如需删除项目中的 Slurm 集群,请选择以下选项之一:
在 Google Cloud 控制台中,前往集群页面。
在集群表格的名称列中,点击要删除的集群的名称。系统会显示一个包含集群详细信息的页面,并且详细信息标签页处于选中状态。
点击 删除。
在随即显示的对话框中,输入集群的名称,然后点击删除以确认。系统会显示集群页面。删除集群可能需要一些时间才能完成。