人工智能 (AI)、机器学习 (ML) 和高性能计算 (HPC) 工作负载通常需要您创建自定义映像,其中包含其他软件包并经过调整以实现最佳性能。您现在可以使用高级计算映像为 AI/ML 或 HPC 工作负载设置优化环境。
高级计算映像为 AI/机器学习和 HPC 基础设施提供标准化映像堆栈。这些映像可让您无需为 AI/机器学习和 HPC 工作负载手动构建自己的自定义映像。
优势
Advanced Compute Images 具有以下优势:
- 默认情况下,计算实例已准备好用于 AI/机器学习或 HPC 工作负载。无需手动调整性能、管理实例重启、安装 Slurm 代理,也不必及时了解最新 Google Cloud 更新即可实现紧密耦合的 AI/ML 或 HPC 工作负载。
- 一致、可重现的性能。映像标准化可提供一致、可重现的应用级性能。
高级计算映像的类型
高级计算映像包含多个配置层,可支持运行 AI/机器学习和 HPC 工作负载。
- 操作系统配置:包括停用自动更新、设置经过 HPC 优化的 ulimit、调整内核 sysctl 参数,以及配置 SELinux 等安全设置。
- 网络调优:包含网络调优所需的脚本,例如启用多队列服务。
- Google Cloud 集成:安装并配置 Google Cloud CLI 和 Ops Agent。
- 容器工具:安装并配置所有与容器相关的软件,包括:
- Docker
- NVIDIA Container Toolkit(版本 1.19.0-1)
- NVIDIA Enroot
- NVIDIA Pyxis
- NVIDIA:安装以下工具:
MPI:安装消息传递接口 (MPI) 库。 在基于 Ubuntu 和基于 Rocky Linux 的映像上安装 Open MPI。对于基于 Rocky Linux 的映像,您还可以使用预安装的脚本来安装和配置 Intel MPI 库:
sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
Slurm:安装创建 Slurm 集群节点所需的核心组件,包括:
- Slurm 二进制文件(版本 25.11)
- 用于身份验证的 Munge
- 用于进程管理的 PMIx
- JSON Web 令牌 (JWT) 库 (
libjwt)
文件系统客户端:安装用于访问各种文件系统的客户端工具,例如 Cloud Storage FUSE、NFS 实用程序 (
nfs-utils) 和 Lustre 客户端。开发者工具:安装常见的开发和调试工具链及实用程序,例如:
环境管理:安装和配置环境管理工具(主要是 Lmod),并设置必要的配置文件脚本,以使用户可以使用模块命令。
RDMA:在 CPU(基于 Rocky Linux)映像上安装远程直接内存访问 (RDMA) 驱动程序和软件包,包括:
rdma-core和开发库libfabricperftestkmod-idpf-irdma- 适用于受支持的计算优化型机器类型的 Intel 以太网 RDMA 驱动程序infiniband-diags、libibverbs和librdmacm实用程序
支持的硬件和映像系列
ACI 支持两种主要硬件平台:
CPU (HPC):支持 CPU 工作负载,并具有以下特征:
- 针对计算密集型工作负载进行了优化
- 支持 Rocky Linux 9
- 随附 RDMA 驱动程序和实用程序
- 预集成 MPI 库,包括 Open MPI 和可配置的 Intel MPI
GPU (AI/ML/HPC):支持 GPU 工作负载,并具有以下特征:
- 针对 NVIDIA 加速器进行了优化
- 支持 Ubuntu LTS 22.04 和 Ubuntu LTS 24.04
- 预集成 CUDA 和 NVIDIA 驱动程序
- 适合 AI、机器学习或 HPC 工作负载
- 在 Cluster Toolkit 中为 A4X、A4 和 A3 Ultra 机器类型部署 Slurm 集群蓝图时,是否会安装默认映像
| 硬件 | 操作系统 | 编排程序 | 特性 | 架构 | 支持的机器系列 | 映像系列 |
|---|---|---|---|---|---|---|
| CPU | Rocky Linux 9 | 无 |
|
AMD x86_64 | C2D、H3、H4D | aci-cpu-rocky-linux-9-amd64 |
| CPU | Rocky Linux 9 | Slurm 25.11 |
|
AMD x86_64 | C2D、H3、H4D | aci-cpu-rocky-linux-9-slurm-2511-amd64 |
| GPU | Ubuntu LTS 22.04 | Slurm 25.11 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
AMD x86_64 | A4 | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | Slurm 25.11 |
|
Arm64 | A4X | aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64 |
| GPU | Ubuntu LTS 22.04 | 无 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2204-cuda-130-nvidia-580-amd64 |
| GPU | Ubuntu LTS 24.04 | 无 |
|
AMD x86_64 | A3 Ultra、A4 | aci-gpu-u2404-cuda-130-nvidia-580-amd64 |
预安装的软件包(或 RPM)
高级计算映像预安装了各种工具、库、驱动程序和软件包。如需查看任何映像的已安装内容列表,请参阅相应映像的清单文件。
您可以在 /usr/share/google/manifest.txt 找到清单文件。
映像系列生命周期阶段和支持
所有 Advanced Compute Images 系列都遵循标准化的生命周期,以确保安全性、稳定性以及可预测的维护时间表。在生命周期的每个阶段,映像系列都具有以下支持状态之一:
- 支持:
- 接收重要的安全更新和 bug 修复
- 通过 Cloud Customer Care 提供支持。
- 可用于创建计算实例。
- 不支持:
- 不再接收关键安全更新或 bug 修复。
- 没有新功能。
- Cloud Customer Care 不支持此功能。
- 无法用于创建计算实例。
Advanced Compute Images 系列的生命周期包含四个阶段:
| 生命周期阶段 | 支持情况 | 说明和影响 |
|---|---|---|
| 有效 | 支持 | 建议用于新部署。在发布日期后的 12 个月内,映像系列会受到完全支持。接收重要的安全更新和 bug 修复。 |
| 已弃用(支持终止日期) | 不支持 | 建议您迁移到受支持的映像系列。在有效阶段结束后的大约 6 个月内,相应映像系列会被弃用。未发布任何新功能或补丁。 当您创建使用此映像系列的实例时, Google Cloud 控制台和 Google Cloud CLI 会显示警告。 |
| 已过时 | 不支持 | 弃用阶段结束后,映像系列会变为过时。您将无法再使用此映像系列创建计算实例。现有计算实例继续运行,但存在与 Slurm 控制器不兼容的风险。 |
| 删除 | 不支持 | 映像系列过时三个月后,系统会永久删除相应的 Advanced Compute Images 映像资源。现有计算实例会继续运行,但存在与 Slurm 控制器不兼容和出现漏洞的风险。 |
如需了解映像系列的具体支持结束日期,请参阅受支持的硬件和映像系列。
价格
高级计算映像无需额外付费即可使用。由于 Advanced Compute Images 在 Compute Engine 上运行,因此 Compute Engine 资源(例如 vCPU、GPU、TPU、磁盘和内存)可能会产生费用。如需了解详情,请参阅 Compute Engine 价格。
后续步骤
- 使用 Advanced Compute Images 创建实例
了解如何使用 Advanced Compute Images 部署现成的 Slurm 集群蓝图: