Advanced Compute Images 概览

人工智能 (AI)、机器学习 (ML) 和高性能计算 (HPC) 工作负载通常需要您创建自定义映像,其中包含其他软件包并经过调整以实现最佳性能。您现在可以使用高级计算映像为 AI/ML 或 HPC 工作负载设置优化环境。

高级计算映像为 AI/机器学习和 HPC 基础设施提供标准化映像堆栈。这些映像可让您无需为 AI/机器学习和 HPC 工作负载手动构建自己的自定义映像。

优势

Advanced Compute Images 具有以下优势:

  • 默认情况下,计算实例已准备好用于 AI/机器学习或 HPC 工作负载。无需手动调整性能、管理实例重启、安装 Slurm 代理,也不必及时了解最新 Google Cloud 更新即可实现紧密耦合的 AI/ML 或 HPC 工作负载。
  • 一致、可重现的性能。映像标准化可提供一致、可重现的应用级性能。

高级计算映像的类型

高级计算映像包含多个配置层,可支持运行 AI/机器学习和 HPC 工作负载。

  • 操作系统配置:包括停用自动更新、设置经过 HPC 优化的 ulimit、调整内核 sysctl 参数,以及配置 SELinux 等安全设置。
  • 网络调优:包含网络调优所需的脚本,例如启用多队列服务。
  • Google Cloud 集成:安装并配置 Google Cloud CLI 和 Ops Agent
  • 容器工具:安装并配置所有与容器相关的软件,包括:
  • NVIDIA:安装以下工具:
  • MPI:安装消息传递接口 (MPI) 库。 在基于 Ubuntu 和基于 Rocky Linux 的映像上安装 Open MPI。对于基于 Rocky Linux 的映像,您还可以使用预安装的脚本来安装和配置 Intel MPI 库:

    sudo google_install_intelmpi --impi_2021 --install_dir=PATH_INSTALL_MPI
    
  • Slurm:安装创建 Slurm 集群节点所需的核心组件,包括:

  • 文件系统客户端:安装用于访问各种文件系统的客户端工具,例如 Cloud Storage FUSE、NFS 实用程序 (nfs-utils) 和 Lustre 客户端。

  • 开发者工具:安装常见的开发和调试工具链及实用程序,例如:

  • 环境管理:安装和配置环境管理工具(主要是 Lmod),并设置必要的配置文件脚本,以使用户可以使用模块命令。

  • RDMA:在 CPU(基于 Rocky Linux)映像上安装远程直接内存访问 (RDMA) 驱动程序和软件包,包括:

    • rdma-core 和开发库
    • libfabric
    • perftest
    • kmod-idpf-irdma - 适用于受支持的计算优化型机器类型的 Intel 以太网 RDMA 驱动程序
    • infiniband-diagslibibverbslibrdmacm 实用程序

支持的硬件和映像系列

ACI 支持两种主要硬件平台:

  • CPU (HPC):支持 CPU 工作负载,并具有以下特征:

    • 针对计算密集型工作负载进行了优化
    • 支持 Rocky Linux 9
    • 随附 RDMA 驱动程序和实用程序
    • 预集成 MPI 库,包括 Open MPI 和可配置的 Intel MPI
  • GPU (AI/ML/HPC):支持 GPU 工作负载,并具有以下特征:

    • 针对 NVIDIA 加速器进行了优化
    • 支持 Ubuntu LTS 22.04 和 Ubuntu LTS 24.04
    • 预集成 CUDA 和 NVIDIA 驱动程序
    • 适合 AI、机器学习或 HPC 工作负载
    • 在 Cluster Toolkit 中为 A4X、A4 和 A3 Ultra 机器类型部署 Slurm 集群蓝图时,是否会安装默认映像
硬件 操作系统 编排程序 特性 架构 支持的机器系列 映像系列
CPU Rocky Linux 9
  • RDMA
  • OpenMPI、IntelMPI
AMD x86_64 C2D、H3、H4D aci-cpu-rocky-linux-9-amd64
CPU Rocky Linux 9 Slurm 25.11
  • RDMA
  • MPI
AMD x86_64 C2D、H3、H4D aci-cpu-rocky-linux-9-slurm-2511-amd64
GPU Ubuntu LTS 22.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2204-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A4 aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04 Slurm 25.11
  • CUDA 13.0
  • NVIDIA 580
Arm64 A4X aci-gpu-u2404-slurm-2511-cuda-130-nvidia-580-arm64
GPU Ubuntu LTS 22.04
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2204-cuda-130-nvidia-580-amd64
GPU Ubuntu LTS 24.04
  • CUDA 13.0
  • NVIDIA 580
AMD x86_64 A3 Ultra、A4 aci-gpu-u2404-cuda-130-nvidia-580-amd64

预安装的软件包(或 RPM)

高级计算映像预安装了各种工具、库、驱动程序和软件包。如需查看任何映像的已安装内容列表,请参阅相应映像的清单文件。

您可以在 /usr/share/google/manifest.txt 找到清单文件。

映像系列生命周期阶段和支持

所有 Advanced Compute Images 系列都遵循标准化的生命周期,以确保安全性、稳定性以及可预测的维护时间表。在生命周期的每个阶段,映像系列都具有以下支持状态之一:

  • 支持
    • 接收重要的安全更新和 bug 修复
    • 通过 Cloud Customer Care 提供支持。
    • 可用于创建计算实例。
  • 不支持
    • 不再接收关键安全更新或 bug 修复。
    • 没有新功能。
    • Cloud Customer Care 不支持此功能。
    • 无法用于创建计算实例。

Advanced Compute Images 系列的生命周期包含四个阶段:

生命周期阶段 支持情况 说明和影响
有效 支持 建议用于新部署。在发布日期后的 12 个月内,映像系列会受到完全支持。接收重要的安全更新和 bug 修复。
已弃用(支持终止日期) 不支持 建议您迁移到受支持的映像系列。在有效阶段结束后的大约 6 个月内,相应映像系列会被弃用。未发布任何新功能或补丁。 当您创建使用此映像系列的实例时, Google Cloud 控制台和 Google Cloud CLI 会显示警告。
已过时 不支持 弃用阶段结束后,映像系列会变为过时。您将无法再使用此映像系列创建计算实例。现有计算实例继续运行,但存在与 Slurm 控制器不兼容的风险。
删除 不支持 映像系列过时三个月后,系统会永久删除相应的 Advanced Compute Images 映像资源。现有计算实例会继续运行,但存在与 Slurm 控制器不兼容和出现漏洞的风险。

如需了解映像系列的具体支持结束日期,请参阅受支持的硬件和映像系列

价格

高级计算映像无需额外付费即可使用。由于 Advanced Compute Images 在 Compute Engine 上运行,因此 Compute Engine 资源(例如 vCPU、GPU、TPU、磁盘和内存)可能会产生费用。如需了解详情,请参阅 Compute Engine 价格

后续步骤