您配置的网络服务取决于您选择的部署选项(虚拟机或集群)和基础架构。
本文档面向希望了解 AI Hypercomputer 部署的网络服务的架构师、网络工程师和开发者。本文档假定您对云网络和分布式计算概念有基本的了解。如需详细了解部署选项,请参阅部署选项概览。
如需详细了解网络架构、协议和硬件拓扑,请参阅 GPU 网络概览。
采用默认配置的 AI 优化型 GKE 部署的网络配置
当您使用默认设置创建 AI 优化型 GKE 集群时,Cluster Toolkit 蓝图会按如下方式配置网络:
- 蓝图使用默认 VPC 网络作为主 GKE 集群。
- 它会创建两个额外的 VPC:一个用于第二个主机网络接口卡 (NIC),另一个用于 GPU 到 GPU 的远程直接内存访问 (RDMA) 流量。
- 该蓝图会将预配置的 Google 管理的网络配置文件应用于用于 GPU 流量的 VPC。此配置文件会自动配置网络,以实现高速、低延迟的 RDMA 性能。
- 该蓝图会自动在 RDMA VPC 内创建八个专用子网,分别对应加速器虚拟机上的八个 RDMA NIC。
- 它会配置防火墙规则,以允许集群内节点之间的所有 TCP、UDP 和 ICMP 流量。
采用自定义配置的 GKE 部署的网络配置
自定义 GKE 设置的网络配置取决于您的工作负载类型和基础架构:
- 对于通用 GPU 或非分布式工作负载,请创建一个未启用 GPUDirect RDMA 的 GKE 集群。此配置使用单个 VPC 网络处理所有通信。
- 对于集群 GPU 或分布式工作负载,请创建一个启用了 GPUDirect RDMA 的 GKE 集群。此配置使用多 VPC 环境,将通用流量与高带宽的 GPU 间通信隔离开来。
Slurm 集群部署的网络配置
使用 Cluster Toolkit 通过可自定义的蓝图(例如 A4 或 A3 Ultra 系列的蓝图)部署 AI 和机器学习工作负载。
蓝图为集群化 GPU Slurm 部署配置的网络组件如下所示:
- 该蓝图会创建三个不同的 VPC:一个用于 Slurm 控制平面的主 VPC、一个用于常规主机级流量的辅助 VPC,以及一个用于 GPU 间通信的专用高性能 VPC。
- 对于 GPU 数据平面,蓝图会应用预配置的、经过 Google 管理且针对 RoCE 优化的网络配置文件。
- 此蓝图设置了 Filestore 服务所需的专用 IP 地址范围,该服务可为集群提供共享
/home目录。 - 它会创建一个临时的隔离映像构建 VPC,仅在为集群节点构建自定义虚拟机映像的过程中使用。
Compute Engine 实例的网络
您可以使用 Compute Engine 创建独立虚拟机、批量计算实例和托管式实例组 (MIG)。具体的网络要求取决于机器类型的基础设施模型:
- 集群 GPU:这些机器系列(A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High,均配备 8 个 GPU)需要采用多 VPC 网络配置,以将常规主机到主机流量与高带宽 GPU 到 GPU 通信隔离开来。
- 通用 GPU:这些机器系列(G2、G4、A2 和 N1,搭载 T4 或 V100)通过 gVNIC 接口使用单 VPC 架构进行所有通信。A3 Edge 是例外情况,需要 4 个数据 VPC 和 GPUDirect-TCPX。
如需详细了解您的机器类型的网卡和网络配置,请参阅网络和 GPU 机器。
后续步骤
- 如需了解创建安全且灵活的网络环境的最佳实践,请参阅网络最佳实践。
- 如需了解 AI Hypercomputer 中的存储选项,请参阅关于适用于 AI 和机器学习工作负载的存储服务。
- 如需开始部署集群,请参阅规划和创建 AI 基础设施。