集群式 GPU 针对人工智能 (AI) 和机器学习 (ML) 工作负载进行了优化,这些工作负载优先考虑大规模分布式训练、多主机推理和复杂的高性能计算 (HPC) 任务。
借助集群式 GPU,团队可以使用专用网络结构和同步维护,将数千个互连的加速器部署和扩缩为单个紧密耦合的系统。它们非常适合需要极高的计算能力、内存和高速网络同步的工作负载。常见用例包括预训练具有数万亿个参数的基础模型、前沿模型部署以及药物发现模拟。
集群式 GPU 的主要特征
- 同步维护: Google Cloud 同时更新集群中的所有节点 ,防止单个节点重启导致作业停滞。
- 自动健康状况监控:系统主动识别 落后者,并监控硬件故障或静默数据损坏。
- 主动节点替换:系统从备用池中将性能不佳的虚拟机从健康状况良好的机器中逐出并重新调度 。
- 轨道对齐拓扑:轨道对齐拓扑将 GPU 到 GPU 的流量与标准主机通信隔离开,有助于确保无抖动性能 以实现大规模多节点协调。
- 高级协议:这些机器系列支持高带宽 互连,包括 GPUDirect RDMA(基于 RoCE)。
集群式 GPU 系列和技术规范
请查看这些表格中高级集群式 GPU 机器系列的工作负载和硬件规范。对于艾级训练,请使用 A4X 或 A3 Ultra 系列。
A4X Max 和 A4X 系列
如果您要训练大规模艾级基础模型或运行高度复杂的裸金属高性能计算 (HPC) 模拟,请使用 A4X Max 或 A4X 机器系列。这些系列配备 NVIDIA GB300 Grace Blackwell Ultra 超级芯片,可满足极高的计算和内存需求。
A4X Max(裸金属)
A4X Max
机器类型使用 NVIDIA GB300 Grace Blackwell Ultra 超级芯片 (nvidia-gb300),
非常适合基础模型训练和部署。A4X Max 机器类型以 裸金属实例 的形式提供。
A4X Max 是基于 NVIDIA GB300 NVL72 的艾级平台。每台机器都有两个搭载了 Arm Neoverse V2 核心的 NVIDIA Grace CPU 插槽。这些 CPU 通过快速 芯片间 (NVLink-C2C) 通信连接到四个 NVIDIA B300 Blackwell GPU。
| 挂接了 NVIDIA GB300 Grace Blackwell Ultra 超级芯片 | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3e) |
a4x-maxgpu-4g-metal |
144 | 960 | 12000 | 6 | 3600 | 4 | 1,116 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A4X
A4X
机器类型使用 NVIDIA GB200 Grace Blackwell 超级芯片 (nvidia-gb200),
非常适合基础模型训练和部署。
A4X 是基于 NVIDIA GB200 NVL72 的艾级平台。每台机器都有两个搭载了 Arm Neoverse V2 核心的 NVIDIA Grace CPU 插槽。这些 CPU 通过快速 芯片间 (NVLink-C2C) 通信连接到四个 NVIDIA B200 Blackwell GPU。
| 挂接了 NVIDIA GB200 Grace Blackwell 超级芯片 | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3e) |
a4x-highgpu-4g |
140 | 884 | 12,000 | 6 | 2,000 | 4 | 744 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A4 系列
如果您的目标是训练需要大规模并行处理规模的先进基础模型,请使用 A4 机器系列来优化处理时间并最大限度地提高硬件吞吐量。
A4
机器类型挂接了
NVIDIA B200 Blackwell GPU
(nvidia-b200),非常适合基础模型
训练和部署。
| 挂接的 NVIDIA B200 Blackwell GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3e) |
a4-highgpu-8g |
224 | 3,968 | 12,000 | 10 | 3600 | 8 | 1,440 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A3 系列(Ultra、Mega 和 High,具有 8 个 GPU)
如果您需要执行大规模分布式训练运行或跨多个主机部署具有大型数据集表的前沿模型,请使用 A3 机器系列来最大限度地减少主机到主机的网络延迟。
A3 Ultra
| 挂接了 NVIDIA H200 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3e) |
a3-ultragpu-8g |
224 | 2,952 | 12,000 | 10 | 3600 | 8 | 1128 |
A3 Mega
| 挂接了 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3) |
a3-megagpu-8g |
208 | 1,872 | 6000 | 9 | 1800 | 8 | 640 |
A3 High
| 挂接了 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6000 | 5 | 1000 | 8 | 640 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
容量获取
获取集群式 GPU 的计算容量需要协调,以管理高性能加速器的供需。 由于这些资源在物理上位于专用网络结构中,因此您必须通过托管式工作流请求它们。
您可以通过客户支持团队预留容量,也可以使用未来预留和动态工作负载调度器。
后续步骤
- 如需了解如何获取容量,请参阅消费选项。
- 如需评估您的基础架构要求,请参阅选择基础架构。
- 如需规划您的网络拓扑,请参阅集群环境的 GPU 网络要求。
- 如需预留计算资源,请参阅预留容量。