GPU 概览

通用 GPU 针对以下人工智能 (AI) 和机器学习 (ML) 工作负载进行了优化:优先考虑运营灵活性、资源独立性和成本效益。

借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。

通用 GPU 的主要特征

  • 操作灵活性:您可以使用标准 GKE(Autopilot 和 Standard)和 Compute Engine 接口来管理资源,从而简化部署和伸缩。
  • 高可用性: Google Cloud 独立更新各个实例,以帮助确保一个节点上的更新不会影响其他节点的可用性,从而使负载均衡器能够重定向流量,而不会导致服务舰队停滞。
  • 网络简单易用:工作负载使用标准虚拟私有云 (VPC) 服务和标准 TCP/IP over Google 虚拟 NIC (gVNIC) 接口,无需复杂的硬件级光纤交换结构。
  • 费用优化:您可以将 Spot 虚拟机用于容错型研究,与标准按需费率相比,可节省高达 90% 的费用。
  • 自助获取:您可以直接通过标准预留和按需请求获取容量,而无需使用由客户服务团队管理的工作流。

常规 GPU 系列和技术规格

查看通用 GPU 机器系列的工作负载和硬件规格。如需实现高吞吐量服务,请使用 A3 Edge 系列。

A3 系列(High,具有 1 个、2 个或 4 个 GPU;Edge)

A3 High(1、2 或 4 个 GPU)

如果您运行的推理或标准训练工作负载需要高性能,但不需要完整的 8-GPU 同步集群,请使用附加了 1 个、2 个或 4 个 GPU 的 A3 High 机器系列。

A3 High 机器类型配备 NVIDIA H100 SXM GPU,非常适合大型模型推理和模型微调。

挂接了 NVIDIA H100 GPU
机器类型 vCPU 数量1 实例内存 (GB) 已挂接的本地 SSD (GiB) 物理 NIC 数量 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3
(GB HBM3)
a3-highgpu-1g 26 234 750 1 25 1 80
a3-highgpu-2g 52 468 1,500 1 50 2 160
a3-highgpu-4g 104 936 3000 1 100 4 320
a3-highgpu-8g 208 1,872 6000 5 1000 8 640

1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。

A3 Edge

如果您要在多个主机上运行高吞吐量分布式推理工作负载,但没有协调的集群结构,请使用 A3 Edge 系列来简化通过标准虚拟专用网络的部署。

A3 Edge 机器类型配备 NVIDIA H100 SXM GPU,专为部署而设计,在部分区域提供。

挂接了 NVIDIA H100 GPU
机器类型 vCPU 数量1 实例内存 (GB) 已挂接的本地 SSD (GiB) 物理 NIC 数量 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3
(GB HBM3)
a3-edgegpu-8g 208 1,872 6000 5
  • 600:适用于 asia-south1 和 northamerica-northeast2
  • 400:适用于所有其他 A3 Edge 区域
8 640

A2 系列(标准版和 Ultra 版)

如果您需要执行高性能单节点模型部署或小规模模型微调,请使用 A2 机器系列来访问专用 NVIDIA A100 GPU 资源。

A2 Ultra

挂接了 NVIDIA A100 80GB GPU
机器类型 vCPU 数量1 实例内存 (GB) 已挂接的本地 SSD (GiB) 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3
(GB HBM2e)
a2-ultragpu-1g 12 170 375 24 1 80
a2-ultragpu-2g 24 340 750 32 2 160
a2-ultragpu-4g 48 680 1500 50 4 320
a2-ultragpu-8g 96 1,360 3000 100 8 640

1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。

A2 标准

挂接了 NVIDIA A100 40GB GPU
机器类型 vCPU 数量1 实例内存 (GB) 支持本地 SSD 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3
(GB HBM2)
a2-highgpu-1g 12 85 24 1 40
a2-highgpu-2g 24 170 32 2 80
a2-highgpu-4g 48 340 50 4 160
a2-highgpu-8g 96 680 100 8 320
a2-megagpu-16g 96 1,360 100 16 640

1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。

G4 系列

如果您的团队需要经济实惠的入门级推理或标准图形渲染工作负载,请使用配备 NVIDIA RTX PRO 6000 GPU 的 G4 机器系列。

G4 机器类型使用 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU (nvidia-rtx-pro-6000),适用于 NVIDIA Omniverse 模拟工作负载、图形密集型应用、视频转码和虚拟桌面。与 A 系列机器类型相比,G4 机器类型还提供了一种低成本解决方案来执行单主机推理和模型调优。

挂接了 NVIDIA RTX PRO 6000 GPU
机器类型 vCPU 数量1 实例内存 (GB) 支持的最大 Titanium SSD (GiB)2 物理 NIC 数量 网络带宽上限 (Gbps)3 GPU 数量 GPU 内存4
(GB GDDR7)
g4-standard-6 6 22 0 1 20 1/8 12
g4-standard-12 12 45 375 1 20 1/4 24
g4-standard-24 24 90 750 1 20 1/2 48
g4-standard-48 48 180 1,500 1 50 1 96
g4-standard-96 96 360 3000 1 100 2 192
g4-standard-192 192 720 6000 1 200 4 384
g4-standard-384 384 1,440 12,000 2 400 8 768

*GPU 内存是 GPU 设备上可用的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理加速型工作负载(例如机器学习和图形密集型工作负载)的更高带宽需求。

G2 系列

如果您要部署主流的实时推理应用或检索增强生成 (RAG) 流水线,请使用 G2 机器系列,以便通过 NVIDIA L4 GPU 平衡性能和成本效益。

挂接了 NVIDIA L4 GPU
机器类型 vCPU 数量1 默认实例内存 (GB) 自定义实例内存范围 (GB) 支持的最大本地 SSD (GiB) 网络带宽上限 (Gbps)2 GPU 数量 GPU 内存3 (GB GDDR6)
g2-standard-4 4 16 16 - 32 375 10 1 24
g2-standard-8 8 32 32 - 54 375 16 1 24
g2-standard-12 12 48 48 - 54 375 16 1 24
g2-standard-16 16 64 54 - 64 375 32 1 24
g2-standard-24 24 96 96 - 108 750 32 2 48
g2-standard-32 32 128 96 - 128 375 32 1 24
g2-standard-48 48 192 192 - 216 1500 50 4 96
g2-standard-96 96 384 384 - 432 3000 100 8 192

1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。

N1 系列(NVIDIA T4 或 V100)

如果您优先考虑的是成本敏感型实验或运行低并发入门级推理,请使用 N1 机器系列来连接 NVIDIA T4 或 V100 GPU。

NVIDIA T4

加速器类型 GPU 数量 GPU 内存1 (GB GDDR6) vCPU 数量 实例内存 (GB) 支持本地 SSD
nvidia-tesla-t4
nvidia-tesla-t4-vws
1 16 1 - 48 1 - 312
2 32 1 - 48 1 - 312
4 64 1 - 96 1 - 624

NVIDIA V100

加速器类型 GPU 数量 GPU 内存1 (GB HBM2) vCPU 数量 实例内存 (GB) 支持本地固态硬盘2
nvidia-tesla-v100 1 16 1 - 12 1 - 78
2 32 1 - 24 1 - 156
4 64 1 - 48 1 - 312
8 128 1 - 96 1 - 624

容量获取

通用 GPU 加速器使用标准自助式预配。您可以通过标准预留、按需请求或 Spot 虚拟机获取容量。由于按需容量可能会出现缺货情况,因此请尽可能使用 Spot 虚拟机或灵活启动。

后续步骤