通用 GPU 针对以下人工智能 (AI) 和机器学习 (ML) 工作负载进行了优化:优先考虑运营灵活性、资源独立性和成本效益。
借助通用 GPU,团队可以完全自主地部署和扩缩 NVIDIA 加速器,从而绕过协调式超级计算集群的架构复杂性。它们非常适合优先考虑高可用性、自助服务配置和独立伸缩的工作负载。常见用例包括实时推理、RAG、原型设计以及中小型模型训练。
通用 GPU 的主要特征
- 操作灵活性:您可以使用标准 GKE(Autopilot 和 Standard)和 Compute Engine 接口来管理资源,从而简化部署和伸缩。
- 高可用性: Google Cloud 独立更新各个实例,以帮助确保一个节点上的更新不会影响其他节点的可用性,从而使负载均衡器能够重定向流量,而不会导致服务舰队停滞。
- 网络简单易用:工作负载使用标准虚拟私有云 (VPC) 服务和标准 TCP/IP over Google 虚拟 NIC (gVNIC) 接口,无需复杂的硬件级光纤交换结构。
- 费用优化:您可以将 Spot 虚拟机用于容错型研究,与标准按需费率相比,可节省高达 90% 的费用。
- 自助获取:您可以直接通过标准预留和按需请求获取容量,而无需使用由客户服务团队管理的工作流。
常规 GPU 系列和技术规格
查看通用 GPU 机器系列的工作负载和硬件规格。如需实现高吞吐量服务,请使用 A3 Edge 系列。
A3 系列(High,具有 1 个、2 个或 4 个 GPU;Edge)
A3 High(1、2 或 4 个 GPU)
如果您运行的推理或标准训练工作负载需要高性能,但不需要完整的 8-GPU 同步集群,请使用附加了 1 个、2 个或 4 个 GPU 的 A3 High 机器系列。
A3 High 机器类型配备 NVIDIA H100 SXM GPU,非常适合大型模型推理和模型微调。
| 挂接了 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3) |
a3-highgpu-1g |
26 | 234 | 750 | 1 | 25 | 1 | 80 |
a3-highgpu-2g |
52 | 468 | 1,500 | 1 | 50 | 2 | 160 |
a3-highgpu-4g |
104 | 936 | 3000 | 1 | 100 | 4 | 320 |
a3-highgpu-8g |
208 | 1,872 | 6000 | 5 | 1000 | 8 | 640 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A3 Edge
如果您要在多个主机上运行高吞吐量分布式推理工作负载,但没有协调的集群结构,请使用 A3 Edge 系列来简化通过标准虚拟专用网络的部署。
A3 Edge 机器类型配备 NVIDIA H100 SXM GPU,专为部署而设计,在部分区域提供。
| 挂接了 NVIDIA H100 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 物理 NIC 数量 | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM3) |
a3-edgegpu-8g |
208 | 1,872 | 6000 | 5 |
|
8 | 640 |
A2 系列(标准版和 Ultra 版)
如果您需要执行高性能单节点模型部署或小规模模型微调,请使用 A2 机器系列来访问专用 NVIDIA A100 GPU 资源。
A2 Ultra
| 挂接了 NVIDIA A100 80GB GPU | ||||||
|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 已挂接的本地 SSD (GiB) | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM2e) |
a2-ultragpu-1g |
12 | 170 | 375 | 24 | 1 | 80 |
a2-ultragpu-2g |
24 | 340 | 750 | 32 | 2 | 160 |
a2-ultragpu-4g |
48 | 680 | 1500 | 50 | 4 | 320 |
a2-ultragpu-8g |
96 | 1,360 | 3000 | 100 | 8 | 640 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
A2 标准
| 挂接了 NVIDIA A100 40GB GPU | ||||||
|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 支持本地 SSD | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB HBM2) |
a2-highgpu-1g |
12 | 85 | 是 | 24 | 1 | 40 |
a2-highgpu-2g |
24 | 170 | 是 | 32 | 2 | 80 |
a2-highgpu-4g |
48 | 340 | 是 | 50 | 4 | 160 |
a2-highgpu-8g |
96 | 680 | 是 | 100 | 8 | 320 |
a2-megagpu-16g |
96 | 1,360 | 是 | 100 | 16 | 640 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
G4 系列
如果您的团队需要经济实惠的入门级推理或标准图形渲染工作负载,请使用配备 NVIDIA RTX PRO 6000 GPU 的 G4 机器系列。
G4
机器类型使用
NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU (nvidia-rtx-pro-6000),适用于 NVIDIA Omniverse 模拟工作负载、图形密集型应用、视频转码和虚拟桌面。与 A 系列机器类型相比,G4 机器类型还提供了一种低成本解决方案来执行单主机推理和模型调优。
| 挂接了 NVIDIA RTX PRO 6000 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 实例内存 (GB) | 支持的最大 Titanium SSD (GiB)2 | 物理 NIC 数量 | 网络带宽上限 (Gbps)3 | GPU 数量 | GPU 内存4 (GB GDDR7) |
g4-standard-6 |
6 | 22 | 0 | 1 | 20 | 1/8 | 12 |
g4-standard-12 |
12 | 45 | 375 | 1 | 20 | 1/4 | 24 |
g4-standard-24 |
24 | 90 | 750 | 1 | 20 | 1/2 | 48 |
g4-standard-48 |
48 | 180 | 1,500 | 1 | 50 | 1 | 96 |
g4-standard-96 |
96 | 360 | 3000 | 1 | 100 | 2 | 192 |
g4-standard-192 |
192 | 720 | 6000 | 1 | 200 | 4 | 384 |
g4-standard-384 |
384 | 1,440 | 12,000 | 2 | 400 | 8 | 768 |
*GPU 内存是 GPU 设备上可用的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理加速型工作负载(例如机器学习和图形密集型工作负载)的更高带宽需求。
G2 系列
如果您要部署主流的实时推理应用或检索增强生成 (RAG) 流水线,请使用 G2 机器系列,以便通过 NVIDIA L4 GPU 平衡性能和成本效益。
| 挂接了 NVIDIA L4 GPU | |||||||
|---|---|---|---|---|---|---|---|
| 机器类型 | vCPU 数量1 | 默认实例内存 (GB) | 自定义实例内存范围 (GB) | 支持的最大本地 SSD (GiB) | 网络带宽上限 (Gbps)2 | GPU 数量 | GPU 内存3 (GB GDDR6) |
g2-standard-4 |
4 | 16 | 16 - 32 | 375 | 10 | 1 | 24 |
g2-standard-8 |
8 | 32 | 32 - 54 | 375 | 16 | 1 | 24 |
g2-standard-12 |
12 | 48 | 48 - 54 | 375 | 16 | 1 | 24 |
g2-standard-16 |
16 | 64 | 54 - 64 | 375 | 32 | 1 | 24 |
g2-standard-24 |
24 | 96 | 96 - 108 | 750 | 32 | 2 | 48 |
g2-standard-32 |
32 | 128 | 96 - 128 | 375 | 32 | 1 | 24 |
g2-standard-48 |
48 | 192 | 192 - 216 | 1500 | 50 | 4 | 96 |
g2-standard-96 |
96 | 384 | 384 - 432 | 3000 | 100 | 8 | 192 |
1每个 vCPU 是在其中一个可用的 CPU 平台上以单个硬件超线程的形式实现的。
2 出站流量带宽上限不能超过给定的数量。实际的出站带宽取决于目的地 IP 地址和其他因素。如需详细了解网络带宽,请参阅网络带宽。
3GPU 内存是 GPU 设备上的内存,可用于临时存储数据。它与实例的内存分开,专门用于处理图形密集型工作负载的更高带宽需求。
N1 系列(NVIDIA T4 或 V100)
如果您优先考虑的是成本敏感型实验或运行低并发入门级推理,请使用 N1 机器系列来连接 NVIDIA T4 或 V100 GPU。
NVIDIA T4
| 加速器类型 | GPU 数量 | GPU 内存1 (GB GDDR6) | vCPU 数量 | 实例内存 (GB) | 支持本地 SSD |
|---|---|---|---|---|---|
nvidia-tesla-t4 或 nvidia-tesla-t4-vws
|
1 | 16 | 1 - 48 | 1 - 312 | 是 |
| 2 | 32 | 1 - 48 | 1 - 312 | 是 | |
| 4 | 64 | 1 - 96 | 1 - 624 | 是 |
NVIDIA V100
| 加速器类型 | GPU 数量 | GPU 内存1 (GB HBM2) | vCPU 数量 | 实例内存 (GB) | 支持本地固态硬盘2 |
|---|---|---|---|---|---|
nvidia-tesla-v100 |
1 | 16 | 1 - 12 | 1 - 78 | 是 |
| 2 | 32 | 1 - 24 | 1 - 156 | 是 | |
| 4 | 64 | 1 - 48 | 1 - 312 | 是 | |
| 8 | 128 | 1 - 96 | 1 - 624 | 是 |
容量获取
通用 GPU 加速器使用标准自助式预配。您可以通过标准预留、按需请求或 Spot 虚拟机获取容量。由于按需容量可能会出现缺货情况,因此请尽可能使用 Spot 虚拟机或灵活启动。
后续步骤
- 如需了解如何获取容量,请参阅消费选项。
- 如需评估您的基础架构要求,请参阅选择基础架构。
- 如需查看 GPU 的网络服务,请参阅 GPU 网络概览。
- 如需查看启动集群时需要做出的流程和选择,请参阅规划和创建 AI 基础设施。