在通用 GPU 和集群 GPU 之间进行选择

本文档针对不同的人工智能 (AI)、机器学习 (ML) 和高性能计算 (HPC) 工作负载,提供了有关加速器、使用选项和部署工具的建议。本文档可帮助您确定最适合工作负载的部署。

如需了解有关 AI、机器学习和 HPC 工作负载的基础设施支柱的信息和建议,请参阅以下文档:

工作负载概览

AI Hypercomputer 架构支持以下用例:

工作负载 说明 建议
预训练基础模型 这涉及使用大型数据集构建语言模型。预训练基础模型的结果是获得一个擅长执行一般任务的新模型。
模型按大小分为以下几类:
  • 前沿模型:参数数量从数千亿到数万亿甚至更高的机器学习模型。其中包括 Gemini 等大语言模型 (LLM)。
  • 大型模型:参数数量在数百亿到数千亿或更高的机器学习模型。
请参阅 预训练模型的建议
微调 这涉及使用专门的数据集或其他技术,将训练好的模型调整为执行特定任务。 微调通常针对大型模型进行。 请参阅 有关微调模型的建议
推理或部署 这涉及使用经过训练或微调的模型,并使其可供用户或应用使用。
推理工作负载根据模型大小分为以下几类:
  • 跨多个主机的基础模型推理:使用参数数量从数千亿到数万亿甚至更高的已训练机器学习模型执行推理。对于这些推理工作负载,计算负载在多台宿主机之间共享。
  • 单主机基础模型推理:使用参数数量在数百亿到数千亿之间的已训练机器学习模型执行推理。对于这些推理工作负载,计算负荷仅限于单个宿主机。
  • 大型模型推理:使用参数数量在数百亿到数千亿之间的已训练或微调的机器学习模型执行推理。
请参阅 推理建议
适用于中小型模型的机器学习 这涉及训练和部署规模和复杂性较小的机器学习模型,通常用于更专业的任务。 请参阅 针对小型或中型模型的机器学习建议
HPC 这种做法用于聚合计算资源,获得的性能要优于单个工作站、服务器或计算机的性能。HPC 用于解决学术研究、科学、设计、模拟和商业智能方面的问题。 请参阅 HPC 建议

预训练模型的建议

为了预训练基础模型,大型加速器集群会持续读取大量数据。这些加速器通过前向和后向传递来调整权重,以便从数据中学习。这些训练作业一次运行数周甚至数月。

以下各部分概述了我们建议您用于预训练基础模型的加速器和使用选项。

推荐的加速器

如需在 Google Cloud上预训练基础模型,建议您使用A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化型机器类型,并使用编排器部署集群。

如需部署这些加速器集群,我们还建议您使用 Cluster DirectorCluster Toolkit。如需了解详情,请参阅下表中您选择的机器类型对应的集群部署指南。

工作负载 建议 集群部署指南
机器类型 编排程序
预训练基础模型
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE 创建具有默认配置的 AI 优化型 GKE 集群
Slurm
大型模型训练 A3 Ultra (NVIDIA H200 141GB) GKE 创建具有默认配置的 AI 优化型 GKE 集群
Slurm
大型模型训练
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在 Standard 模式集群中最大限度地提高 GPU 网络带宽
Slurm

建议的使用选项

为了确保获得大型加速器集群,我们建议使用预留。具体而言,为了最大限度地降低预留资源的费用,我们建议您申请的预留时长应足以获得承诺使用折扣。如需详细了解消费选项,请参阅选择消费选项

微调模型的建议

为了对大型基础模型进行微调,较小的加速器集群会读取中等量的数据。这些加速器会调整模型以执行特定任务。这些微调作业会运行数天甚至数周。

以下部分概述了微调模型时建议使用的加速器和消费选项。

如需在 Google Cloud上对模型进行微调,建议您使用 A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化机器类型,并使用编排器部署集群。

如需部署这些加速器集群,我们还建议您使用 Cluster DirectorCluster Toolkit。如需了解详情,请参阅下表中您选择的机器类型对应的集群部署指南。

工作负载 建议 集群部署指南
机器类型 编排程序
微调大型模型 A3 Ultra (NVIDIA H200 141GB) GKE 创建具有默认配置的 AI 优化型 GKE 集群
Slurm
微调大型模型
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在 Standard 模式集群中最大限度地提高 GPU 网络带宽
Slurm

建议的使用选项

对于微调工作负载,请使用日历模式下的未来预留来预配资源。如需详细了解使用选项,请参阅选择使用选项

关于推理建议

以下部分概述了在执行推理时建议使用的加速器和消费选项。

推荐的加速器

建议用于推理的加速器取决于您是执行多主机前沿模型推理/大型模型推理,还是单主机前沿模型推理。

推荐的加速器(多主机)

如需在 Google Cloud上执行多主机前沿或大模型推理,请使用 A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化型机器类型,并使用编排器部署机器。如需部署这些加速器集群,我们还建议您使用 Cluster Director Cluster Toolkit。下表提供了指向每种推荐机器类型的集群部署指南的链接。

工作负载 建议 集群部署指南
机器类型 编排程序
多主机前沿推理
  • A4X Max (NVIDIA GB300)
  • A4X (NVIDIA GB200)
  • A4 (NVIDIA B200)
GKE 创建具有默认配置的 AI 优化型 GKE 集群
Slurm
大型模型推理 A3 Ultra (NVIDIA H200 141GB) GKE 创建具有默认配置的 AI 优化型 GKE 集群
Slurm
大型模型推理
  • A3 Mega (NVIDIA H100 80GB)
  • A3 High (NVIDIA H100 80GB)
GKE 在 Standard 模式集群中最大限度地提高 GPU 网络带宽
Slurm

推荐的加速器(单主机)

下表列出了我们建议您用于执行单主机前沿推理的加速器。下表提供了指向每种推荐机器类型的虚拟机部署指南的链接。

工作负载 建议 虚拟机部署指南
机器类型 编排程序
单主机前沿推理和主流推理
  • A4 (NVIDIA B200)
  • A3 Ultra (NVIDIA H200 141GB)
不适用 创建 A4 或 A3 Ultra 实例
  • A3 High (NVIDIA H100 80GB)
  • A3 Edge (NVIDIA H100 80GB)
创建 A3 High 或 A3 Edge 实例
G4 (NVIDIA RTX PRO 6000) 创建 G4 实例
A2 (NVIDIA A100) 创建 A2 实例
G2 (NVIDIA L4) 创建 G2 实例
N1(NVIDIA T4 或 V100) 创建 N1 实例

建议的使用选项

对于推理,请使用长期预留或日历模式下的未来预留。如需详细了解消费选项,请参阅选择消费选项

针对小型或中型模型的建议

对于涉及中小型模型的机器学习工作负载,在价格和性能之间实现最佳平衡是主要考虑因素。

推荐的加速器

下表概述了建议用于中小型模型机器学习工作负载的加速器。

工作负载 建议 虚拟机部署指南
机器类型 编排程序
适用于中小型模型的 ML G4 (NVIDIA RTX PRO 6000) 不适用 创建 G4 实例
G2 (NVIDIA L4) 创建 G2 实例
A2 (NVIDIA A100) 创建 A2 实例
A3 Edge (NVIDIA H100 80GB) 创建 A3 Edge 实例
N1(NVIDIA T4 或 V100) 创建 N1 实例

HPC 建议

对于 HPC 工作负载,任何加速器优化机器系列计算优化机器系列都适合。 如果使用加速器优化机器系列,最佳选择取决于必须分流到 GPU 的计算量。如需详细了解有关 HPC 工作负载的建议,请参阅运行 HPC 工作负载的最佳实践

建议摘要

下表总结了每种工作负载的推荐加速器和消费选项。

资源 建议
模型预训练
机器家族 使用以下任一加速器优化型机器类型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB)
使用选项 “使用标准未来预留
模型微调
机器家族 使用 A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化机器类型
使用选项 “使用标准未来预留
推理
机器家族 使用以下任一机器类型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB)、G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100)
使用选项 使用预留、按需或 Spot
适用于中小型模型的 ML
机器家族 使用以下任一机器类型:G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100)
使用选项 使用按需预留、Spot 预留或标准预留
存储 使用 Cloud Storage FUSE
HPC
请参阅运行 HPC 工作负载的最佳实践的摘要部分

后续步骤