本文档针对不同的人工智能 (AI)、机器学习 (ML) 和高性能计算 (HPC) 工作负载,提供了有关加速器、使用选项和部署工具的建议。本文档可帮助您确定最适合工作负载的部署。
如需了解有关 AI、机器学习和 HPC 工作负载的基础设施支柱的信息和建议,请参阅以下文档:
工作负载概览
AI Hypercomputer 架构支持以下用例:
| 工作负载 | 说明 | 建议 |
|---|---|---|
| 预训练基础模型 | 这涉及使用大型数据集构建语言模型。预训练基础模型的结果是获得一个擅长执行一般任务的新模型。 模型按大小分为以下几类:
|
请参阅 预训练模型的建议 |
| 微调 | 这涉及使用专门的数据集或其他技术,将训练好的模型调整为执行特定任务。 微调通常针对大型模型进行。 | 请参阅 有关微调模型的建议 |
| 推理或部署 | 这涉及使用经过训练或微调的模型,并使其可供用户或应用使用。 推理工作负载根据模型大小分为以下几类:
|
请参阅 推理建议 |
| 适用于中小型模型的机器学习 | 这涉及训练和部署规模和复杂性较小的机器学习模型,通常用于更专业的任务。 | 请参阅 针对小型或中型模型的机器学习建议 |
| HPC | 这种做法用于聚合计算资源,获得的性能要优于单个工作站、服务器或计算机的性能。HPC 用于解决学术研究、科学、设计、模拟和商业智能方面的问题。 | 请参阅 HPC 建议 |
预训练模型的建议
为了预训练基础模型,大型加速器集群会持续读取大量数据。这些加速器通过前向和后向传递来调整权重,以便从数据中学习。这些训练作业一次运行数周甚至数月。
以下各部分概述了我们建议您用于预训练基础模型的加速器和使用选项。
推荐的加速器
如需在 Google Cloud上预训练基础模型,建议您使用A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化型机器类型,并使用编排器部署集群。
如需部署这些加速器集群,我们还建议您使用 Cluster Director 或 Cluster Toolkit。如需了解详情,请参阅下表中您选择的机器类型对应的集群部署指南。
| 工作负载 | 建议 | 集群部署指南 | |
|---|---|---|---|
| 机器类型 | 编排程序 | ||
| 预训练基础模型 |
|
GKE | 创建具有默认配置的 AI 优化型 GKE 集群 |
| Slurm | |||
| 大型模型训练 | A3 Ultra (NVIDIA H200 141GB) | GKE | 创建具有默认配置的 AI 优化型 GKE 集群 |
| Slurm | |||
| 大型模型训练 |
|
GKE | 在 Standard 模式集群中最大限度地提高 GPU 网络带宽 |
| Slurm | |||
建议的使用选项
为了确保获得大型加速器集群,我们建议使用预留。具体而言,为了最大限度地降低预留资源的费用,我们建议您申请的预留时长应足以获得承诺使用折扣。如需详细了解消费选项,请参阅选择消费选项。
微调模型的建议
为了对大型基础模型进行微调,较小的加速器集群会读取中等量的数据。这些加速器会调整模型以执行特定任务。这些微调作业会运行数天甚至数周。
以下部分概述了微调模型时建议使用的加速器和消费选项。
推荐的加速器
如需在 Google Cloud上对模型进行微调,建议您使用 A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化机器类型,并使用编排器部署集群。
如需部署这些加速器集群,我们还建议您使用 Cluster Director 或 Cluster Toolkit。如需了解详情,请参阅下表中您选择的机器类型对应的集群部署指南。
| 工作负载 | 建议 | 集群部署指南 | |
|---|---|---|---|
| 机器类型 | 编排程序 | ||
| 微调大型模型 | A3 Ultra (NVIDIA H200 141GB) | GKE | 创建具有默认配置的 AI 优化型 GKE 集群 |
| Slurm | |||
| 微调大型模型 |
|
GKE | 在 Standard 模式集群中最大限度地提高 GPU 网络带宽 |
| Slurm | |||
建议的使用选项
对于微调工作负载,请使用日历模式下的未来预留来预配资源。如需详细了解使用选项,请参阅选择使用选项。
关于推理建议
以下部分概述了在执行推理时建议使用的加速器和消费选项。
推荐的加速器
建议用于推理的加速器取决于您是执行多主机前沿模型推理/大型模型推理,还是单主机前沿模型推理。
推荐的加速器(多主机)
如需在 Google Cloud上执行多主机前沿或大模型推理,请使用 A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化型机器类型,并使用编排器部署机器。如需部署这些加速器集群,我们还建议您使用 Cluster Director 或 Cluster Toolkit。下表提供了指向每种推荐机器类型的集群部署指南的链接。
| 工作负载 | 建议 | 集群部署指南 | |
|---|---|---|---|
| 机器类型 | 编排程序 | ||
| 多主机前沿推理 |
|
GKE | 创建具有默认配置的 AI 优化型 GKE 集群 |
| Slurm | |||
| 大型模型推理 | A3 Ultra (NVIDIA H200 141GB) | GKE | 创建具有默认配置的 AI 优化型 GKE 集群 |
| Slurm | |||
| 大型模型推理 |
|
GKE | 在 Standard 模式集群中最大限度地提高 GPU 网络带宽 |
| Slurm | |||
推荐的加速器(单主机)
下表列出了我们建议您用于执行单主机前沿推理的加速器。下表提供了指向每种推荐机器类型的虚拟机部署指南的链接。
| 工作负载 | 建议 | 虚拟机部署指南 | |
|---|---|---|---|
| 机器类型 | 编排程序 | ||
| 单主机前沿推理和主流推理 |
|
不适用 | 创建 A4 或 A3 Ultra 实例 |
|
创建 A3 High 或 A3 Edge 实例 | ||
| G4 (NVIDIA RTX PRO 6000) | 创建 G4 实例 | ||
| A2 (NVIDIA A100) | 创建 A2 实例 | ||
| G2 (NVIDIA L4) | 创建 G2 实例 | ||
| N1(NVIDIA T4 或 V100) | 创建 N1 实例 | ||
建议的使用选项
对于推理,请使用长期预留或日历模式下的未来预留。如需详细了解消费选项,请参阅选择消费选项。
针对小型或中型模型的建议
对于涉及中小型模型的机器学习工作负载,在价格和性能之间实现最佳平衡是主要考虑因素。
推荐的加速器
下表概述了建议用于中小型模型机器学习工作负载的加速器。
| 工作负载 | 建议 | 虚拟机部署指南 | |
|---|---|---|---|
| 机器类型 | 编排程序 | ||
| 适用于中小型模型的 ML | G4 (NVIDIA RTX PRO 6000) | 不适用 | 创建 G4 实例 |
| G2 (NVIDIA L4) | 创建 G2 实例 | ||
| A2 (NVIDIA A100) | 创建 A2 实例 | ||
| A3 Edge (NVIDIA H100 80GB) | 创建 A3 Edge 实例 | ||
| N1(NVIDIA T4 或 V100) | 创建 N1 实例 | ||
HPC 建议
对于 HPC 工作负载,任何加速器优化机器系列或计算优化机器系列都适合。 如果使用加速器优化机器系列,最佳选择取决于必须分流到 GPU 的计算量。如需详细了解有关 HPC 工作负载的建议,请参阅运行 HPC 工作负载的最佳实践。
建议摘要
下表总结了每种工作负载的推荐加速器和消费选项。
| 资源 | 建议 |
|---|---|
| 模型预训练 | |
| 机器家族 | 使用以下任一加速器优化型机器类型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) |
| 使用选项 | “使用标准未来预留 |
| 模型微调 | |
| 机器家族 | 使用 A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB) 或 A3 High (NVIDIA H100 80GB) 加速器优化机器类型 |
| 使用选项 | “使用标准未来预留 |
| 推理 | |
| 机器家族 | 使用以下任一机器类型:A4X Max (NVIDIA GB300)、A4X (NVIDIA GB200)、A4 (NVIDIA B200)、A3 Ultra (NVIDIA H200 141GB)、A3 Mega (NVIDIA H100 80GB)、A3 High (NVIDIA H100 80GB)、G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100) |
| 使用选项 | 使用预留、按需或 Spot |
| 适用于中小型模型的 ML | |
| 机器家族 | 使用以下任一机器类型:G2 (NVIDIA L4)、G4 (NVIDIA RTX PRO 6000)、A2 (NVIDIA A100)、A3 Edge (NVIDIA H100 80GB) 或 N1 (NVIDIA T4 或 V100) |
| 使用选项 | 使用按需预留、Spot 预留或标准预留 |
| 存储 | 使用 Cloud Storage FUSE |
| HPC | |
| 请参阅运行 HPC 工作负载的最佳实践的摘要部分 | |
后续步骤
- 了解如何创建 AI 优化型 GKE 集群。
- 了解如何创建全代管式 Slurm 集群。
- 了解如何创建 AI 优化实例。