选择加速器基础设施

本文档可帮助您根据生命周期阶段(例如小规模原型设计、实时推理和大规模分布式训练)确定适合您的人工智能 (AI) 和机器学习 (ML) 工作负载的最佳加速器基础架构。AI Hypercomputer 将加速器产品分为两 类:通用 GPU集群式 GPU

GPU 基础架构

AI Hypercomputer 提供两种截然不同的 GPU 类别。每个类别都有不同的管理模型,该模型决定了系统如何处理生命周期事件、管理维护以及优化工作负载的网络:

通用 GPU 管理模型

通用 GPU 管理模型专为优先考虑资源独立性和高可用性的工作负载而设计。此 模型使用标准 Google Cloud 管理平面,为已在使用 Compute Engine 或 GKE 的团队提供熟悉的 体验。

  • 维护: 异步。各个实例会独立更新。在多节点服务舰队中,一个节点上的维护事件不会影响其他节点的可用性,从而允许将流量重定向到运行状况良好的节点,而不会使整个作业停滞。

  • 主要用例: 建议用于实时推理、模型部署、小规模原型设计和开发环境等主流任务,这些任务不需要超级计算规模。

通用 GPU 机器系列

以下机器系列是通用 GPU:

  • 具有 1、2 或 4 个 GPU 的 A3 High
  • A3 Edge
  • A2
  • G4
  • G2
  • N1+T4
  • N1+V100

如需了解有关每台通用 GPU 机器的技术信息,请参阅 GPU 机器类型

集群式 GPU 管理模型

集群式 GPU 管理模型是一种超级计算级环境,专为大规模分布式训练而设计。资源通过使用集群式 GPU 堆栈作为单个紧密耦合的系统进行管理。

  • 维护: 协调。此模型协调维护事件以支持紧密耦合的工作负载。对于分布式训练,您可以使用同步维护,即同时在所有节点上应用更新。这种方法可防止节点重启导致作业停滞,并最大限度地提高 goodput。此模型还提供 90 天的维护通知。

  • 主要用例: 专为训练具有数万亿个参数的百亿亿级基础模型或运行复杂的高性能计算 (HPC) 模拟(例如药物发现和蛋白质折叠)而设计。

集群式 GPU 机器系列

以下机器系列是集群式 GPU:

  • A4X Max
  • A4X
  • A4
  • A3 Ultra
  • A3 Mega
  • 具有 8 个 GPU 的 A3 High

如需了解有关每台集群式 GPU 机器的技术信息,请参阅 GPU 机器类型

功能矩阵

比较通用 GPU 和集群式 GPU 管理模型的技术和运营特征:

特征 通用 GPU 管理模型 集群式 GPU 管理模型
主要用例 推理、模型部署、原型设计和开发 大规模分布式训练和 HPC
维护 异步: 独立的节点更新允许重定向流量,而不会使作业停滞 协调: 支持集群范围内的协调(同步)更新,以保持节点同步并最大限度地提高 goodput
目标硬件 A3 High(1、2 或 4 个 GPU)A3 EdgeG4G2A2N1+T4N1+V100 A4XA4A3 UltraA3 MegaA3 High(8 个 GPU)
网络 通过 gVNIC 接口的标准 VPC 网络(A3 Edge 除外,它通过多个 VPC 使用 GPUDirect-TCPX) 专用低延迟网络结构(RDMA、RoCE、TCPX 或 NVIDIA NVLink)
管理堆栈 标准 Google Cloud 平面(Compute Engine 或 GKE) 专用管理堆栈(例如 Cluster Director)
可靠性 标准节点自动修复和 Pod 级正常运行时间 专用资源和恢复套件

决策矩阵

使用此矩阵确定哪些硬件系列与您的特定工作负载意图一致:

如果您的工作负载涉及... 推荐的 GPU 基础架构 推荐的机器系列
原型设计和开发 通用 GPU A3 High(1、2 或 4 个 GPU)A3 EdgeA2G4G2N1+T4N1+V100
实时推理(< 1000 亿个参数) 通用 GPU A3 High(1、2 或 4 个 GPU)A3 EdgeA2G4G2N1+T4N1+V100
跨多个 GPU 进行推理 集群式 GPU A4A3 UltraA3 MegaA3 High(8 个 GPU)
大规模训练和推理 集群式 GPU A4A3 UltraA3 MegaA3 High(8 个 GPU)
大规模训练(> 5000 亿个参数)和分离式推理 集群式 GPU A4X MaxA4XA4

如需详细了解如何将模型架构直接映射到硬件的决策树,请参阅 选择加速器

确定这些主要条件后,选择编排平台。 此选择取决于您的团队对自动管理或对操作系统和驱动程序进行精细控制的偏好。

后续步骤