GPU 加速器简介

AI Hypercomputer 提供垂直集成的基础设施,经过优化可满足严苛的人工智能 (AI) 和机器学习 (ML) 工作负载的需求。高性能 NVIDIA GPU 根据系统处理其生命周期事件和维护的方式分为两类:常规 GPU 和集群 GPU。

如需确定适合工作负载的最佳基础设施类别,请参阅选择加速器基础设施

通用 GPU

通用 GPU 作为独立的计算单元进行管理,通过使用标准 Compute Engine 和 Google Kubernetes Engine (GKE) API 直接与 Google Cloud的控制平面集成。

通用 GPU 包括以下机器系列:

集群 GPU

集群 GPU 由 Cluster Director 管理,是一个由数千个互联加速器组成的紧密耦合的单一系统。

集群 GPU 包括以下机器系列:

GPU 性能注意事项

为了评估和优化工作负载的性能,您可以跟踪 CUDA 核心和 Tensor 核心利用率等硬件级指标。如需监控资源并评估常规环境和集群环境中的性能,请参阅以下内容:

  • 监控信息中心:跟踪各个独立实例或编排的集群舰队的实时 GPU 利用率和内存用量。
  • 有效吞吐量指标配方:衡量加速器执行有效计算的时间百分比与系统开销,强烈建议在集群硬件上进行大规模分布式训练时使用。

后续步骤