AI Hypercomputer 提供垂直集成的基础设施,经过优化可满足严苛的人工智能 (AI) 和机器学习 (ML) 工作负载的需求。高性能 NVIDIA GPU 根据系统处理其生命周期事件和维护的方式分为两类:常规 GPU 和集群 GPU。
如需确定适合工作负载的最佳基础设施类别,请参阅选择加速器基础设施。
通用 GPU
通用 GPU 作为独立的计算单元进行管理,通过使用标准 Compute Engine 和 Google Kubernetes Engine (GKE) API 直接与 Google Cloud的控制平面集成。
通用 GPU 包括以下机器系列:
- 配备 1、2 或 4 个 (NVIDIA H100) GPU 的 A3 High:针对不需要 8 个 GPU 同步集群的标准训练和推理工作负载进行了优化。
- A3 Edge (NVIDIA H100):针对推理进行了优化,可使用标准 VPC 网络在多个主机之间以高吞吐量进行分布式推理。
- A2 (NVIDIA A100): 针对高性能单节点服务和小规模微调进行了优化。
- G4 (NVIDIA RTX PRO 6000):经过优化,可经济高效地处理入门级推理和图形工作负载。
- G2 (NVIDIA L4):针对主流推理和 RAG 进行了优化。
- N1(NVIDIA T4 或 V100):针对入门级推理和研究任务进行了优化,优先考虑成本而非高性能互连。
集群 GPU
集群 GPU 由 Cluster Director 管理,是一个由数千个互联加速器组成的紧密耦合的单一系统。
集群 GPU 包括以下机器系列:
- A4X Max (NVIDIA GB300):专为裸机艾级训练和高性能计算而设计,搭载 NVIDIA GB300 Grace Blackwell Ultra 超级芯片。
- A4X (NVIDIA GB200) 和 A4 (NVIDIA B200):专为基础模型训练和艾级基础模型训练而设计。
- A3 Ultra (NVIDIA H200)、A3 Mega (NVIDIA H100) 和 A3 High(配备 8 个 NVIDIA H100 GPU):针对大规模分布式训练和涉及海量数据表的多主机推理进行了优化。
GPU 性能注意事项
为了评估和优化工作负载的性能,您可以跟踪 CUDA 核心和 Tensor 核心利用率等硬件级指标。如需监控资源并评估常规环境和集群环境中的性能,请参阅以下内容:
后续步骤
- 如需评估基础设施要求,请参阅选择加速器基础设施。
- 如需查看启动集群时的流程和选择,请参阅规划和创建 AI 基础设施。