如需高效运行人工智能 (AI) 或机器学习 (ML) 工作负载,您必须同时选择工作负载编排器和部署平台。这些组件的功能如下:
编排器会安排并运行作业。
部署选项用于管理编排器。
确定要使用哪种 GPU 基础设施(集群 GPU 或通用 GPU)来运行工作负载后,请按照本文档中的指南确定最适合您的工作负载和管理级别的编排器和部署。
如需查看可用于运行工作负载的 GPU 机器类型,请参阅 GPU 机器。
比较编排器和部署选项
AI Hypercomputer 为您的计算实例提供了多种编排器和部署选项。这些选项包括全代管式集群(可让您专注于工作负载)和自行管理的环境(可让您精细控制计算实例的维护和更新方式)。
下表比较了运行 AI 工作负载时可使用的编排器和部署选项:
| 产品 | 编排程序 | 技术复杂性 | 建议用于 | 关键优势 |
|---|---|---|---|---|
| Cluster Director | Slurm | 低 | AI 研究人员、数据科学家 | Slurm 集群的托管式生命周期 |
| Google Kubernetes Engine (GKE) | Kubernetes | 中至高 | 机器学习工程师、平台工程师 | 容器编排和伸缩 |
| Cluster Toolkit | Slurm、Kubernetes | 中 | ML dZevOps、平台工程师 | 经过验证的基础设施即代码蓝图 |
| Compute Engine | 自定义 / 无 | 高 | 基础架构架构师 | 对操作系统和网络进行精细控制 |
选择编排器和部署选项
如需选择编排程序和部署选项,请使用以下流程图:
上述流程图提出了以下问题:
您是否希望为工作负载进行集群编排?
- 是:请前往第 2 题。
- 否:使用 Compute Engine。
您是否要运行标准容器化应用?
- 是:使用 GKE。
- 否:请前往第 3 题。
您是否希望 Google 管理集群生命周期?
- 是:使用 Cluster Director。
- 否:使用 Cluster Toolkit。
支持的编排器
编排程序可自动管理集群,无需单独管理每个计算实例。Slurm 或 Kubernetes 等编排器可处理作业排队、资源分配和自动扩缩。
Slurm:一种开源编排器,通常用于 AI、机器学习和 HPC 工作负载。您可以将 Slurm 与 Cluster Toolkit 或 Cluster Director 搭配使用。
Kubernetes:一个开源容器编排平台。您可以使用 GKE 直接部署 Kubernetes,也可以通过 Cluster Toolkit 部署。
自定义或无:如果您偏好其他编排器,或者想要在没有编排器的情况下管理计算实例,请使用 Compute Engine。 此选项可提供最高级别的控制,但需要您手动设置、维护和更新计算实例。
支持的部署平台
确定适合您的使用情形的推荐编排器和部署选项后,请查看以下说明,确认其管理级别和功能是否满足您的工作负载要求。
托管式自动化平台
如果您想避免管理集群的开销,而是专注于运行工作负载,请使用以下托管平台之一:
Cluster Director:一项全代管式服务,可自动管理 Slurm 集群的生命周期。使用 Cluster Director 可简化 Slurm 集群的设置和配置。Cluster Director 可自动管理集群的生命周期,让您可以专注于运行 AI、机器学习或 HPC 工作负载。如需了解详情,请参阅 Cluster Director 概览。
GKE:一种针对 AI 和 ML 工作负载优化的托管式 Kubernetes 环境。使用 GKE 来编排容器化工作负载、与专用 Compute Engine 硬件集成,并利用 GKE 特有的功能,例如拓扑感知调度 (TAS)。如需了解详情,请参阅 GKE 概览。
半托管式平台和自行管理的平台
如果您需要对操作系统、内核配置或驱动程序版本进行精细控制,请使用半托管或自托管平台:
Cluster Toolkit:一种开源工具包,可提供经过验证的可自定义蓝图,用于部署可重现的 AI 和 ML 环境。它采用基础设施即代码 (IaC) 原则,可提供高度的灵活性和控制力。如需了解详情,请参阅 Cluster Toolkit 概览。
Compute Engine:一项可自定义的计算服务,可提供最大程度的控制,让您从头开始构建自定义环境。虽然 Compute Engine 不是独立的编排器,但对于喜欢构建和管理自己的专用自定义堆栈的用户来说,它可作为基础。如需了解详情,请参阅 Compute Engine 概览。