AI Hypercomputer 概览

AI Hypercomputer 是一种集成式超级计算系统,经过优化可支持人工智能 (AI) 和机器学习 (ML) 工作负载。 它是 Google CloudGoogle Cloud AI 基础架构的统一产品组合,提供了一个 入口点,用于探索、配置和部署性能优化型 硬件、开放软件和灵活的使用模式。

AI Hypercomputer 融入了系统级设计和最佳实践,可提升整个 AI 开发生命周期(从原型设计和开发到大规模训练和实时部署)的效率。

系统架构

AI Hypercomputer 垂直集成了以下三个组件,以 最大限度地提高 有效吞吐量( 衡量实际机器学习生产力的指标):

  • 性能优化型基础架构:提供加速器(NVIDIA GPU 和 Google Cloud TPU)、网络和存储资源。
    • GPU:根据系统处理其生命周期事件 和维护的方式进行分类:
      • 通用 GPU:作为独立的计算单元进行基础架构 管理,并采用异步维护。
      • 集群式 GPU:作为单个紧密耦合的系统进行高性能 集群管理,并采用同步 维护。
    • TPU:使用专为执行大型矩阵运算而设计的硬件, 并具有片上高带宽内存 (HBM),可用于处理更大的模型和批次 大小。TPU 可以连接在名为切片的组中,这让您可以在几乎不需要更改代码的情况下对工作负载进行扩容。 如需了解 TPU 基础架构,请参阅 Cloud TPU 文档
  • 开放软件:提供机器学习框架 (PyTorch、JAX 和 TensorFlow)和编排平台的优化版本。如需部署和管理加速器,您可以从以下选项中进行选择:
    • Google Kubernetes Engine,用于自动伸缩容器原生应用
    • 通过 Cluster Director 使用 Slurm
    • Cluster Toolkit 蓝图
  • 使用选项:根据您的 工作负载需求提供灵活的预配选项:
    • 灵活启动虚拟机Spot 虚拟机预留:为不同的工作负载提供灵活的选项。
    • 动态工作负载调度器: 为大规模训练提供互连节点的整个块的原子预配 。

福利

  • 高性能和有效吞吐量:优化调度和运行时层 以最大限度地提高有效吞吐量,帮助加速器将更多时间用于高效 计算,减少用于系统开销的时间。
  • 集成可靠性:获享专用可靠性功能:
    • 集群式 GPU:包括自动 硬件运行状况监控和主动节点替换。
    • 通用 GPU:使用标准 Google Cloud 节点自动修复来维持部署 舰队的 pod 级正常运行时间。
  • 优化存储:使用高吞吐量存储服务(例如 Google Cloud Managed Lustre 和 Cloud Storage Rapid)来消除 I/O 瓶颈。

使用场景

AI Hypercomputer 可满足以下使用场景的需求:

使用场景 示例工作负载
大规模 AI 和机器学习工作负载
  • 生成式 AI 的分布式训练
  • 生成式 AI 的推理
  • 欺诈检测
  • 推荐模型
推理和模型部署
  • 实时欺诈检测
  • 实时结果的推荐引擎
原型设计和开发
  • 小规模实验
  • 早期开发

后续步骤