查看 GKE 节点拓扑

本文档介绍如何在 A4X Max、A4X、A4、A3 Ultra、A3 Mega 和 A3 High Compute Engine 实例上查看 Google Kubernetes Engine (GKE) 节点的物理拓扑。了解节点的物理位置有助于您优化 AI 工作负载的 Pod 放置。

准备工作

在开始之前,请确保您已执行以下任务:

  • 启用 Google Kubernetes Engine API。
  • 启用 Google Kubernetes Engine API
  • 如果您要使用 Google Cloud CLI 执行此任务,请安装初始化 gcloud CLI。如果您之前安装了 gcloud CLI,请通过运行 gcloud components update 命令来获取最新版本。较早版本的 gcloud CLI 可能不支持运行本文档中的命令。

连接到集群

  • 运行以下命令以连接到您的集群:

    gcloud container clusters get-credentials CLUSTER_NAME
    

    CLUSTER_NAME 替换为您的集群名称。

了解 GKE 节点拓扑

您可以参考以下节点标签,了解 A4X Max、A4X、A4 和 A3 Ultra Compute Engine 实例上 GKE 节点的物理拓扑:

  • cloud.google.com/gce-topology-block:虚拟机所在预留块的组织专用 ID。是由一层分布式网络结构连接的子块集合。
  • cloud.google.com/gce-topology-subblock:虚拟机所在子块的组织专用 ID。子区块是一组主机和关联的连接硬件:
    • 对于 A4 和 A3 Ultra 虚拟机,主机通过大规模分布式 Jupiter 网络结构连接。
    • A4X Max 和 A4X Compute Engine 实例分为多个子块,每个子块构成一个 NVIDIA NVLink 网域 (NVL72)。在每个 NVL72 中,GPU 通过专用高带宽 NVLink 架构紧密互连。在子块之间,GPU 可以通过使用 RoCE 光纤网络的 RDMA NIC 进行连接。子块之间的主机通信以及存储等其他网络流量通过高速前端以太网 NIC 使用 Jupiter 网络结构。
  • cloud.google.com/gce-topology-host:虚拟机所在主机的组织专用 ID。主机或节点是数据中心内的单个物理服务器机器。每个 GKE 节点都预配在虚拟机实例上,而虚拟机实例又预配在物理主机上。
  • kubernetes.io/hostname:Kubernetes 节点的主机名。 此名称通常也是 GKE 节点名称。

查看 GKE 集群节点的物理拓扑

运行以下命令,获取具有特定加速器的 GKE 集群节点的节点标签:

kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \
    -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4

ACCELERATOR 替换为加速器的名称,例如 nvidia-h200-141gb

输出会显示每个具有指定加速器的 GKE 节点的块、子块和主机。

如需了解详情,请参阅查看预留的拓扑

后续步骤