このドキュメントでは、A4X Max、A4X、A4、A3 Ultra、A3 Mega、A3 High Compute Engine インスタンスで Google Kubernetes Engine(GKE)ノードの物理トポロジを表示する方法について説明します。ノードの物理的な位置を把握することで、AI ワークロードの Pod の配置を最適化できます。
始める前に
始める前に、次のタスクが完了していることを確認してください。
- Google Kubernetes Engine API を有効にする。 Google Kubernetes Engine API の有効化
- このタスクに Google Cloud CLI を使用する場合は、
インストールして
初期化する
gcloud CLI。gcloud CLI をインストール済みの場合は、最新の
バージョンを
gcloud components updateコマンドを実行して取得します。以前のバージョンの gcloud CLI では、このドキュメントのコマンドを実行できない場合があります。
クラスタに接続する
次のコマンドを実行して、クラスタに接続します。
gcloud container clusters get-credentials CLUSTER_NAMECLUSTER_NAMEは、使用するクラスタの名前に置き換えます。
GKE ノードのトポロジを理解する
A4X Max、A4X、A4、A3 Ultra Compute Engine インスタンスの GKE ノードの物理トポロジは、次のノードラベルを参照することで確認できます。
cloud.google.com/gce-topology-block: VM が配置されている予約済みブロックの組織固有の ID。 ブロックは、分散ネットワーク ファブリックのレイヤで接続されたサブブロックの集まりです。cloud.google.com/gce-topology-subblock: VM が配置されているサブブロックの組織固有の ID。-
サブブロックは、ホストと関連する接続ハードウェアのグループです。
- A4 VM と A3 Ultra VM の場合、ホストは大規模な分散 Jupiter ネットワーク ファブリックを介して接続されます。
- A4X Max と A4X Compute Engine インスタンスはサブブロックに編成され、それぞれが NVIDIA NVLink ドメイン(NVL72)を構成します。各 NVL72 内では、専用の高帯域幅 NVLink ファブリックを介して GPU が緊密に相互接続されます。サブブロック間で、GPU は RoCE ファブリックを使用して RDMA NIC を介して接続できます。 サブブロック間のホスト通信や、 ストレージなどの他のネットワーク トラフィックでは、高速フロントエンド イーサネット NIC を介して Jupiter ネットワーク ファブリック が使用されます。
cloud.google.com/gce-topology-host: VM が配置されているホストの組織固有の ID 。 ホストまたはノードは、データセンター内の単一の物理サーバーマシンです。各 GKE ノードは、物理ホスト上にプロビジョニングされた VM インスタンスにプロビジョニングされます。kubernetes.io/hostname: Kubernetes ノードのホスト名。 通常、これは GKE ノード名でもあります。
GKE クラスタ ノードの物理トポロジを表示する
次のコマンドを実行して、特定のアクセラレータを使用する GKE クラスタ ノードのノードラベルを取得します。
kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \ -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4
ACCELERATOR は、アクセラレータの名前(nvidia-h200-141gb など)に置き換えます。
出力には、指定したアクセラレータを使用する各 GKE ノードのブロック、サブブロック、ホストが表示されます。
詳細については、予約のトポロジを表示するをご覧ください。
次のステップ
- トポロジ認識スケジューリングを使用して GKE ワークロードをスケジュールする 方法を確認する。
- GKE クラスタのホスト メンテナンス イベント、クラスタのアップグレード、障害のあるホストのレポートを管理する方法を確認する