이 문서에서는 A4X Max, A4X, A4, A3 Ultra, A3 Mega, A3 High Compute Engine 인스턴스에서 Google Kubernetes Engine (GKE) 노드의 물리적 토폴로지를 보는 방법을 보여줍니다. 노드의 물리적 위치를 파악하면 AI 워크로드의 포드 배치를 최적화하는 데 도움이 됩니다.
시작하기 전에
시작하기 전에 다음 태스크를 수행했는지 확인합니다.
- Google Kubernetes Engine API를 사용 설정합니다. Google Kubernetes Engine API 사용 설정
- 이 태스크에 Google Cloud CLI를 사용하려면
설치한 후
초기화합니다.
gcloud CLI를 이전에 gcloud CLI를 설치했으면 최신
버전을
gcloud components update명령어를 실행하여 가져옵니다. 이전 gcloud CLI 버전에서는 이 문서의 명령어를 실행하지 못할 수 있습니다.
클러스터에 연결
다음 명령을 실행하여 클러스터에 연결합니다.
gcloud container clusters get-credentials CLUSTER_NAMECLUSTER_NAME을 클러스터 이름으로 바꿉니다.
GKE 노드 토폴로지 이해
다음 노드 라벨을 참조하여 A4X Max, A4X, A4, A3 Ultra Compute Engine 인스턴스에서 GKE 노드의 물리적 토폴로지를 파악할 수 있습니다.
cloud.google.com/gce-topology-block: VM이 있는 예약된 블록의 조직별 ID입니다. 블록은 분산 네트워크 패브릭 계층으로 연결된 하위 블록의 모음입니다.cloud.google.com/gce-topology-subblock: VM이 있는 하위 블록의 조직별 ID입니다. 하위 블록은 호스트 그룹과 연결된 연결 하드웨어입니다.- A4 및 A3 Ultra VM의 경우 호스트는 대규모 분산 Jupiter 네트워크 패브릭을 통해 연결됩니다.
- A4X Max 및 A4X Compute Engine 인스턴스는 하위 블록으로 구성되며 각 하위 블록은 NVIDIA NVLink 도메인 (NVL72)을 구성합니다. 각 NVL72 내에서 GPU는 전용 고대역폭 NVLink 패브릭을 통해 긴밀하게 상호 연결됩니다. 하위 블록 간에 GPU는 RoCE 패브릭을 사용하여 RDMA NIC를 통해 연결할 수 있습니다. 하위 블록 간의 호스트 통신과 스토리지와 같은 기타 네트워크 트래픽은 고속 프런트엔드 이더넷 NIC를 통해 Jupiter 네트워크 패브릭 을 사용합니다.
cloud.google.com/gce-topology-host: VM이 있는 호스트의 조직별 ID입니다. 호스트 또는 노드는 데이터 센터의 단일 물리적 서버 머신입니다. 각 GKE 노드는 물리적 호스트 위에 프로비저닝된 VM 인스턴스에 프로비저닝됩니다.kubernetes.io/hostname: Kubernetes 노드의 호스트 이름입니다. 일반적으로 GKE 노드 이름이기도 합니다.
GKE 클러스터 노드의 물리적 토폴로지 보기
다음 명령어를 실행하여 특정 가속기가 있는 GKE 클러스터 노드의 노드 라벨을 가져옵니다.
kubectl get nodes -l cloud.google.com/gke-accelerator=ACCELERATOR \ -ocustom-columns='0-NAME:.metadata.name,0-BLOCK:.metadata.labels.cloud\.google\.com/gce-topology-block,0-SUBBLOCK:.metadata.labels.cloud\.google\.com/gce-topology-subblock,0-HOST:.metadata.labels.cloud\.google\.com/gce-topology-host'| sort -k2,4
ACCELERATOR를 가속기 이름(예: nvidia-h200-141gb)으로 바꿉니다.
출력에는 지정된 가속기가 있는 각 GKE 노드의 블록, 하위 블록, 호스트가 표시됩니다.
자세한 내용은 예약 토폴로지 보기를 참조하세요.
다음 단계
- 토폴로지 인식 예약을 사용하여 GKE 워크로드를 예약하는 방법을 알아봅니다.
- GKE 클러스터의 호스트 유지보수 이벤트, 클러스터 업그레이드, 결함이 있는 호스트 보고를 관리하는 방법을 알아봅니다.